
< (왼쪽부터) 정상윤 박사과정(KAIST, MAD 및 DNA 연구 제1저자), 노용만 교수(KAIST, 교신 저자), 유영준 박사(KAIST, DNA연구 공동 제1저자) >
AI가 ‘안 들리는데 들린다’, ‘없는데 있다’고 우기는 시대가 끝난다. 우리 대학 연구진이 AI가 여러 감각 정보를 스스로 구분하고 존재하지 않는 정보를 만들어내는 ‘환각’을 줄이는 핵심 기술을 개발했다. 자율주행차와 로봇, 의료 AI 등 실제 산업 현장에서 더욱 신뢰할 수 있는 멀티모달 AI 구현의 기반이 될 것으로 기대된다.
우리 대학은 전기및전자공학부 노용만 교수 연구팀이 멀티모달 대형 언어모델(MLLM, 텍스트와 이미지·소리 등 여러 정보를 함께 이해하는 AI)의 감각 혼선을 줄이는 두 가지 핵심 기술을 개발했다고 31일 밝혔다. 이번 기술은 카메라와 다양한 센서의 특성을 정확히 이해하도록 하는 기술과 시각·청각 정보가 뒤섞이면서 발생하는 환각을 줄이는 기술로, 별도의 대규모 재학습 없이도 AI의 신뢰성을 크게 높였다.
연구팀이 개발한 첫 번째 기술은 AI가 열화상(Thermal, 물체가 내는 열을 영상으로 보여주는 센서), 깊이 영상(Depth, 물체까지의 거리를 측정하는 센서), 엑스레이(X-ray) 등 다양한 센서가 담고 있는 물리적 의미를 정확하게 이해하도록 돕는 ‘센서 이해 AI’기술(DNA, Diverse Negative Attributes) 최적화 기법이다.

< 연구팀이 개발한 DNA 최적화 기술이 적용된 모델 >
사람은 열화상 화면에서 밝게 보이는 부분이 ‘뜨거운 곳’이라는 것을 알지만, 기존 AI는 이를 일반 사진처럼 해석해 단순한 빛으로 착각하기도 했다. 연구팀은 AI가 열과 거리 등 센서가 측정하는 물리 정보를 이해하도록 새로운 학습 기술을 개발했다. AI가 자주 틀리는 사례를 반복적으로 학습하게 한 결과, 어둠이나 연기 속에서도 사물을 더욱 정확하게 인식할 수 있게 됐다.
두 번째 기술은 시각과 청각 정보가 서로 영향을 주면서 발생하는 환각을 줄이는 ‘감각 혼선 방지' 기술(MAD, Modality-Adaptive Decoding) 기술이다.
예를 들어 CCTV 영상에 자동차가 지나가는 장면이 담겨 있지만 실제로는 소리가 녹음되지 않았을 때, 기존 멀티모달 AI는 자동차가 보인다는 이유만으로‘엔진 소리가 들린다’고 답하는 경우가 있었다. 연구팀은 AI가 먼저 ‘이번 질문은 영상을 보고 판단해야 하는지, 소리를 듣고 판단해야 하는지’를 스스로 구분한 뒤, 더 중요한 감각 정보에 집중하도록 만들었다. 이를 통해 AI를 처음부터 다시 학습시키지 않고도(Training-free) 이러한 감각 혼선과 환각을 효과적으로 줄였다.
또한 연구팀은 AI를 막대한 컴퓨팅 자원으로 처음부터 다시 학습시키는 대신, DNA 기술은 적은 데이터만으로 다양한 센서를 이해하도록 성능을 높이고, ‘감각 혼선 방지' 기술(MAD)은 기존 AI에 프로그램을 추가하듯 바로 적용할 수 있도록 설계했다. 따라서 시간과 비용을 크게 줄이면서도 기존 멀티모달 AI의 신뢰성을 높일 수 있어 산업 현장에 빠르게 적용할 수 있다.
이번 기술은 밤이나 안개 속에서도 보행자와 차량을 정확히 인식해야 하는 자율주행차, 연기로 앞이 보이지 않는 화재 현장에서 생존자를 찾는 구조 로봇, 열화상 카메라를 이용하는 드론 등에 활용될 수 있다. 또한 공항 보안검색에서 엑스레이 영상을 분석하거나, 병원에서 CT·MRI·엑스레이 등 여러 의료영상을 함께 분석하는 AI의 정확성과 신뢰성을 높이는 데도 기여할 것으로 기대된다.

< 연구 이미지 (AI 생성) >
노용만 교수는 "멀티모달 AI가 실제 환경에서 사용되기 위해서는 다양한 센서의 특성을 정확히 이해하고 여러 감각 정보를 혼동하지 않는 것이 중요하다”며 "이번 연구는 대규모 재학습 없이도 AI의 감각 편향과 환각을 줄여 실제 생활과 산업 현장에서 믿고 사용할 수 있는 멀티모달 AI의 기반을 마련했다”고 말했다.
이번 성과는 KAIST 전기및전자공학부 정상윤 박사과정이 두 기술 연구 모두 제1 저자로 참여해 연속성을 빛냈으며, 유영준 박사가 ‘센서 이해 AI' 기술(DNA) 연구에 공동 제1 저자로 참여했다.
관련 논문 중 ‘감각 혼선 방지' 기술(MAD) 연구는 인공지능 컴퓨터 비전 분야 최고 권위 국제학회인 ‘국제 컴퓨터 비전 및 패턴인식 학술대회(CVPR)’에 지난 6월 발표되었다. 또한 ‘센서 이해 AI' 기술(DNA) 연구는 영상처리 분야 최고 국제 학술지인 ‘IEEE Transactions on Image Processing’에 게재가 되었다.
※ 논문명: Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking, DOI:10.48550/arXiv.2412.20750
※ 저자 정보: 정상윤 (KAIST, 공동 제1 저자), 유영준 (KAIST, 공동 제1 저자), 김세연 (KAIST, 제3 저자), 지영채 (KAIST, 제4 저자), 노용만(KAIST, 교신저자)
※ 논문명: MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models, DOI:10.48550/arXiv.2601.21181
※ 저자 정보: 정상윤 (KAIST, 제1 저자), 김세연 (KAIST, 제2 저자), 지영채 (KAIST, 제3 저자), 노용만(KAIST, 교신저자)
한편, 이번 연구는 정보통신기획평가원(IITP) 사람중심인공지능 핵심원천기술 개발사업과 국방과학연구소 인공지능 특화연구센터(CARAI) 과제 등의 지원을 받아 수행되었다.
“지난해 가장 많이 팔린 상품을 찾아줘.” AI가 회사 자료를 찾는 과정에서 존재하지 않는 항목을 잘못 사용하면 검색이 실패할 수 있다. 지금까지는 작은 오류 하나에도 검색 명령 전체를 다시 만들어야 했지만, 우리 대학 연구진이 틀린 부분만 찾아 바로잡는 기술을 개발했다. AI의 데이터 검색을 더 빠르고 정확하게 만들어 기업의 ‘AI 업무비서’ 활용을 앞당길 것으로 기대된다. 우리 대학은 전산학부 김민수 교수 연구팀이 사람의 일상적인 질문을 데이터베이스에서 원하는 정보를 찾는 컴퓨터 명령어인 SQL(Structured Query Language)로 바꾸는 과정에서 발생하는 오류를 찾아 수정하는 기술 ‘세이프큐엘(SafeQL)’을 개발했다고 4일 밝혔다. 최근에는 “지난해 매출이 가장 많이 늘어난 상품은?”, “재고가 부족한 상품은?”처럼 일상적인 말로 질문하면 AI가
2026-09-04우리 대학이 세계적인 연구기관인 미국 캘리포니아공과대학교(California Institute of Technology, 이하 ‘Caltech’)와 공동연구를 넘어 차세대 연구자까지 함께 키우는 새로운 글로벌 협력 모델을 구축한다. 우리 대학은 9월 1일부터 2일까지 Caltech과 ‘제1회 KAIST-Caltech 분자과학 및 화학혁신 공동 워크숍(1st KAIST-Caltech Joint Workshop on Molecular Science and Chemical Innovation)’을 개최한다고 2일 밝혔다. 이번 워크숍은 양 기관이 첨단 분자과학과 미래 화학기술 분야의 연구성과를 공유하는 데 그치지 않고, 공동연구와 인재양성, 연구시설 활용까지 연결하는 지속 가능한 협력체계를 구축하기 위해 마련됐다. 특히 KAIST와 Caltech 교수가 박사후연구원(Postdoctoral Researcher)을 함께 선발하고 지도하는
2026-09-02“이 단백질에 잘 결합하는 신약 후보를 설계해줘.” 연구자가 AI에게 이렇게 요청하면 AI가 단백질의 3차원 구조를 예측하고, 어떤 물질이 잘 결합할지 분석해 유망한 신약 후보를 설계한다. 우리 대학 연구진이 세계에서 가장 빠르게 단백질 구조 예측을 수행하는 바이오 AI 모델 ‘K-Fold(케이폴드)’를 국내 독자 기술로 개발했다. 우리 대학은 과학기술정보통신부 ‘AI 특화 파운데이션 모델 프로젝트’의 주관기관으로 ‘팀 KAIST’를 구성하고, 차세대 바이오 AI 모델 ‘K-Fold’를 공개했다고 28일 밝혔다. ‘팀 KAIST’는 화학과 김우연 교수가 연구를 총괄하고, 김우연 교수 그룹과 김재철AI대학원 황성주·안성수 교수 그룹 연구원들이 AI 모델 개발을, 생명과학과 오병하·김호민·이규리 교수가 단백질
2026-08-28AI가 똑똑해질수록 더 많은 데이터를 빠르게 처리할 수 있는 ‘고성능 메모리’가 필요하다. 하지만 기존처럼 반도체를 계속 작게 만드는 데는 한계가 있다. 우리 대학 연구진이 반도체를 위로 쌓는 3차원 구조의 약점까지 해결하면서, AI 반도체의 성능은 높이고 전력 소모는 낮출 새로운 길을 열었다. 우리 대학은 전기및전자공학부 권지민 교수 연구팀이 UNIST(총장 박종래), 연세대학교(총장 윤동섭) 등 국내 연구진과 공동으로 차세대 메모리 소자인 산화물 수직 채널 트랜지스터(Vertical Channel Transistor, VCT)의 결함을 줄이고 성능과 안정성을 크게 높일 수 있는 새로운 다층 층간 절연막 구조를 개발했다고 20일 밝혔다. 컴퓨터의 주기억장치로 사용되는 DRAM은 컴퓨터가 작업 중인 데이터를 임시로 저장해 빠르게 꺼내 쓸 수 있도록 하는 메모리다. 지난 수십 년간 DRAM은 반도체 소자의 크기를 줄여 같은 면적에 더 많은 데이터를 저장
2026-08-20우리 대학은 KAIST와 국가AI연구거점이 공동으로 제프 딘(Jeff Dean) 디스커버리 루프(Discovery Loop) 공동 창업자 겸 CEO를 초청해 13일 서울 AI 허브에서 특별강연을 개최했다고 18일 밝혔다. 제프 딘은 1999년 구글 초기 멤버로 합류해 27년간 검색 인프라의 근간인 맵리듀스(MapReduce)와 빅테이블(Bigtable), AI 시대의 핵심 기반인 텐서플로우(TensorFlow)와 TPU 개발을 이끌었고, 구글 브레인을 공동 설립한 뒤 수석과학자로서 제미나이(Gemini) 개발을 총괄해 '구글의 전설'로 불리는 인물이다. 그는 최근 산제이 게마왓(Sanjay Ghemawat), 쿽 레(Quoc Le), 오리올 비냘스(Oriol Vinyals)와 함께 디스커버리 루프를 창업했다. 가설 수립부터 실험 실행과 결과 분석에 이르는 연구의 반복 과정을 AI로 자동화해, 과학·공학 발견의 속도 자체를 끌어올리겠다는 구상이다. 우리 대학은 이
2026-08-18