-
투명한 유리도 보고 미래도 예측하는 ‘피지컬 AI’ 핵심기술 개발
인공지능(AI)이 화면 속 정보를 분석하는 기술을 넘어, 현실 세계의 물리적 특성을 이해하고 스스로 판단·행동하는 단계로 진화하고 있다. 우리 대학 연구진은 빛과 물질의 상호작용, 공간 인식, 미래 상황 예측, 행동 계획을 아우르는 피지컬 AI(Physical AI·물리 기반 인공지능) 핵심 기술을 개발했다. 이번 성과는 자율주행차와 휴머노이드 로봇, 산업용 로봇, 디지털 트윈 등 실제 환경에서 작동하는 차세대 자율 시스템 구현을 앞당길 것으로 기대된다.
우리 대학은 전산학부 윤성의 교수 연구팀이 ▲유리나 물처럼 투명한 물체를 정확히 인식하는 기술 ▲빛과 물질의 상호작용을 분석해 주변 환경을 이해하는 기술 ▲사진 한 장만으로 로봇이 목적지를 찾아가는 기술 ▲미래 상황을 예측해 행동을 계획하는 기술을 개발했다고 6일 밝혔다.
이번 연구는 시각 인식부터 물리적 이해, 미래 예측, 행동 계획까지 하나의 기술 흐름으로 연결했다는 점에서 의미가 크다. 이를 통해 AI가 '보고(인식) → 이해하고(물리 이해) → 예측하고(미래 예측) → 행동하는(계획)' 전 과정을 수행하는 기반을 제시했으며, 다양한 자율 시스템의 성능과 활용 범위를 한층 넓힐 것으로 기대된다.
이번 연구 성과는 세계 최고 권위의 AI 학회인 ICLR 2026(International Conference on Learning Representations)과 CVPR 2026(Conference on Computer Vision and Pattern Recognition)에서 구두 발표 2편과 하이라이트 논문 2편 등 총 4편의 논문으로 발표됐다. 특히 ICLR과 CVPR의 구두 발표는 각각 약 1.13%, 0.8%만 선정되는 최상위 발표 형식으로, 연구의 독창성과 우수성을 국제적으로 인정받았다.
▲ 유리까지 이해하는 AI… 투명한 물체도 정확히 인식
연구팀은 글린트(GLINT, 투명 환경 시각 인식 기술)를 개발해 AI가 유리와 같은 투명한 물체도 정확하게 인식할 수 있도록 했다.
사람은 유리창을 볼 때 유리에 비친 모습과 유리 너머의 풍경을 자연스럽게 구분한다. 하지만 기존 AI는 두 정보를 하나의 영상으로 인식해 투명한 물체를 제대로 이해하지 못하는 경우가 많았다.
연구팀은 유리에 반사된 모습과 유리 뒤의 물체를 각각 분리해 분석하는 새로운 기술을 개발함으로써 AI가 투명한 환경에서도 장면을 정확하게 이해할 수 있도록 했다.
※ 논문 정보 : GLINT: Modeling Scene-Scale Transparency via Gaussian Radiance Transport, 논문 원본: https://arxiv.org/abs/2603.26181 (CVPR 2026 Oral, 6월 5일 구두 발표, Award Candidate(4천여 편 발표 논문 가운데 74편 선정)
▲ 빛의 움직임까지 이해하는 AI
연구팀은 라디오GS(RadioGS, 빛과 재질을 이해하는 장면 복원 기술)를 개발해 빛이 물체에 닿아 반사되고 퍼지는 과정까지 AI가 이해하도록 했다.
같은 물체라도 햇빛 아래와 실내 조명 아래에서는 다르게 보인다. 기존 AI는 이러한 조명 변화에 영향을 받기 쉬웠다. 연구팀은 빛과 물체의 상호작용을 AI가 학습하도록 만들어 조명이 달라져도 물체의 재질과 주변 환경을 더욱 정확하게 이해할 수 있도록 했다.
※ 논문 정보 : Radiometrically Consistent Gaussian Surfels for Inverse Rendering, 논문 원본: https://arxiv.org/abs/2603.01491 (ICLR 2026 Oral, 4월 23일 구두 발표)
▲ 사진 한 장만 보고 목적지를 찾아가는 로봇
연구팀은 비주얼-RRT(Visual-RRT, 이미지 기반 로봇 경로 계획 기술)를 개발해 시각 정보를 실제 행동으로 연결했다. 기존 로봇은 목적지의 좌표 정보가 필요했지만, 이번 기술은 현재 로봇이 보는 장면과 목표 사진을 비교하며 스스로 이동 경로를 찾아간다.
실제 로봇 실험에서도 사진 한 장만으로 목적지에 성공적으로 도달해 서비스 로봇과 자율주행 로봇 등 다양한 분야에 활용될 가능성을 확인했다.
※ 논문 정보: Visual-RRT: Finding Paths toward Visual-Goals via Differentiable Rendering, 논문원본: https://arxiv.org/abs/2604.16388 (CVPR 2026 Highlight) 3월 27일 하이라이트 논문 선정
※ 동영상: https://www.youtube.com/watch?v=nAPk27vHwEE
▲ 미래를 예측하고 스스로 행동을 계획하는 AI
연구팀은 클래드(CLaD, 미래 예측 기반 행동 계획 기술)를 개발해 AI가 행동하기 전에 미래 상황을 예측하고 가장 적절한 행동을 계획하도록 했다.
사람은 행동하기 전에 "이렇게 움직이면 다음에는 어떤 일이 생길까?"를 먼저 생각한다. 클래드는 AI도 이처럼 행동의 결과를 미리 예측한 뒤 가장 효과적인 행동을 선택하도록 만든 기술이다. 이를 통해 복잡한 환경에서도 높은 성공률로 작업을 수행할 수 있어 차세대 자율 로봇의 핵심 기술로 활용될 것으로 기대된다.
※ 논문 정보 : CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics, 논문원본: https://arxiv.org/abs/2603.29409(CVPR 2026 Highlight)
윤성의 교수는 "이번 연구는 AI가 단순히 눈으로 보는 것을 넘어 현실 세계를 이해하고 앞으로 일어날 상황까지 예측해 스스로 행동을 결정하는 방향으로 발전하고 있음을 보여준다"며 "이번 성과가 자율주행차와 휴머노이드 로봇 등 실제 환경에서 작동하는 다양한 피지컬 AI 기술의 발전에 기여하기를 기대한다"고 말했다.
윤성의 교수가 교신저자로 참여한 이번 연구들은 과학기술정보통신부와 정보통신기획평가원(IITP), 한국연구재단(NRF)의 지원을 받아 수행 중인 피지컬 AI 및 지능형 로봇 연구과제의 일환으로 수행됐다.
2026.07.06
조회수 1438
-
적은 메모리로도 휴머노이드 로봇의 눈 밝힌다
스마트폰의 안면 인식부터 휴머노이드 로봇까지, 인공지능(AI)의 눈 역할을 하는 컴퓨터 비전 기술은 우리 일상에 널리 활용되고 있다. 우리 대학과 국제 공동연구진은 적은 메모리만으로도 AI가 세상을 더욱 선명하게 볼 수 있는 기술을 개발해 GPU(그래픽처리장치) 메모리 효율을 최대 16배 높였다. 이번 성과는 휴머노이드 로봇과 온디바이스 AI 시대를 앞당길 핵심 기술로 평가된다.
우리 대학은 전기및전자공학부 김창익 교수 연구팀이 미국 MIT 및 마이크로소프트 연구진과의 공동 연구를 통해, 제한된 GPU 메모리만으로도 AI의 시각 성능을 높일 수 있는 범용 기술 ‘업샘플 애니띵(Upsample Anything)’을 개발했다고 17일 밝혔다.
이번 성과는 인공지능 및 컴퓨터 비전 분야 세계 최고 권위 학회인 ‘CVPR 2026’ 논문 채택에 이어, 계산 자원의 효율적 활용을 인정받아 전체 1위인‘CVPR 컴퓨트 골드 스타(CVPR Compute Gold Star)’를 수상하고, 연구 과정의 투명성과 재현 가능성 부문 ‘트랜스패런시 챔피언(Transparency Champion)’에 선정됐다. 이는 연구 성능은 물론 사용된 계산 자원, 코드 공개, 실험 재현 가능성 등 책임 있는 인공지능 연구의 핵심 요소를 두루 인정받은 성과다.
최근 휴머노이드 로봇과 자율주행 시스템, 세계모델(World Model·현실 세계의 물리적 환경과 변화를 학습·예측하는 AI 모델) 기반 인공지능은 연산 속도를 높이고 메모리 사용량을 줄이기 위해 입력 영상을 저해상도 특징 정보(Feature·AI가 이미지에서 추출한 핵심 정보)로 압축해 활용하고 있다.
그러나 압축 과정에서 작은 물체나 얇은 구조물, 미세한 결함과 같은 중요한 시각 정보가 손실되는 문제가 발생한다. 반대로 모든 영상을 처음부터 고해상도로 처리하면 막대한 GPU 메모리와 연산 자원이 필요해 실시간 처리가 어려워진다. 이는 스마트폰과 같은 소형 기기나 기동성이 중요한 로봇이 주변 환경을 정밀하게 인식해야 하는 상황에서 오랫동안 해결되지 않은 과제로 남아 있었다.
연구팀은 이러한 한계를 극복하기 위해 입력 이미지의 경계와 구조 정보를 활용해 저해상도 특징 정보를 고해상도로 복원하는 학습 없는(Training-free·추가 데이터 학습이 필요 없는) 업샘플링 기술을 개발했다.
기존 기술은 새로운 환경이나 데이터에 적용하기 위해 별도의 재학습이나 복잡한 최적화 과정을 거쳐야 했다. 반면 연구팀이 개발한 ‘업샘플 애니띵’은 입력 이미지 한 장만으로 최적의 복원 방식을 찾아낼 수 있어 다양한 환경에 즉시 적용할 수 있다.
또한 모든 시각 정보를 고해상도로 저장·처리하지 않고 핵심 정보만 압축해 활용함으로써 GPU 메모리 사용량을 크게 줄였다. 연구팀은 AI 연구에서 널리 활용되는 224×224 크기 이미지(약 5만 개 픽셀) 기준 약 0.4초의 짧은 계산만으로 원본에 가까운 시각 정보를 복원했으며, GPU 메모리 효율을 최대 16배까지 향상시키는 성과를 거뒀다.
이는 제한된 연산 자원만으로도 인공지능이 주변 환경을 더욱 정밀하게 인식할 수 있음을 의미한다. 따라서 이번 기술은 스마트폰과 같은 소형 기기는 물론, 작은 물체를 정확하게 식별하고 조작해야 하는 휴머노이드 로봇, 자율주행 시스템, 온디바이스 AI 등 다양한 차세대 인공지능 분야에 폭넓게 활용될 것으로 기대된다.
김창익 교수는 “이번 기술은 적은 자원으로도 인공지능의 시각 정밀도를 크게 높일 수 있는 알고리즘으로, 휴머노이드 로봇과 온디바이스 AI의 실용화를 앞당길 것으로 기대한다”며 “CVPR에서 성능뿐 아니라 계산 효율성과 연구 투명성까지 인정받았다는 점에서 더욱 의미가 크다”고 말했다.
이번 연구는 KAIST 서민석 박사과정 학생이 제1 저자로 참여했으며, 이번 성과는 인공지능 및 컴퓨터 비전 분야 세계 최고 권위 학회인 ‘CVPR 2026’에서 6월 7일 발표됐다.
※ 논문명: Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling, DOI:10.48550/arXiv.2511.16301
※ 저자 정보: 서민석 (KAIST, 제1 저자), 마크 헤밀턴 (MIT, 마이크로소프트, 제2 저자), 김창익(KAIST, 교신저자)
※ 관련 데모 동영상: https://drive.google.com/file/d/17f9j4tcD0JJfA4xeN4b5qvaOjUxFVS_U/view?usp=sharing
2026.06.17
조회수 8882
-
‘쥬라기 공원’ 공룡이 실제 걸어오는 듯한 소리 자동 구현 AI 기술 개발
영화 ‘쥬라기 공원’에서 거대한 공룡이 걸어오는 장면을 보면 사람들은 자연스럽게 땅이 울리는 듯한 묵직한 저주파음을 떠올린다. 이는 인간이 단순히 사물의 형태뿐 아니라 크기와 무게, 움직임의 속도 같은 물리적 특성까지 함께 고려해 소리를 예측하기 때문이다. 하지만 기존 영상-음향 생성 AI는 화면 속 사물의 형태나 장면 정보에 주로 의존해 소리를 생성해, 무게나 속도에 따라 달라지는 물리적 특성까지는 충분히 반영하지 못했다.
우리 대학은 전산학부 오태현 교수 연구팀이 POSTECH(총장 김성근), 소니 AI(Sony AI) 공동 연구진과 함께 영상 속 물리적 상황을 이해해 보다 현실감 있는 소리를 생성하는 인공지능(AI) 기술 ‘파바스(PAVAS·Physics-Aware Video-to-Audio Synthesis)’를 개발했다고 26일 밝혔다.
이번 기술의 핵심은 영상 속 물체의 질량과 속도 등 눈에 보이지 않는 물리 정보를 AI가 스스로 추론하도록 설계됐다는 점이다. 일반적인 영상에는 물체의 정확한 무게나 속도가 숫자로 제시되지 않지만, 연구팀은 AI가 주변 환경과 움직임의 맥락을 분석해 이를 추정하고, 그 결과를 소리 생성 과정에 반영하도록 했다.
즉, 단순히 ‘무엇이 보이는지’를 인식하는 수준을 넘어, ‘왜 이런 소리가 발생해야 하는지’에 대한 물리적 원인까지 AI가 이해하도록 만든 것이다.
기술 검증 결과, 연구팀의 AI는 물체 간 충돌이나 타격 등 물리적 상호작용이 발생하는 장면에서 실제 환경과 매우 유사한 소리를 생성했다. 특히 물체의 질량과 속도가 달라질 때 소리의 크기와 음색도 자연스럽게 변화하는 등 보다 현실감 있는 음향을 구현했다.
최근에는 영상과 오디오를 동시에 생성하는 생성형 AI 기술이 빠르게 발전하고 있다. 대표적으로 구글의 ‘비오(Veo) 3’, 바이트댄스의 ‘시댄스(Seedance) 2.0’ 등이 있다. 그러나 실제 영화·광고·게임 제작 현장에서는 새로운 영상을 생성하는 것보다 기존 영상에 장면에 맞는 효과음을 추가하거나 음향을 보완하는 후반 작업 수요가 훨씬 크다.
기존 상용 AI 모델들이 영상과 오디오를 함께 생성하는 데 집중했다면, 파바스는 영상 속 객체의 움직임과 충돌 특성을 분석해 장면과 정밀하게 맞아떨어지는 현실적인 효과음을 생성한다는 점에서 차별성을 가진다.
연구팀은 이번 기술이 ‘물리적으로 일관된 생성 AI(Physical AI)’ 분야의 새로운 가능성을 제시했다고 설명했다. 물리적으로 일관된 생성 AI는 단순히 그럴듯한 결과를 만드는 수준을 넘어, 현실 세계의 물리 법칙과 인과관계까지 이해하는 AI를 의미한다.
향후 이 기술은 콘텐츠 음향 제작 자동화는 물론, 증강현실(AR)·가상현실(VR) 콘텐츠, 메타버스, 로보틱스 시뮬레이션 등 다양한 분야에서 더욱 몰입감 있는 사용자 경험을 제공할 수 있을 것으로 기대된다.
오태현 교수는 “기존 생성 AI가 데이터와 모델 규모를 키우는 방식으로 발전해 왔다면, 이번 연구는 AI가 물리량과 인과관계를 직접 이해하도록 설계했다는 점에서 의미가 있다”며 “향후 텍스트·영상·음성 등 다양한 정보를 동시에 이해하고 처리하는 차세대 멀티모달 AI의 핵심 기반 기술로 확장될 수 있을 것”이라고 말했다.
이번 연구에는 POSTECH 오현빈 통합과정 학생이 제1저자로 참여했으며, KAIST 오태현 교수와 소니 AI의 타키다 유타(Yuta Takida), 토시미츠 우에사카(Toshimitsu Uesaka), 미츠후지 유키(Yuki Mitsufuji) 연구원이 공동 저자로 참여했다. 이번 연구는 컴퓨터 비전(영상 기반 인공지능 기술) 분야 세계 최고 권위 학술대회인 ‘CVPR 2026(Computer Vision and Pattern Recognition 2026)’에서 전체 논문 중 상위 1% 이내만 선정되는 오랄(Oral) 발표 논문으로 채택돼 연구의 우수성을 인정받았다. 발표는 오는 6월 6일 진행될 예정이다.
※ 논문명 : PAVAS: Physics-Aware Video-to-Audio Synthesis, DOI: https://arxiv.org/abs/2512.08282
또한 이번 연구는 과학기술정보통신부 기초연구사업 중견연구, 미래창조과학부 미래유망융합기술 파이오니어사업, 과학기술정보통신부 AGI 사업, KAIST 이노코어(InnoCORE) 사업의 지원을 받아 수행됐다.
2026.05.27
조회수 1974
-
기계공학과 윤국진 교수 연구팀, 세계 최고 권위 ‘CVPR 2026’ 논문 10편 채택,글로벌 AI 연구 선도
우리 대학 기계공학과 윤국진 교수 연구팀이 세계적인 컴퓨터 비전 학술대회인 IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026(CVPR 2026)에서 주저자로 총 10편의 논문을 채택시키며, 연구팀의 압도적인 학술적 역량을 다시금 증명했다.
CVPR은 인공지능과 시각 지능 분야에서 가장 큰 영향력을 가진 국제 학술 대회로, 1983년 시작된 이래 매년 엄격한 심사를 거쳐 우수 논문을 선정한다. 올해 CVPR 2026에는 전 세계에서 총 16,092편의 논문이 제출되었으며, 그중 4,090편이 채택되어 약 25.42%의 낮은 채택률을 기록하였다. 단일 연구실에서 주저자/교신저자로 10편의 논문이 동시에 채택되는 것은 국제적으로 매우 독보적인 성과로 평가받는다.
윤국진 교수 연구팀은 인간 수준의 시각 지능 구현을 목표로 폭넓은 연구를 수행하고 있다. 이번에 채택된 논문들은 이벤트 카메라 기반 기술, 자율주행 인지 기술, 그리고 AI 효율화 및 적응 기술 등 컴퓨터 비전 분야의 최첨단 주제들을 다루고 있다.
연구팀은 이미 지난해 ICCV 2025에서도 주저자/교신저자로 12편의 논문을 발표하여 독보적인 연구 역량을 인정받은 바 있다. 이번 CVPR 2026의 성과는 연구팀이 글로벌 컴퓨터 비전 연구를 선도하는 핵심 거점임을 다시 한번 확고히 하는 계기가 되었다. 연구팀은 앞으로도 기존 기술의 한계를 뛰어넘는 도전적인 연구를 통해 미래 AI 기술 발전에 기여할 계획이다.
한편, 이번 CVPR 2026은 오는 6월 3일부터 7일까지 미국 콜로라도주 덴버에서 개최될 예정이다.
2026.03.06
조회수 4059
-
전산학부 구주일 박사과정 학생, 삼성전자 DS부문 산학협력 교류회 최우수논문상 수상
우리 대학 전산학부 구주일(지도교수: 성민혁) 박사과정 학생은 지난 8월 29일 삼성전자 DS부문 산학협력 교류회에서 최우수 논문상을 수상했다. 해당 시상식은 매년 삼성전자와 국내 주요 대학 간 산학협력 성과를 공유하고, 반도체, 인공지능, 바이오, 생명화학공학, 로봇공학 등 다양한 첨단 분야에서 혁신적인 연구를 수행한 연구자들을 격려하기 위해 열린다.
구주일 학생이 최우수 논문상으로 수상한 “Posterior Distillation Sampling” 논문은 세계 최고 권위의 컴퓨터 비전 학회인 Conference on Computer Vision and Pattern Recognition (CVPR 2024)에 게재되었으며, 해당 학회에서 열린 6개의 워크숍에서도 우수성을 인정받아 발표되었다.
본 연구는 텍스트 기반 2D 이미지 생성 모델을 활용해 3D 데이터 (NeRF, 3D Gaussian Splatting)와 벡터기반이미지(SVG) 같은 다양한 비주얼 컨텐츠를 텍스트만으로 변형할 수 있는 새로운 방법론을 제시한다. 해당 방법론은 픽셀기반의 이미지만 변형이 가능하던 기존 방법론들의 한계를 벗어나, 사용자가 텍스트 입력만으로 다양한 비주얼 컨텐츠를 유연하게 변형할 수 있는 가능성을 연다. 이러한 기술을 통해 메타버스와 같은 차세대 컨텐츠 플랫폼에서 컨텐츠 제작 및 변형의 효율성을 크게 향상시킬 수 있을 것으로 기대된다.
수상 논문 5분 설명 영상: https://www.youtube.com/watch?v=GNqJYk949pY
2024.11.29
조회수 7160
-
기계공학과 윤국진 교수 연구팀, CVPR 2024에 9편 논문 발표하며 세계적 성과 달성
우리 대학 기계공학과 윤국진 교수 연구팀이 컴퓨터비전 및 패턴인식 국제학술대회인 CVPR 2024(IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024)에서 구두 발표 논문 1편과 하이라이트 논문 1편을 비롯한 9편의 논문을 발표하여, 컴퓨터비전 분야에서 세계적인 연구 성과를 인정받았다.
1983년부터 개최된 CVPR 학술대회는 매년 열리는 컴퓨터비전과 패턴인식 분야의 최고 권위의 학술 대회로, 구글 Scholar에 따르면 CVPR은 H5-색인 422를 기록하여 공학 및 컴퓨터과학 (Engineering & Computer Science) 전분야에서 1위를 차지한 학술대회이다.
CVPR 2024는 지난 2024년 6월 17일부터 21일까지 미국 시애틀 컨벤션 센터에서 개최되었는데, 올해는 11,532편의 논문이 제출되었고, 그 중 총 2,719편의 논문이 채택되어 23.6%의 채택율을 기록하였다. 특히, 324편의 논문은 하이라이트 논문으로 선정되어 2.81%의 채택율을 기록하였고, 90편의 논문은 구두 발표 논문으로 선정되어 0.78%의 채택율을 기록할 정도로 낮은 채택율을 기록하였다.
윤국진 교수 연구팀은 컴퓨터비전 분야 중에서도 특히 3차원 객체인식, 인체 자세 예측, 비디오 품질 개선, 다중 작업 최적화, 에이전트 경로 예측, 약지도 의미론적 분할 등 최근 많은 주목을 받고 있는 주제에 대해 9편의 논문을 발표하여 학계는 물론 산업계의 주목을 받았다.
특히, 발표된 논문들 중 권혁준 박사과정의 논문은 전체 논문 중 상위 0.78%에 해당하는 구두 발표 논문으로 선정되었으며, 정재우 박사과정과 박대희 박사과정의 논문은전체 논문 중 상위 2.81%에 해당하는 하이라이트 논문 선정되어, 윤국진 교수 연구팀의 연구가 컴퓨터비전 분야에서 매우 높은 학문적 가치를 지닌 것으로 평가받았음을 보여주었다. 또한 윤국진 교수 연구팀의 이번 성과는 단일 연구실에서 다수의 논문이 동일 학회에 채택되는 것이 매우 드문 일임을 고려할 때 더욱 의미있는 성과로 주목 받았다.
윤국진 교수 연구팀의 뛰어난 연구 성과는 인공지능과 컴퓨터비전 분야에서 향후 유사한 연구 분야에서의 새로운 기술 개발과 학문적 발전에 큰 기여를 할 것으로 기대된다. 윤국진 교수 연구팀은 이번 성과를 발판 삼아 앞으로도 컴퓨터 비전의 다양한 연구 주제들을 다뤄가며, 학계에 잔존하는 문제들을 해결하고자 한다.
2024.07.04
조회수 9338
-
세계 최고 수준의 이벤트 카메라 기반 비디오 보간 기술 개발
비디오 보간은 비디오 사이의 새로운 프레임을 생성하여 프레임률을 높이고 비디오 내 부드러운 모션을 구현하는 기술이다. 전 세계적으로 많은 연구진이 RGB 카메라만을 사용하여 비디오 보간을 수행하였다. 하지만, 프레임 사이의 움직임 정보의 부재로 인하여 복잡한 상황에서 비디오 보간 성능의 한계를 지닌다. 특히, 현실적인 상황에서 발생하는 비선형적인 움직임에 대해서는 비디오 보간 성능이 크게 하락하는 문제점이 존재한다.
우리 대학 기계공학과 윤국진 교수팀은 인간의 시신경을 모방한 이벤트 카메라와 RGB 카메라를 동시에 사용할 수 있는 하이브리드 카메라 시스템을 구축하고 세계 최고 수준의 이벤트 카메라 기반 초고속 비디오 보간 기술을 개발했다. 본 연구는 기존의 비디오 보간 방법 대비 35% 이상의 세계 최고 성능을 달성하였고, 복잡하고 극심한 움직임 속에서도 높은 성능으로 30FPS 비디오를 10000FPS 이상의 초고속 비디오로 합성할 수 있다.
이벤트 카메라는 인간의 시신경을 모방한 카메라로서, 영상의 밝기 변화만을 감지한다. 이러한 특성으로 인하여 이벤트 카메라는 micro 초 단위의 시간 해상도와 높은 dynamic range의 정보를 제공하여 기존의 RGB 카메라가 가지지 못하는 장점을 가지고 있다. 따라서, 이벤트 카메라는 RGB video 프레임 사이의 정확한 움직임 정보를 포착할 수 있어 일반 RGB 카메라와 이벤트 카메라를 동시적으로 사용하면 정확도 높은 초고속 비디오를 생성할 수 있다.
기존의 이벤트 카메라 기반 비디오 보간 연구는 이벤트 카메라에서 나오는 이벤트 정보만을 사용하여 프레임 사이의 광학 흐름을 추정하거나 프레임 사이의 움직임을 근사하는 방법을 사용하였다. 하지만, 이벤트 정보는 공간적으로 희박하고 밝기 정보만을 기록하기 때문에 이벤트만을 사용한 광학 흐름 추정 방법의 결과가 좋지 못한 점을 연구팀은 주목했다. 이를 극복하기 위해 연구팀은 기존의 RGB 이미지와 이벤트 정보를 동시적으로 사용하는 이미지-이벤트 비대칭 양방향 움직임 추정 기법을 제안하였다. 이벤트는 풍부한 움직임의 궤적정보를 제공하는 장점과 이미지의 풍부한 시각 정보의 각 장점을 잘 융합하여 서로 다른 정보의 장단점을 보완 및 융합한 광학 흐름 추정 방법을 제안하여 그 우수성을 입증하였다.
또한, 설계 및 제작한 빔 스플리터 기반 이벤트-RGB 하이브리드 카메라 시스템을 사용하여 이벤트 카메라를 이용한 모션-기반 비디오 보간 기술 데이터셋을 구축하였다. 기존의 이벤트 카메라를 이용한 비디오 보간 데이터셋의 경우, 카메라 움직임이 존재하지 않는 문제와 낮은 프레임 레이트/해상도로 인하여 딥러닝 알고리즘의 학습 및 이벤트 카메라 기반 비디오 보간 기술 개발 및 평가에 한계점을 지닌다. 제안된 데이터셋의 경우 이벤트 카메라 기반 비디오 향상 연구 커뮤니티에 큰 기여를 할 수 있을 것으로 예상된다.
이번 연구는 고품질의 높은 프레임률을 가지는 비디오 생성이 가능하여, 기존의 초고속 카메라로 비디오 촬영이 어려운 광량이 부족한 환경 및 아주 빠른 물체의 움직임을 분석이 필요한 여러 상황 등에서 널리 사용될 수 있을 것으로 기대된다.
이번 연구는 윤국진 교수 연구실의 김태우 박사과정(제1 저자), 채유정 박사과정(제2 저자), 장현걸 석사과정(제3 저자)이 참여하였고, 올해 캐나다 밴쿠버에서 6월 18일에 열릴 컴퓨터 비전 및 패턴인식 분야의 국제 저명학술지인 CVPR 2023(IEEE Conference on Computer Vision and Pattern Recognition)에 highlight 논문(2.5% acceptance rate)으로 게재될 예정이다.
이 연구는 중견 연구자개발 과제의 지원을 받아 수행되었다. 윤국진 교수 연구팀은 다년간 이벤트 카메라에 관련된 연구를 수행해오면서 이벤트 카메라를 이용한 여러 가지 컴퓨터 비전 분야에 핵심 연구 들을 수행하여 오고 있으며, 앞으로도 이벤트 카메라 연구 커뮤니티에 이바지하기 위하여 지속적인 연구를 수행할 예정이다.
※ 논문명 : Event-based Video Frame Interpolation with Cross-Modal Asymmetric Bidirectional Motion Fields
※ 저자 정보 : 윤국진 (KAIST, 교신저자), 김태우(KAIST, 제1 저자), 채유정(KAIST, 제2 저자), 장현걸(KAIST, 제3 저자) - 총 4명
2023.04.05
조회수 10166
-
딥러닝 생성모델의 오류 수정 기술 개발
우리 대학 AI대학원 최재식 교수(설명가능 인공지능연구센터장) 연구팀이 심층 학습(이하 딥러닝) 생성모델의 오류 수정 기술을 개발했다고 25일 밝혔다.
최근 딥러닝 생성모델(Deep Generative Models)은 이미지, 음성뿐만 아니라 문장 등 새로운 콘텐츠를 생성하는 데 널리 활용되고 있다. 이런 생성모델의 발전에도 불구하고 최근 개발된 생성모델도 여전히 결함이 있는 결과를 만드는 경우가 많아, 국방, 의료, 제조 등 중요한 작업 및 학습에 생성모델을 활용하기는 어려운 점이 있었다.
최 교수 연구팀은 딥러닝 내부를 해석하는 설명가능 인공지능 기법을 활용해, 생성모델 내부에서 이미지 생성과정에서 문제를 일으키는 유닛(뉴런)을 찾아 제거하는 알고리즘을 고안해 생성모델의 오류를 수리했다. 이러한 생성 오류 수리 기술은 신경망 모델의 재학습을 요구하지 않으며 모델 구조에 대한 의존성이 적어, 다양한 적대적 생성 신경망에 폭넓게 응용 및 적용될 수 있을 것으로 기대된다. 또한, 고안된 기술은 딥러닝 생성모델의 신뢰도를 향상해 생성모델이 중요 작업에도 적용될 수 있을 것으로 기대된다.
AI대학원의 알리 투씨(Ali Tousi), 정해동 연구원이 공동 제1 저자로 참여한 이번 연구는 `국제 컴퓨터 비전 및 패턴인식 학술대회 (IEEE Conference on Computer Vision and Pattern Recognition, CVPR)'에서 6월 23일 발표됐다. (논문명: Automatic Correction of Internal Units in Generative Neural Networks, CVPR 2021).
적대적 생성 신경망은 생성기와 구분기의 적대적 관계를 이용한 모델로서, 생성 이미지의 품질이 높고 다양성이 높아, 이미지 생성뿐만 아니라 다양한 분야(예, 시계열 데이터 생성)에서 주목받고 있다.
딥러닝 생성모델의 성능을 향상하기 위해서 적대적 생성기법 및 생성기의 새로운 구조 설계 혹은 학습 전략의 세분화와 같은 연구가 활발히 진행되고 있다. 그러나 최신 적대적 생성 신경망 모델은 여전히 시각적 결함이 포함된 이미지를 생성하고 있으며, 재학습을 통해서 이를 해결하기에는 오류 수리를 보장할 수 없으며, 많은 학습 시간과 비용을 요구하게 된다. 이렇게 규모가 큰 최신 적대적 생성 신경망 모델의 일부 오류를 해결하기 위해 모델 전체를 재학습하는 것은 적합하지 않다.
연구팀은 문제 해결을 위해 생성 오류를 유도하는 딥러닝 내부의 유닛(뉴런)을 찾아 제거하는 알고리즘을 개발했다. 알고리즘은 딥러닝 모델의 시각적 결함의 위치를 파악하고, 딥러닝 모델 내 여러 계층에 존재하는 오류를 유발한 유닛을 찾아서 활성화하지 못하도록 하여 결함이 발생하지 않도록 했다.
연구팀은 설명가능 인공지능 기술을 활용해 시각적 결함이 생성된 이미지의 어느 부분에 분포하는지, 또 딥러닝 내부의 어떤 유닛이 결함의 생성에 관여하는지 찾을 수 있었다. 개발된 기술은 딥러닝 생성모델의 오류를 수리할 수 있고, 생성모델의 구조에 상관없이 적용할 수 있다.
연구팀은 전통적인 구조를 가지는 `진행형 생성모델(Progressive GAN, PGGAN)'에서 개발 기술이 효과적으로 생성 오류를 수리할 수 있음을 확인했다. 수리 성능은 매사추세츠 공과대학(MIT)이 보유한 수리 기술 대비 FID 점수가 10점 정도 감소했으며, 사용자 평가에서 시험 이미지 그룹의 약 50%가 결함이 제거됐고, 약 90%에서 품질이 개선됐다는 결과를 얻었다. 나아가 특이 구조를 가지는 `StyleGAN2'와 `U-net GAN'에서도 생성 오류 수리가 가능함을 보임으로써 개발 기술의 일반성과 확장 가능성을 보였다.
연구팀이 개발한 생성모델의 오류 제거 기술은 다양한 이미지 외에도 다양한 생성모델에 적용돼 모델의 결과물에 대한 신뢰성을 높일 것으로 기대된다.
공동 제1 저자인 알리 투씨와 정해동 연구원은 "딥러닝 생성모델이 생성한 결과물에 있는 시각적 오류를 찾고, 이에 상응하는 활성화를 보이는 생성모델 내부의 유닛을 순차적으로 제거함으로써 생성 오류를 수리할 수 있음을 보였다ˮ라며 이는 "충분히 학습된 모델 내부에 미학습 혹은 잘못 학습된 내부요소가 있음을 보여주는 결과다ˮ라고 말했다.
한편 이번 연구는 2021년도 과학기술정보통신부의 재원으로 정보통신기획평가원의 지원을 받은 혁신성장동력프로젝트 설명가능인공지능 및 한국과학기술원 인공지능 대학원 프로그램과제를 통해서 수행됐다.
2021.06.25
조회수 25855