AI 스스로 숨은 약점 찾는다…더 안전한 생성형 AI 만든다
튼튼한 성을 만들려면 먼저 약한 곳을 찾아야 한다. 생성형 인공지능(AI)도 마찬가지다. 우리 대학 연구진이 AI의 숨은 취약점을 기존보다 약 7배 더 다양하게 찾아내는 안전성 검증 기술을 개발했다. 더욱 안전하고 신뢰할 수 있는 AI 개발의 기반이 될 것으로 기대된다.
우리 대학은 전기및전자공학부 김준모 교수 연구팀이 대규모 언어모델(Large Language Model, LLM)의 안전성을 검증하는 레드팀(Red Teaming, AI를 의도적으로 공격해 취약점을 찾는 안전성 검증 과정) 기술의 한계를 극복한 새로운 프레임워크 ‘스테이블-지플로우넷(Stable-GFlowNet)'을 개발했다고 30일 밝혔다.
생성형 AI의 레드팀(Red Teaming)은 프로그램을 배포하기 전에 AI가 유해하거나 위험한 답변을 하도록 유도하는 공격 프롬프트(Attack Prompt, AI의 취약점을 시험하기 위한 질문)를 만들어 숨은 약점을 찾아내는 과정이다. 가능한 한 다양한 공격 방법을 찾아낼수록 더 많은 취약점을 사전에 제거할 수 있어, 공격 성공률과 공격 다양성이 모두 중요하다.
기존에는 강화학습(Reinforcement Learning, 보상을 최대화하도록 학습하는 AI 기법)을 이용해 공격 프롬프트를 생성하는 방식이 주로 사용됐다. 하지만 가장 성공률이 높은 한두 가지 공격 방법만 반복적으로 생성하는 모드 붕괴(Mode Collapse, 다양한 결과 대신 일부 결과에만 치우치는 현상)가 자주 발생해 여러 유형의 취약점을 충분히 찾지 못하는 한계가 있었다.
이를 해결하기 위해 생성 흐름 네트워크(Generative Flow Network, GFlowNet, 보상에 비례해 다양한 결과를 생성하도록 학습하는 AI 생성 기술)가 제안됐지만, 학습 과정에서 계산이 복잡하고 불안정하며 의미 없는 문장에도 높은 보상이 주어져 성능이 쉽게 무너지는 문제가 있었다.
연구팀은 이러한 문제를 해결하기 위해 좋은 공격은 더 잘 배우고, 잘못된 공격은 걸러내는 세 가지 핵심 기술을 개발했다.
첫째, 여러 길 가운데 더 나은 길을 비교해 선택하듯, 대조 궤적 균형(Contrastive Trajectory Balance, CTB) 기법을 도입해 계산이 복잡한 과정을 줄이고 학습을 안정화했다.
둘째, 시끄러운 환경에서도 필요한 목소리만 골라 듣듯, 노이즈 경사 가지치기(Noise Gradient Pruning, NGP)를 적용해 불필요한 잡음은 제거하고 중요한 정보만 학습하도록 했다.
셋째, 횡설수설하는 말보다 자연스러운 문장을 우선 평가하듯 유창성 안정화 장치(MKS)를 적용해 사람이 실제 사용할 법한 공격 프롬프트를 생성하도록 유도했다.
그 결과 연구팀이 개발한 스테이블-지플로우넷(Stable-GFlowNet)은 기존 기술이 찾아낸 17개의 고유 공격 유형보다 약 7배 많은 134개의 공격 유형을 발굴하면서도 92%의 높은 공격 성공률을 유지했다.
또한 스테이블-지플로우넷으로 학습한 방어 모델은 서로 다른 공격 기법을 이용해 평가하는 교차 공격(Cross Attack) 시험에서도 다양한 공격을 효과적으로 방어하며 우수한 일반화 성능을 입증했다.
이번 기술은 AI 안전성 검증뿐 아니라 신약 후보 물질을 생성하는 분자 생성(Molecular Generation) 등 다양한 분포 매칭(Distribution Matching) 문제에서도 기존보다 빠르고 안정적인 성능을 보여 범용적으로 활용될 가능성도 확인했다.
김준모 교수는 “이번 기술은 적은 데이터와 잡음이 많은 현실적인 환경에서도 AI의 다양한 취약점을 안정적으로 찾아낼 수 있다는 점에서 의미가 크다”며 “생성형 AI를 실제 서비스에 적용하기 전에 더 폭넓은 위험 요소를 찾아내고 방어할 수 있어, 더욱 안전하고 신뢰할 수 있는 AI 개발의 핵심 기반기술이 될 것으로 기대한다”고 말했다.
이번 연구는 KAIST 전기및전자공학부 권민찬 박사과정이 제1저자로 참여했으며, 인공지능 분야 세계 최고 권위 학회인 '국제머신러닝학회(ICML) 2026'에서 상위 2.2%에 해당하는 스포트라이트(Spotlight) 논문으로 선정되는 쾌거를 이뤘다.
※ 논문명: Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance,DOI : https://arxiv.org/abs/2605.00553
한편, 이번 연구는 과학기술정보통신부 정보통신기획평가원 SW스타랩 사업의 지원을 받아 수행됐다.
AI에 가정교사 생겼다...사람의 선호를 더 정확히 배운다
아무리 많은 데이터를 학습해도, 인공지능(AI)은 왜 사람의 의도를 자주 빗나갈까? 사람의 선호를 이해시키기 위한 비교 학습은 오히려 AI를 혼란스럽게 만드는 경우도 적지 않았다. KAIST 연구진은 AI에게 ‘가정교사’를 붙이는 방식으로, 적은 데이터에서도 사람의 선호를 정확히 배우는 새로운 학습 해법을 제시했다.
우리 대학 전기및전자공학부 김준모 교수 연구팀이 인간의 선호를 효과적으로 반영하면서도 데이터 효율성과 학습 안정성을 크게 향상시킨 강화학습 프레임워크 ‘TVKD(Teacher Value-based Knowledge Distillation)’를 개발했다고 17일 밝혔다.
기존 인공지능 학습 방식은 “A가 B보다 낫다”는 식의 단순 비교(preference comparison) 데이터를 대량으로 수집해 학습하는 구조였다. 이 방식은 많은 데이터가 필요하고, 판단이 애매한 상황에서는 AI가 혼란에 빠지기 쉽다는 한계가 있었다.
연구팀은 이러한 문제를 해결하기 위해, 사람의 선호를 먼저 깊이 이해한 ‘교사(Teacher) 모델’이 그 핵심 정보만을 ‘학생(Student) 모델’에게 전달하는 방식을 제안했다.
이는 복잡한 내용을 정리해 가르치는 가정교사에 비유할 수 있으며, 연구팀은 이를 ‘선호 증류(Preference Distillation)’라고 명명했다.
이번 기술의 가장 큰 특징은 단순히 ‘좋다·나쁘다’를 흉내 내는 것이 아니라, 각 상황이 얼마나 가치 있는지를 수치적으로 판단하는 ‘가치 함수(Value Function)’를 교사 모델이 학습한 뒤 이를 학생 모델에 전달하도록 설계했다는 점이다.
이를 통해 AI는 애매한 상황에서도 단편적인 비교가 아닌, ‘이 선택이 왜 더 나은지’를 종합적으로 판단하며 학습할 수 있다.
이번 기술의 핵심은 크게 두 가지다. 첫째, 문맥 전체를 고려한 가치 판단을 학생 모델에 반영함으로써, 단편적인 답변이 아닌 전체 흐름을 이해하는 학습이 가능해졌다. 둘째, 선호 데이터의 신뢰도에 따라 학습 중요도를 조절하는 기법을 도입했다.
명확한 데이터는 학습에 크게 반영하고, 모호하거나 잡음이 섞인 데이터는 영향력을 줄여 현실적인 환경에서도 AI가 안정적으로 학습할 수 있도록 했다.
연구팀이 이 기술을 여러 AI 모델에 적용해 실험한 결과, 기존에 가장 성능이 좋다고 알려진 방법들보다 더 정확하고 안정적인 성능을 보였다. 특히 엠티-벤치(MT-Bench), 알파카-이밸(AlpacaEval) 등 주요 평가 지표에서 기존 최고 기술을 안정적으로 앞서는 성과를 기록했다.
김준모 교수는 “현실에서는 사람의 선호 데이터가 항상 충분하거나 완벽하지 않다”며 “이번 기술은 그런 제약 속에서도 AI가 일관되게 학습할 수 있게 해, 다양한 분야에서 실용성이 매우 높을 것”이라고 말했다.
우리 대학 전기및전자공학부 권민찬 박사과정이 제1 저자로 참여했으며, 연구 성과는 국제 인공지능 분야 최고 권위 학회인 ‘신경정보처리시스템학회(NeurIPS) 2025’에 채택됐다. 해당 연구는 2025년 12월 3일(미국 태평양시간) 포스터 세션에서 발표됐다.
※ 논문명: Preference Distillation via Value based Reinforcement Learning), DOI: https://doi.org/10.48550/arXiv.2509.16965
한편 이번 연구는 2024년도 정부(과학기술정보통신부)의 재원으로 정보통신기획평가원의 지원을 받아 수행된 연구 성과물(No.RS-2024-00439020, 지속가능한 실시간 멀티모달 인터렉티브 생성 AI 개발, SW스타랩)을 지원을 받아 수행했다.
인간의 인지 방식과 유사한 AI 모델 개발
우리 연구진이 인간의 인지 방식을 모방해 이미지 변화를 이해하고, 시각적 일반화와 특정성을 동시에 확보하는 인공지능 기술을 개발했다. 이 기술은 의료 영상 분석, 자율주행, 로보틱스 등 다양한 분야에서 이미지를 이해하여 객체를 분류, 탐지하는 데 활용될 전망이다.
우리 대학 전기및전자공학부 김준모 교수 연구팀이 변환 레이블(transformational labels) 없이도 스스로 변환 민감 특징(transformation-sensitive features)을 학습할 수 있는 새로운 시각 인공지능 모델 STL(Self-supervised Transformation Learning)을 개발했다고 13일 밝혔다.
연구팀이 개발한 시각 인공지능 모델 STL은 스스로 이미지의 변환을 학습하여, 이미지 변환의 종류를 인간이 직접 알려주면서 학습하는 기존 방법들보다 높은 시각 정보 이해 능력을 보였다. 특히, 기존 방법론들을 통해 학습한 모델이 이해할 수 없는 세부적인 특징까지도 학습하여 기존 방법 대비 최대 42% 우수한 성능을 보여줬다.
컴퓨터 비전에서 이미지 변환을 통한 데이터 증강을 활용해 강건한 시각 표현을 학습하는 방식은 일반화 능력을 갖추는 데 효과적이지만, 변환에 따른 시각적 세부 사항을 무시하는 경향이 있어 범용 시각 인공지능 모델로서 한계가 있다.
연구팀이 제안한 STL은 변환 라벨 없이 변환 정보를 학습할 수 있도록 설계된 새로운 학습 기법으로, 라벨 없이 변환 민감 특징을 학습할 수 있다. 또한, 기존 학습 방법 대비 학습 복잡도를 유지한 채로 효율적인 최적화할 수 있는 방법을 제안했다.
실험 결과, STL은 정확하게 객체를 분류하고 탐지 실험에서 가장 낮은 오류율을 기록했다. 또한, STL이 생성한 표현 공간은 변환의 강도와 유형에 따라 명확히 군집화되어 변환 간 관계를 잘 반영하는 것으로 나타났다.
김준모 교수는 "이번에 개발한 STL은 복잡한 변환 패턴을 학습하고 이를 표현 공간에서 효과적으로 반영하는 능력을 통해 변환 민감 특징 학습의 새로운 가능성을 제시했다”며, "라벨 없이도 변환 정보를 학습할 수 있는 기술은 다양한 AI 응용 분야에서 핵심적인 역할을 할 것”이라고 말했다.
우리 대학 전기및전자공학부 유재명 박사과정이 제1 저자로 참여한 이번 연구는 최고 권위 국제 학술지 ‘신경정보처리시스템학회(NeurIPS) 2024’에서 올 12월 발표될 예정이다.(논문명: Self-supervised Transformation Learning for Equivariant Representations)
한편 이번 연구는 이 논문은 2024년도 정부(과학기술정보통신부)의 재원으로 정보통신기획평가원의 지원을 받아 수행된 연구 성과물(No.RS-2024-00439020, 지속가능한 실시간 멀티모달 인터렉티브 생성 AI 개발, SW스타랩) 이다.
김준모·주재걸 교수, 한국인공지능학회 학술상·학회공로상 수상
우리 대학 유창동 전기및전자공학부 교수가 회장을 맡은 한국인공지능학회 지난 11일 2022 송년회를 개최하고 인공지능의 학술적 발전에 기여한 기업과 연구자에게 시상했다.
최근 5년 간 영향력이 큰 논문을 쓴 연구자에게 주는 학술상은 김준모 KAIST 전기및전자공학부 교수, 주재걸 KAIST 김재철AI대학원 교수에게 수여됐다. 서민준 KAIST 김재철AI대학원 교수는 신진연구자상을 받았다. 또한, 인공지능 및 학회 발전에 세운 공로로 김광수·장동의 KAIST 전기및전자공학부 교수, 석흥일 고려대 인공지능학과 교수, 백승렬 유니스트 AI 대학원 교수, 주재걸 KAIST 김재철AI대학원 교수에게 학회공로상이 부상과 함께 주어졌다.
이번 시상식에서는 학술분야의 높은 성과와 함께 인공지능 개발과 응용에 앞장서 국내·외 협력 사업을 활성화고 학회와의 협력을 위해서 노력한 기업인들의 공로도 치하돼 배경훈 LG AI 연구원장, 하정우 네이버 AI 연구소장, 배순민 KT AI2XL 소장에게 기업인상이 주여졌다.
배경훈 원장은 LG AI 연구원의 초대원장으로 LG 그룹의 인공지능 연구를 발전에 일조하고 최근에는 인력양성과 초거대 AI에 큰 힘을 쏟고 있다.
하정우 네이버 AI 연구소장은 네이버의 인공지능 연구를 세계적 수준으로 올리는데 크게 기여하고 있으며, 최근에는 NeurIPS 2022 의 Social Chair와 디지털플랫폼정부위원회 데이터-인공지능 분과 위원장을 역임하고 있다.
배순민 소장은 디지털플랫폼정부위원회 데이터-인공지능 분과에 참여하고 있으며, KT내 인공지능 연구와 국제협력 사업에 큰 힘을 기울이고 있다.
유창동 회장은 “2022년 한국인공지능 발전을 이끌어주신 모든 수상자들에게 축하와 감사의 인사를 전하며, 2023년에는 더 크게 도약하는 한 해가 되길 기원한다”라고 전했다.
AI World Cup 2017 공개강좌 개최
우리 대학이 오는 11월 개최 예정인 ‘AI 월드컵(World Cup) 2017’을 앞두고 9월 8일과 14일 오후 1시30분부터 각각 서울 도곡동 캠퍼스와 대전 본원에서 공개강좌를 개최한다고 17일 밝혔다.
‘AI 월드컵(World Cup) 2017’은 KAIST가 오는 11월부터 개최하는 축구경기인데 스포츠 종목의 인공지능(AI) 경기로는 세계 최초로 열리는 공식대회다.
이번 공개강좌의 수강대상은 ‘AI 월드컵(World Cup) 2017’에 참가를 원하는 AI(인공지능)분야에 관심 있는 전국 대학(원)생과 일반인인데 1차 공개강좌는 9월 8일 오후 1시30분부터 서울 도곡동 캠퍼스에서, 그리고 2차 공개강좌는 9월 14일 같은 시간에 대전 본원에서 두 차례에 걸쳐 열린다.
공개강좌는 김종환 공과대학장의 ‘AI 월드컵(World Cup) 2017’소개를 시작으로 김준모 교수(전기및전자공학부)의 ‘딥러닝의 이해’, 정세영 교수(전기및전자공학부)의‘심층강화학습’, 황성주 교수(UNIST 전기전자컴퓨터공학부)의 ‘스포츠 영상에서의 상황이해 및 자막생성 기술’, 차미영 교수(전산학부)의 ‘인공지능과 로봇저널리즘: AI리포터와 가짜뉴스 탐지기술’등 4개의 특강 순으로 진행된다.
‘AI 월드컵(World Cup) 2017’ 공개강좌에 수강을 원하는 사람들은 이달 17일부터 오는 9월 5일까지 관련 홈페이지(http://mir.kaist.ac.kr/worldcup_ai)에 회원으로 가입한 후 신청서를 접수하면 된다. 수강료는 5만원이다.
한편 KAIST가 세계 최초로 주관, 개최하는 ‘AI 월드컵(World Cup) 2017’대회는 온라인 시뮬레이션 환경에서 인공지능 기술로 스스로 학습한 5명의 선수가 한 팀을 이뤄 상대팀 골대에 골을 넣어 득점하는 ▲AI 축구와 온라인 경기영상을 분석하고 해설하는 ▲AI 경기해설, 그리고 온라인 경기결과를 기사로 작성하는 ▲AI 기자 등 모두 3개 종목으로 구성돼 치러진다.
참가자들은 10월 한 달간 온라인 연습기간을 거친 후 11월 1일부터 24일까지 예선을 치르는데, 누적 경기실적에서 고득점을 획득한 상위 팀들은 12월 1일 대전 KAIST 본교 KI빌딩에서 치루는 본선경기에 참여하게 된다.
본선 당일에는 인공지능 기술 구현방법 발표평가를 시행한 후 종합평가를 통해 최종 우승팀을 선정한다.
‘이 대회에 참가를 원하는 사람들은 팀 구성(안)을 준비해서 관련 홈페이지(http://mir.kaist.ac.kr/worldcup_ai)에 회원으로 가입한 후 참가신청서와 참가종목 등을 직접 입력해 접수기간 마감일인 9월 30일까지 등록하면 된다.
한편 대회 조직위원장인 김종환 공과대학장은 “2018년 상반기에는 대전시 등 여러 기관들과의 협력을 통해 외국 팀들에게도 출전 기회를 개방하는 등 AI 월드컵(World Cup) 대회규모를 국제행사로 크게 확대할 방침”이라고 강조했다. 문의 042-350-8877(사무국). (끝).
□ 사진 설명
사진1. 공개강좌 포스터