‘나만의 AI’ 더 안전하게 만든다...AI 개인화 시대 핵심기술 개발
“우리 회사 문서만 학습한 AI 비서를 만들어줘.”
기업과 개인이 자신의 문서와 데이터를 AI에 학습시켜 ‘나만의 AI’를 만드는 시대가 열리고 있다. 하지만 AI를 맞춤형으로 학습시키면 업무 능력은 높아지는 반면 기존의 안전장치가 약해질 수 있다는 한계가 있었다. 국내 연구진이 맞춤형 성능은 그대로 유지하면서 안전성은 오히려 높이는 AI 핵심 기술을 개발했다.
우리 대학은 전기및전자공학부 김창익 교수 연구팀이 챗GPT와 같은 대형언어모델(LLM, Large Language Model)을 개인이나 기업의 데이터에 맞게 다시 학습시키는 파인튜닝(Fine-tuning, 기존 AI에 새로운 지식이나 업무를 추가로 학습시키는 과정)에서 안전성이 훼손되는 문제를 해결하는 ‘버퍼 앤드 리인포스(Buffer-and-Reinforce)’ 학습 프레임워크를 개발했다고 15일 밝혔다.
기존에는 AI를 맞춤형으로 학습시키면 새로운 업무 능력은 향상되지만 기존의 안전 규칙이 함께 약화되는 문제가 AI 개인화 시대의 가장 큰 과제로 꼽혀왔다. 연구팀은 먼저 AI가 원래 거부해야 할 위험한 요청에도 응답할 수 있도록 만든 ‘탈옥(Jailbreak)’ 상태의 AI를 맞춤형으로 학습시키면 오히려 안전성이 크게 훼손되지 않는다는 기존 연구 결과에 주목했다.
이에 연구팀은 탈옥 상태를 실제 서비스에 사용하는 것이 아니라 완충 모듈인 ‘버퍼로라(BufferLoRA)’를 활용해 맞춤형 학습 과정에서만 일시적으로 적용한 뒤 제거하는 새로운 접근법을 고안했다.
연구팀은 왜 이러한 현상이 발생하는지를 세계 최초로 규명했다. 그 결과 탈옥 상태의 AI는 위험한 정보에는 더 이상 쉽게 영향을 받지 않는 반면, 사용자가 원하는 새로운 업무 능력은 그대로 효과적으로 학습한다는 사실을 확인했다. 즉, 위험한 정보는 추가로 받아들이지 않으면서 필요한 지식은 계속 학습하는 원리를 밝혀낸 것이다.
이를 바탕으로 연구팀은 ‘완충(Buffer)’과 ‘안전성 강화(Reinforce)’의 두 단계 학습 기법을 개발했다.
먼저 완충 모듈인 ‘버퍼로라(BufferLoRA)’를 AI에 임시로 적용해 맞춤형 학습 과정에서 악성 데이터가 AI 본체에 직접 영향을 주지 못하도록 막아주는 보호막 역할을 하도록 했다. 맞춤형 학습이 끝나면 이 모듈은 제거된다.
이후 안전성 강화 모듈인 ‘리인포스로라(ReinforceLoRA)’를 적용해 AI의 안전성을 다시 높였다. 이 과정에서는 큐알 분해(QR Decomposition, 서로 다른 정보를 분리해 필요한 정보만 선택적으로 반영하는 수학적 기법)를 활용해 사용자가 학습시킨 새로운 기능은 그대로 유지하면서 안전성만 선택적으로 강화하는 데 성공했다.
쉽게 말해, 연구팀은 AI 본체에 임시 보호막(BufferLoRA)을 씌워 악성 데이터가 직접 영향을 주지 못하도록 한 뒤 필요한 업무만 학습시켰다. 이후 보호막을 제거하고 안전성 강화 모듈(ReinforceLoRA)을 적용해 AI의 안전장치를 다시 강화함으로써 맞춤형 성능은 그대로 유지하면서 안전성까지 높이는 데 성공한 것이다.
실험 결과, 사용자 데이터가 모두 위험한 질문과 답변으로 구성된 극단적인 환경에서도 AI는 높은 안전성을 유지했다. 재학습 이후 위험한 답변을 생성하는 비율은 약 8%로, 재학습을 하지 않은 기존 모델의 약 18%보다도 낮은 수준을 기록했다. 또한 별도의 안전성 재학습이나 추가적인 계산 비용 증가 없이 맞춤형 성능과 최고 수준의 안전성을 동시에 확보해 실제 AI 개인화 서비스에도 효율적으로 적용할 수 있는 가능성을 제시했다.
김창익 교수는 “이번 연구는 누구나 자신의 데이터로 맞춤형 AI를 자유롭게 만들면서도 더욱 안전하게 사용할 수 있도록 하는 핵심 기반 기술”이라며 “AI 안전성이 더욱 강조되는 AI 개인화와 AI 에이전트 시대에 신뢰할 수 있는 AI 서비스 환경을 구축하는 데 크게 기여할 것으로 기대한다”고 말했다.
이번 연구는 KAIST 전기및전자공학부 함석일 박사과정이 제1저자로 참여했으며, 인공지능 분야 세계 최고 권위 학술대회인 국제머신러닝학회(ICML, International Conference on Machine Learning) 2026에서 7월 전체 투고 논문 중 상위 약 2.2%에만 주어지는 스포트라이트(Spotlight) 논문으로 채택되어 세계적인 주목을 받았다.
※ 논문명 : Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models, DOI: 10.48550/arXiv.2605.24550
※ 저자 정보 : 함석일(한국과학기술원, 제1 저자), 장재혁(한국과학기술원, 제2 저자), 이원준(한국과학기술원, 제3 저자), 김창익(한국과학기술원, 교신저자)
※ 관련 동영상 파일: https://drive.google.com/file/d/1gfok06dE8699qtiUR7gVsRoVmBGADaWQ/view?usp=sharing
한편, 이번 연구는 과학기술정보통신부 정보통신기획평가원(IITP)이 지원하는 ‘공존가능한 신뢰AI를 위한 AI Safety 기술개발사업’의 지원을 받아 수행됐다.
적은 메모리로도 휴머노이드 로봇의 눈 밝힌다
스마트폰의 안면 인식부터 휴머노이드 로봇까지, 인공지능(AI)의 눈 역할을 하는 컴퓨터 비전 기술은 우리 일상에 널리 활용되고 있다. 우리 대학과 국제 공동연구진은 적은 메모리만으로도 AI가 세상을 더욱 선명하게 볼 수 있는 기술을 개발해 GPU(그래픽처리장치) 메모리 효율을 최대 16배 높였다. 이번 성과는 휴머노이드 로봇과 온디바이스 AI 시대를 앞당길 핵심 기술로 평가된다.
우리 대학은 전기및전자공학부 김창익 교수 연구팀이 미국 MIT 및 마이크로소프트 연구진과의 공동 연구를 통해, 제한된 GPU 메모리만으로도 AI의 시각 성능을 높일 수 있는 범용 기술 ‘업샘플 애니띵(Upsample Anything)’을 개발했다고 17일 밝혔다.
이번 성과는 인공지능 및 컴퓨터 비전 분야 세계 최고 권위 학회인 ‘CVPR 2026’ 논문 채택에 이어, 계산 자원의 효율적 활용을 인정받아 전체 1위인‘CVPR 컴퓨트 골드 스타(CVPR Compute Gold Star)’를 수상하고, 연구 과정의 투명성과 재현 가능성 부문 ‘트랜스패런시 챔피언(Transparency Champion)’에 선정됐다. 이는 연구 성능은 물론 사용된 계산 자원, 코드 공개, 실험 재현 가능성 등 책임 있는 인공지능 연구의 핵심 요소를 두루 인정받은 성과다.
최근 휴머노이드 로봇과 자율주행 시스템, 세계모델(World Model·현실 세계의 물리적 환경과 변화를 학습·예측하는 AI 모델) 기반 인공지능은 연산 속도를 높이고 메모리 사용량을 줄이기 위해 입력 영상을 저해상도 특징 정보(Feature·AI가 이미지에서 추출한 핵심 정보)로 압축해 활용하고 있다.
그러나 압축 과정에서 작은 물체나 얇은 구조물, 미세한 결함과 같은 중요한 시각 정보가 손실되는 문제가 발생한다. 반대로 모든 영상을 처음부터 고해상도로 처리하면 막대한 GPU 메모리와 연산 자원이 필요해 실시간 처리가 어려워진다. 이는 스마트폰과 같은 소형 기기나 기동성이 중요한 로봇이 주변 환경을 정밀하게 인식해야 하는 상황에서 오랫동안 해결되지 않은 과제로 남아 있었다.
연구팀은 이러한 한계를 극복하기 위해 입력 이미지의 경계와 구조 정보를 활용해 저해상도 특징 정보를 고해상도로 복원하는 학습 없는(Training-free·추가 데이터 학습이 필요 없는) 업샘플링 기술을 개발했다.
기존 기술은 새로운 환경이나 데이터에 적용하기 위해 별도의 재학습이나 복잡한 최적화 과정을 거쳐야 했다. 반면 연구팀이 개발한 ‘업샘플 애니띵’은 입력 이미지 한 장만으로 최적의 복원 방식을 찾아낼 수 있어 다양한 환경에 즉시 적용할 수 있다.
또한 모든 시각 정보를 고해상도로 저장·처리하지 않고 핵심 정보만 압축해 활용함으로써 GPU 메모리 사용량을 크게 줄였다. 연구팀은 AI 연구에서 널리 활용되는 224×224 크기 이미지(약 5만 개 픽셀) 기준 약 0.4초의 짧은 계산만으로 원본에 가까운 시각 정보를 복원했으며, GPU 메모리 효율을 최대 16배까지 향상시키는 성과를 거뒀다.
이는 제한된 연산 자원만으로도 인공지능이 주변 환경을 더욱 정밀하게 인식할 수 있음을 의미한다. 따라서 이번 기술은 스마트폰과 같은 소형 기기는 물론, 작은 물체를 정확하게 식별하고 조작해야 하는 휴머노이드 로봇, 자율주행 시스템, 온디바이스 AI 등 다양한 차세대 인공지능 분야에 폭넓게 활용될 것으로 기대된다.
김창익 교수는 “이번 기술은 적은 자원으로도 인공지능의 시각 정밀도를 크게 높일 수 있는 알고리즘으로, 휴머노이드 로봇과 온디바이스 AI의 실용화를 앞당길 것으로 기대한다”며 “CVPR에서 성능뿐 아니라 계산 효율성과 연구 투명성까지 인정받았다는 점에서 더욱 의미가 크다”고 말했다.
이번 연구는 KAIST 서민석 박사과정 학생이 제1 저자로 참여했으며, 이번 성과는 인공지능 및 컴퓨터 비전 분야 세계 최고 권위 학회인 ‘CVPR 2026’에서 6월 7일 발표됐다.
※ 논문명: Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling, DOI:10.48550/arXiv.2511.16301
※ 저자 정보: 서민석 (KAIST, 제1 저자), 마크 헤밀턴 (MIT, 마이크로소프트, 제2 저자), 김창익(KAIST, 교신저자)
※ 관련 데모 동영상: https://drive.google.com/file/d/17f9j4tcD0JJfA4xeN4b5qvaOjUxFVS_U/view?usp=sharing
차세대 새로운 패러다임 동영상 인식기술 개발
챗GPT와 같은 거대 언어 모델의 근간이 되는 트랜스포머로 구축된 기존 비디오 모델보다 8배 낮은 연산량과 4배 낮은 메모리 사용량으로도 높은 정확도를 기록했으며, 추론 속도 또한 기존 트랜스포머 기반 모델 대비 4배의 매우 빠른 속도를 달성한 동영상 인식기술이 우리 연구진에 의해 개발됐다.
우리 대학 전기및전자공학부 김창익 교수 연구팀이 초고효율 동영상 인식 모델 ‘비디오맘바(VideoMamba)’를 개발했다고 23일 밝혔다.
비디오맘바는 기존 트랜스포머 기반 모델들이 가지고 있는 높은 계산 복잡성을 해결하기 위해 설계된 새로운 동영상 인식 모델이다. 기존의 트랜스포머 기반 모델들은 셀프-어텐션(self-attention)이라는 메커니즘에 의존해 계산 복잡도가 제곱으로 증가하는 문제를 가지고 있었다.
김창익 교수 연구팀의 비디오맘바는 선택적 상태 공간 모델(Selective State Space Model, Selective SSM)* 메커니즘을 활용해 선형 복잡도**로 효율적인 처리가 가능하다. 이를 통해 비디오맘바는 동영상의 시공간적 정보를 효과적으로 포착해 긴 종속성을 가진 동영상 데이터도 효율적으로 처리할 수 있다.
*선택적 상태 공간 모델(Selective SSM): 입력에 따라 동적으로 매개변수를 조정하여 시퀀스 데이터의 문맥을 더 잘 이해하는 상태 공간 모델
**선형 복잡도:입력 데이터의 크기에 비례하여 계산량이 증가하는 알고리즘 복잡도
김창익 교수 연구팀은 동영상 인식 모델의 효율성을 극대화하기 위해 비디오맘바에 1차원 데이터 처리에 국한된 기존 선택적 상태 공간 메커니즘을 3차원 시공간 데이터 분석이 가능하도록 고도화한 시공간적 전방 및 후방 선택적 상태 공간 모델(spatio-temporal forward and backward SSM)을 도입했다. 이 모델은 순서가 없는 공간 정보와 순차적인 시간 정보를 효과적으로 통합해 인식 성능을 향상한다. 연구팀은 다양한 동영상 인식 벤치마크에서 비디오맘바의 성능을 검증했다.
연구팀이 개발한 비디오맘바는 영상 분석이 필요한 다양한 응용 분야에서 효율적이고 실용적인 솔루션을 제공할 수 있다. 예를 들어, 자율주행에서는 주행 영상을 분석해 도로 상황을 정확하게 파악하고, 보행자와 장애물을 실시간으로 인식해 사고를 예방할 수 있다. 의료 분야에서는 수술 영상을 분석해 환자의 상태를 실시간으로 모니터링하고 긴급 상황 발생 시 신속히 대처할 수 있다. 스포츠 분야에서는 경기 중 선수들의 움직임과 전술을 분석해 전략을 개선하고, 훈련 중 피로도나 부상 가능성을 실시간으로 감지해 예방할 수 있다.
연구를 주도한 김창익 교수는 “비디오맘바의 빠른 처리 속도와 낮은 메모리 사용량, 그리고 뛰어난 성능은 우리 생활에서의 다양한 동영상 활용 분야에 큰 장점을 제공할 것이다”고 연구의 의의를 설명했다.
이번 연구에는 전기및전자공학부 박진영 석박사통합과정, 김희선 박사과정, 고강욱 박사과정이 공동 제1 저자, 김민범 박사과정이 공동 저자, 그리고 전기및전자공학부 김창익 교수가 교신 저자로 참여했다. 연구 결과는 올해 9월 이탈리아 밀라노에서 열리는 컴퓨터 비전 분야 최우수 국제 학회 중 하나인 ‘European Conference on Computer Vision(ECCV) 2024’에서 발표될 예정이다. (논문명: VideoMamba: Spatio-Temporal Selective State Space Model)
한편, 이번 연구는 정부(과학기술정보통신부)의 재원으로 정보통신기획평가원의 지원을 받아 수행됐다. (No. 2020-0-00153, 기계학습 모델 보안 역기능 취약점 자동 탐지 및 방어 기술 개발)