투명한 유리도 보고 미래도 예측하는 ‘피지컬 AI’ 핵심기술 개발
인공지능(AI)이 화면 속 정보를 분석하는 기술을 넘어, 현실 세계의 물리적 특성을 이해하고 스스로 판단·행동하는 단계로 진화하고 있다. 우리 대학 연구진은 빛과 물질의 상호작용, 공간 인식, 미래 상황 예측, 행동 계획을 아우르는 피지컬 AI(Physical AI·물리 기반 인공지능) 핵심 기술을 개발했다. 이번 성과는 자율주행차와 휴머노이드 로봇, 산업용 로봇, 디지털 트윈 등 실제 환경에서 작동하는 차세대 자율 시스템 구현을 앞당길 것으로 기대된다.
우리 대학은 전산학부 윤성의 교수 연구팀이 ▲유리나 물처럼 투명한 물체를 정확히 인식하는 기술 ▲빛과 물질의 상호작용을 분석해 주변 환경을 이해하는 기술 ▲사진 한 장만으로 로봇이 목적지를 찾아가는 기술 ▲미래 상황을 예측해 행동을 계획하는 기술을 개발했다고 6일 밝혔다.
이번 연구는 시각 인식부터 물리적 이해, 미래 예측, 행동 계획까지 하나의 기술 흐름으로 연결했다는 점에서 의미가 크다. 이를 통해 AI가 '보고(인식) → 이해하고(물리 이해) → 예측하고(미래 예측) → 행동하는(계획)' 전 과정을 수행하는 기반을 제시했으며, 다양한 자율 시스템의 성능과 활용 범위를 한층 넓힐 것으로 기대된다.
이번 연구 성과는 세계 최고 권위의 AI 학회인 ICLR 2026(International Conference on Learning Representations)과 CVPR 2026(Conference on Computer Vision and Pattern Recognition)에서 구두 발표 2편과 하이라이트 논문 2편 등 총 4편의 논문으로 발표됐다. 특히 ICLR과 CVPR의 구두 발표는 각각 약 1.13%, 0.8%만 선정되는 최상위 발표 형식으로, 연구의 독창성과 우수성을 국제적으로 인정받았다.
▲ 유리까지 이해하는 AI… 투명한 물체도 정확히 인식
연구팀은 글린트(GLINT, 투명 환경 시각 인식 기술)를 개발해 AI가 유리와 같은 투명한 물체도 정확하게 인식할 수 있도록 했다.
사람은 유리창을 볼 때 유리에 비친 모습과 유리 너머의 풍경을 자연스럽게 구분한다. 하지만 기존 AI는 두 정보를 하나의 영상으로 인식해 투명한 물체를 제대로 이해하지 못하는 경우가 많았다.
연구팀은 유리에 반사된 모습과 유리 뒤의 물체를 각각 분리해 분석하는 새로운 기술을 개발함으로써 AI가 투명한 환경에서도 장면을 정확하게 이해할 수 있도록 했다.
※ 논문 정보 : GLINT: Modeling Scene-Scale Transparency via Gaussian Radiance Transport, 논문 원본: https://arxiv.org/abs/2603.26181 (CVPR 2026 Oral, 6월 5일 구두 발표, Award Candidate(4천여 편 발표 논문 가운데 74편 선정)
▲ 빛의 움직임까지 이해하는 AI
연구팀은 라디오GS(RadioGS, 빛과 재질을 이해하는 장면 복원 기술)를 개발해 빛이 물체에 닿아 반사되고 퍼지는 과정까지 AI가 이해하도록 했다.
같은 물체라도 햇빛 아래와 실내 조명 아래에서는 다르게 보인다. 기존 AI는 이러한 조명 변화에 영향을 받기 쉬웠다. 연구팀은 빛과 물체의 상호작용을 AI가 학습하도록 만들어 조명이 달라져도 물체의 재질과 주변 환경을 더욱 정확하게 이해할 수 있도록 했다.
※ 논문 정보 : Radiometrically Consistent Gaussian Surfels for Inverse Rendering, 논문 원본: https://arxiv.org/abs/2603.01491 (ICLR 2026 Oral, 4월 23일 구두 발표)
▲ 사진 한 장만 보고 목적지를 찾아가는 로봇
연구팀은 비주얼-RRT(Visual-RRT, 이미지 기반 로봇 경로 계획 기술)를 개발해 시각 정보를 실제 행동으로 연결했다. 기존 로봇은 목적지의 좌표 정보가 필요했지만, 이번 기술은 현재 로봇이 보는 장면과 목표 사진을 비교하며 스스로 이동 경로를 찾아간다.
실제 로봇 실험에서도 사진 한 장만으로 목적지에 성공적으로 도달해 서비스 로봇과 자율주행 로봇 등 다양한 분야에 활용될 가능성을 확인했다.
※ 논문 정보: Visual-RRT: Finding Paths toward Visual-Goals via Differentiable Rendering, 논문원본: https://arxiv.org/abs/2604.16388 (CVPR 2026 Highlight) 3월 27일 하이라이트 논문 선정
※ 동영상: https://www.youtube.com/watch?v=nAPk27vHwEE
▲ 미래를 예측하고 스스로 행동을 계획하는 AI
연구팀은 클래드(CLaD, 미래 예측 기반 행동 계획 기술)를 개발해 AI가 행동하기 전에 미래 상황을 예측하고 가장 적절한 행동을 계획하도록 했다.
사람은 행동하기 전에 "이렇게 움직이면 다음에는 어떤 일이 생길까?"를 먼저 생각한다. 클래드는 AI도 이처럼 행동의 결과를 미리 예측한 뒤 가장 효과적인 행동을 선택하도록 만든 기술이다. 이를 통해 복잡한 환경에서도 높은 성공률로 작업을 수행할 수 있어 차세대 자율 로봇의 핵심 기술로 활용될 것으로 기대된다.
※ 논문 정보 : CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics, 논문원본: https://arxiv.org/abs/2603.29409(CVPR 2026 Highlight)
윤성의 교수는 "이번 연구는 AI가 단순히 눈으로 보는 것을 넘어 현실 세계를 이해하고 앞으로 일어날 상황까지 예측해 스스로 행동을 결정하는 방향으로 발전하고 있음을 보여준다"며 "이번 성과가 자율주행차와 휴머노이드 로봇 등 실제 환경에서 작동하는 다양한 피지컬 AI 기술의 발전에 기여하기를 기대한다"고 말했다.
윤성의 교수가 교신저자로 참여한 이번 연구들은 과학기술정보통신부와 정보통신기획평가원(IITP), 한국연구재단(NRF)의 지원을 받아 수행 중인 피지컬 AI 및 지능형 로봇 연구과제의 일환으로 수행됐다.
적은 데이터로도 정밀 동작 구현하는 로봇 AI 개발
좁은 틈에 부품을 끼우고 작은 버튼을 누르는 사람의 손재주를 로봇이 적은 데이터만으로도 배울 수 있게 됐다. 우리 대학 연구진이 작업 상황에 따라 스스로 움직임의 정밀도를 조절하는 로봇 인공지능 기술을 개발했다. 기존 최고 성능 모델보다 작업 성공률을 최대 81% 높인 이번 기술은 정밀 제조와 의료 분야 로봇의 활용 범위를 크게 넓힐 것으로 기대된다.
우리 대학은 전산학부 박대형 교수 연구팀이 적은 양의 동작 데이터만으로도 사용자가 원하는 정밀도에 맞춰 움직임을 세밀하게 생성하는 다중 정밀도 조작 모델 ‘디스포(DiSPo)'를 개발했다고 24일 밝혔다.
기존의 로봇 인공지능은 사람이 움직이는 모습을 매우 짧은 시간 간격으로 기록한 방대한 양의 데이터를 학습해야 정밀한 작업을 수행할 수 있었다. 예를 들어 나사를 조이거나 좁은 틈에 부품을 끼워 넣는 작업을 배우려면 수많은 동작 데이터를 세밀하게 수집해야 했기 때문에 시간과 비용이 많이 들었다.
연구팀은 이러한 한계를 극복하기 위해 로봇이 움직임의 변화를 스스로 예측하면서 다양한 행동을 학습할 수 있는 인공지능 기술을 개발했다. 특히 작업 상황에 따라 동작을 더 세밀하게 나누거나 크게 조절할 수 있는 기능을 새롭게 도입했다.
연구팀은 시간에 따른 변화를 효율적으로 학습하는 상태공간모델 '맘바(Mamba)'와 다양한 행동을 생성하는 확산모델(Diffusion Model)을 결합해 이러한 기능을 구현했다.
이를 통해 로봇은 적은 양의 데이터로 학습하더라도 실제 작업을 수행할 때는 움직임을 더 작은 단위로 나눠 정교하게 동작할 수 있다. 즉, 사람이 비교적 간단하게 시범을 보여줘도 로봇이 필요에 따라 스스로 동작을 세분화해 정밀한 작업을 수행할 수 있게 된 것이다.
연구팀이 개발한 디스포는 시뮬레이션 환경에서 기존 최고 성능 모델 대비 최대 81% 높은 작업 성공률을 기록했다. 또한 실제 협동로봇을 이용한 실험에서는 반경 2.5mm에 불과한 좁은 틈에 부품을 끼워 넣고 스마트폰의 작은 셔터 버튼을 정확히 누르는 고난도 작업을 안정적으로 수행했다. 이는 기존 인공지능 모델보다 최대 4배 높은 성공률이다.
이번 기술은 정밀 부품 조립, 케이블 연결, 의료 수술, 정밀 가공 등 높은 정확성이 요구되는 다양한 산업 분야에 적용될 수 있을 것으로 기대된다. 특히 적은 데이터만으로도 고정밀 로봇을 학습시킬 수 있어 로봇 개발 비용을 크게 낮추고 제조·의료·서비스 산업의 자동화를 앞당기는 데 기여할 전망이다.
박대형 교수는 "이번 연구는 로봇이 적은 양의 데이터만으로도 정교한 동작을 학습하고 작업 상황에 따라 스스로 정밀도를 조절할 수 있음을 보여준 사례"라며 "앞으로 데이터 수집 비용을 획기적으로 줄이면서도 정밀 제조와 의료 등 다양한 산업 현장에서 활용할 수 있는 범용 로봇 학습 기술로 발전시켜 나가겠다"고 말했다.
이번 연구는 김재철 AI대학원 오나영 석사과정생이 제1 저자로 주도하였으며, 6월 1일 오스트리아 비엔나에서 열리는 로봇공학 세계 최고 권위 학술대회인 ‘국제 로봇 및 자동화 학술대회(ICRA 2026)’에서 발표되었다.
※ 논문명: DiSPo: Diffusion-SSM based Policy Learning for Coarse-to-Fine Action Discretization, DOI: https://doi.org/10.48550/arXiv.2409.14719
※ 저자 정보: 오나영 (KAIST 김재철AI대학원, 제1 저자), 장재형 (KAIST 전산학부, 공저자), 정문경 (KAIST 로봇공학학제전공, 공저자), 박대형 (KAIST 전산학부, 교신저자)
한편, 이번 연구는 과학기술정보통신부와 정보통신기획평가원(IITP)의 ‘복합지능 자율행동체 SW 핵심기술 개발 사업’의 일환으로 ‘자율행동체의 복합작업 자율 수행을 위한 임무 수행 절차 생성 기술 개발’ 과제를 통해 수행되었다. 이 외에도 정보통신기획평가원의 ‘글로벌 AI 프론티어랩 사업’과 산업통상자원부의 기술혁신프로그램의 지원을 받았다.
AI 환각 줄이고 정확도 78% 높였다... 차세대 데이터베이스 기술 개발
기업의 방대한 데이터를 읽고 이해하는 AI 에이전트의 가장 큰 약점은 ‘환각(Hallucination·사실과 다른 정보를 그럴듯하게 생성하는 현상)'이다. 우리 대학 연구진이 문서와 데이터, 개체 간 관계를 한 번에 이해할 수 있는 차세대 데이터베이스 기술을 개발해 AI 답변 정확도를 최대 78% 높이고 처리 속도는 최대 20배 향상시키며 기업용 AI 상용화의 핵심 난제 해결에 나섰다.
우리 대학은 전산학부 김민수 교수 연구팀이 교원창업기업인 (주)그래파이와 협력하여 벡터 DB, 그래프 DB, 관계형 DB 기능을 하나의 데이터베이스 관리 시스템(DBMS)에 통합한 차세대 데이터베이스 기술 '아카식DB(AkasicDB)'와 이를 기반으로 한 새로운 검색증강생성(RAG, Retrieval-Augmented Generation) 기법 '옴니RAG(Omni RAG)'를 개발했다고 19일 밝혔다.
아카식DB는 벡터 DB(문서나 이미지의 의미를 숫자 벡터로 변환해 유사한 정보를 찾는 DB), 그래프 DB(사람·기업·제품 등 개체 간 관계를 저장·분석하는 DB), 관계형 DB(표 형태의 데이터를 체계적으로 관리하는 전통적인 DB)의 기능을 하나의 데이터베이스 관리 시스템(DBMS, Database Management System·데이터를 저장·관리·검색하는 소프트웨어)에서 통합 실행할 수 있도록 설계됐으며, 이를 기반으로 개발된 옴니RAG는 문서의 의미 정보와 개체 간 관계, 구조화된 데이터를 동시에 활용해 생성형 AI의 답변 정확도를 높인다.
최근 AI 에이전트는 기업이 보유한 방대한 문서와 전문 지식을 검색한 뒤 이를 바탕으로 답변을 생성하는 RAG 기술을 기반으로 빠르게 확산되고 있다. 그러나 실제 기업 데이터는 문서, 표, 개체 간 관계 등 다양한 형태로 분산돼 있어 AI가 이를 종합적으로 이해하고 활용하기 어렵다. 이 때문에 AI가 충분한 근거 없이 사실과 다른 답변을 생성하는 환각 문제가 발생하며, 이는 기업용 AI 확산을 가로막는 핵심 과제로 꼽혀 왔다.
기존 RAG는 사용자의 질문과 문서를 벡터로 변환한 뒤 의미적으로 유사한 문서를 검색해 대규모언어모델(LLM, Large Language Model·방대한 데이터를 학습해 인간과 유사한 언어를 생성하는 AI 모델)에 제공하는 방식이 일반적이다. 이러한 방식은 비정형 문서 검색에는 효과적이지만, 문서 속 개체 간 관계나 특정 기간·유형·범위와 같은 구조화된 조건을 함께 고려해야 하는 복합 질의에는 한계가 있었다.
예를 들어 "작년에 체결된 계약서 중 A사와 관련된 조항을 찾고, 해당 조항이 어떤 제품 공급 이슈와 연결되는지 설명해 달라"는 질의는 문서 의미를 찾는 벡터 검색, 개체 간 관계를 탐색하는 그래프 검색, 날짜와 유형을 필터링하는 관계형 질의가 동시에 필요하다. 기존 시스템에서는 이를 위해 여러 종류의 데이터베이스를 별도로 구축하고 응용프로그램 계층에서 결과를 결합해야 했기 때문에 관리 복잡성과 응답 지연이 발생했다.
연구팀은 이러한 문제를 해결하기 위해 벡터 유사도 검색, 그래프 탐색, 관계형 필터링을 하나의 질의와 실행 계획 안에서 통합 수행하는 옴니RAG를 제안했다. 옴니RAG는 문서의 의미 정보, 지식 그래프의 관계 정보, 표 형태 데이터의 구조적 조건을 동시에 활용해 보다 정확한 근거를 찾아내고 AI의 환각 현상을 크게 줄인다.
이를 지원하기 위해 개발된 아카식DB는 그래프 DB, 벡터 DB, 관계형 DB를 하나의 엔진으로 통합한 새로운 구조를 채택했다. 사용자는 벡터 검색, 그래프 탐색, 관계형 필터링이 결합된 복합 RAG 질의를 하나의 SQL/GQL* 질의문으로 표현할 수 있으며, 아카식DB는 이를 단일 실행 계획으로 최적화해 처리한다.
*SQL/GQL(구조화 질의어/그래프 질의어) : 데이터베이스에 저장된 정보를 검색하거나 수정하기 위한 명령 언어다. SQL은 표 형태의 데이터를 다루는 전통적인 언어이며, GQL은 사람·기업·제품 등 개체 간 연결 관계를 분석하기 위해 사용되는 그래프 데이터 전용 언어다.
이러한 통합 구조를 통해 아카식DB는 불필요한 중간 결과 생성과 데이터 이동을 최소화해 LLM의 토큰 사용량을 크게 줄이고 응답 지연시간도 단축한다. 실험 결과 기존 시스템에서 최대 21.3초가 소요되던 복합 검색 질의를 1초 이내로 처리해 최대 20배 이상의 성능 향상을 달성했다. 또한 옴니RAG는 기존 RAG 대비 답변 정확도를 최대 78% 향상시키는 것으로 나타났다. 이는 기업용 AI 에이전트의 핵심 과제인 환각 문제를 크게 완화할 수 있음을 보여준다.
김민수 교수는 "AI 에이전트가 기업의 방대한 데이터를 정확하게 이해하고 활용하기 위해서는 벡터, 그래프, 관계형 데이터를 하나의 시스템에서 통합 처리할 수 있는 데이터 인프라가 필수적"이라며 "아카식DB는 AI 에이전트 시대를 위한 차세대 데이터베이스 기술로, 국방·제조·금융·법률·과학기술 등 고도의 신뢰성이 요구되는 분야에서 핵심 데이터 인프라로 활용될 것으로 기대한다"고 말했다.
이번 연구에는 KAIST 전산학부 이건호 박사과정생이 제1저자로 참여하였으며, 연구 성과는 지난 6월 2일, 데이터베이스 분야 최고 권위 국제학술대회인 ACM SIGMOD 2026에서 데모 논문으로 발표되어, 학회 현장에서 글로벌 기업 및 연구자들로부터 뜨거운 관심을 받았다.
※ 논문명 : AkasicDB: Demonstrating Omni RAG with a Unified Vector-Graph-Relational DBMS, DOI: https://doi.org/10.1145/3788853.3801609
※ 저자 정보 : 이건호 (KAIST, 제1 저자), 박정호, 한동형 ((주)그래파이, 공동 저자) 김민수 교수 (KAIST, 교신저자)
※ 시연 동영상: https://www.youtube.com/watch?v=KD6MznZ61P4
거대한 AI서버 구축 전 성능 검증 가능한 ‘가상 AI 실험장’ 개발
챗GPT와 같은 거대언어모델(LLM·Large Language Model) 서비스를 운영하려면 수만 대 규모의 서버 인프라가 필요하다. 하지만 새로운 AI 반도체나 시스템 구조를 검증할 때마다 실제 장비를 구축하는 데에는 막대한 비용과 시간이 소요된다. 우리 대학 연구진은 실제 대규모 AI 서버를 구축하기 전에 컴퓨터 안에서 성능과 효율을 미리 검증할 수 있는 ‘가상 실험장’을 개발했다.
우리 대학은 전산학부 박종세 교수 연구팀이 개발한 거대언어모델(LLM) 서비스 인프라 시뮬레이터(simulator·가상 실험 소프트웨어) 연구가 컴퓨터 시스템 성능 분석 분야의 세계적 권위 학회인 ‘ISPASS 2026(IEEE International Symposium on Performance Analysis of Systems and Software)’에서 최우수 논문상을 수상했다고 29일 밝혔다.
연구팀이 개발한 ‘LLMServingSim 2.0’은 복잡한 AI 서비스 환경에서 다양한 하드웨어와 소프트웨어 조합을 가상으로 분석할 수 있는 시뮬레이션 플랫폼이다. 연구자와 개발자들은 값비싼 대규모 서버 인프라를 직접 구축하지 않고도 다양한 설계안을 자유롭게 실험하고 성능을 검증할 수 있다.
특히 이번 기술은 기존 그래픽처리장치(GPU·Graphics Processing Unit) 중심 환경을 넘어 차세대 AI 반도체로 주목받는 신경망처리장치(NPU·Neural Processing Unit)와 프로세싱 인 메모리(PIM·Processing-In-Memory, 메모리 내부에서 연산을 수행하는 반도체 기술) 등 다양한 하드웨어 환경을 지원한다는 점에서 주목된다.
즉 아직 상용화되지 않은 미래형 AI 반도체를 가상의 데이터센터 환경에서 미리 시험해볼 수 있는 기술이다. 이를 통해 특정 반도체를 적용했을 때 서비스 속도가 얼마나 향상되는지, 전력 소모는 얼마나 줄어드는지, 수만 대 규모의 서버 환경에서도 안정적으로 동작하는지 등을 컴퓨터 안에서 재현하고 분석할 수 있다.
또한 실제 AI 서비스 운영 과정에서 발생하는 데이터 처리, 요청 분배, 메모리 활용 등 복잡한 동작을 시스템 수준에서 재현해 현실에 가까운 성능 평가가 가능하다. 특히 여러 서버 자원을 분리·연결해 사용하는 분산형(disaggregated) 인프라 환경까지 분석할 수 있어 차세대 AI 데이터센터 연구에도 활용 가능성이 크다.
이번 시뮬레이터는 연구자뿐 아니라 LLM 서비스 기업과 AI 반도체 스타트업 등이 차세대 AI 인프라를 설계하고 최적화하는 데 폭넓게 활용될 것으로 기대된다. 새로운 AI 반도체나 서비스 구조를 실제 구축 전에 빠르게 검증할 수 있어 AI 인프라 개발 비용과 시간을 크게 줄일 수 있기 때문이다.
박종세 교수는 “AI 서비스 경쟁력은 모델 자체뿐 아니라 이를 안정적이고 효율적으로 운영하는 인프라 기술에서 결정된다”며 “이번 시뮬레이터가 연구자와 산업계가 차세대 AI 인프라를 더욱 빠르고 효율적으로 개발하는 데 중요한 기반이 되길 기대한다”고 말했다.
이번 연구는 전산학부 조재홍 석사과정, 최현민 석사과정 학생이 공동 1저자로 연구를 주도했으며, 연구팀은 지난 2024년 IISWC(IEEE International Symposium on Workload Characterization)에 이어 이번 ISPASS 2026에서도 최우수 논문상을 수상하며 AI 인프라 분야 연구 경쟁력을 다시 한번 입증했다.
※ 논문 제목: LLMServingSim 2.0: A Unified Simulator for Heterogeneous and Disaggregated LLM Serving Infrastructure, DOI: 10.1109/ISPASS69572.2026.00012
※ 오픈소스 링크: https://llmservingsim.ai/
한편 이번 연구는 과학기술정보통신부(MSIT), 정보통신기획평가원(IITP, No. RS-2024-00396013), 한국전자통신연구원(ETRI, No. RS-2025-02305453), SK하이닉스의 지원을 받아 수행됐다.
‘쥬라기 공원’ 공룡이 실제 걸어오는 듯한 소리 자동 구현 AI 기술 개발
영화 ‘쥬라기 공원’에서 거대한 공룡이 걸어오는 장면을 보면 사람들은 자연스럽게 땅이 울리는 듯한 묵직한 저주파음을 떠올린다. 이는 인간이 단순히 사물의 형태뿐 아니라 크기와 무게, 움직임의 속도 같은 물리적 특성까지 함께 고려해 소리를 예측하기 때문이다. 하지만 기존 영상-음향 생성 AI는 화면 속 사물의 형태나 장면 정보에 주로 의존해 소리를 생성해, 무게나 속도에 따라 달라지는 물리적 특성까지는 충분히 반영하지 못했다.
우리 대학은 전산학부 오태현 교수 연구팀이 POSTECH(총장 김성근), 소니 AI(Sony AI) 공동 연구진과 함께 영상 속 물리적 상황을 이해해 보다 현실감 있는 소리를 생성하는 인공지능(AI) 기술 ‘파바스(PAVAS·Physics-Aware Video-to-Audio Synthesis)’를 개발했다고 26일 밝혔다.
이번 기술의 핵심은 영상 속 물체의 질량과 속도 등 눈에 보이지 않는 물리 정보를 AI가 스스로 추론하도록 설계됐다는 점이다. 일반적인 영상에는 물체의 정확한 무게나 속도가 숫자로 제시되지 않지만, 연구팀은 AI가 주변 환경과 움직임의 맥락을 분석해 이를 추정하고, 그 결과를 소리 생성 과정에 반영하도록 했다.
즉, 단순히 ‘무엇이 보이는지’를 인식하는 수준을 넘어, ‘왜 이런 소리가 발생해야 하는지’에 대한 물리적 원인까지 AI가 이해하도록 만든 것이다.
기술 검증 결과, 연구팀의 AI는 물체 간 충돌이나 타격 등 물리적 상호작용이 발생하는 장면에서 실제 환경과 매우 유사한 소리를 생성했다. 특히 물체의 질량과 속도가 달라질 때 소리의 크기와 음색도 자연스럽게 변화하는 등 보다 현실감 있는 음향을 구현했다.
최근에는 영상과 오디오를 동시에 생성하는 생성형 AI 기술이 빠르게 발전하고 있다. 대표적으로 구글의 ‘비오(Veo) 3’, 바이트댄스의 ‘시댄스(Seedance) 2.0’ 등이 있다. 그러나 실제 영화·광고·게임 제작 현장에서는 새로운 영상을 생성하는 것보다 기존 영상에 장면에 맞는 효과음을 추가하거나 음향을 보완하는 후반 작업 수요가 훨씬 크다.
기존 상용 AI 모델들이 영상과 오디오를 함께 생성하는 데 집중했다면, 파바스는 영상 속 객체의 움직임과 충돌 특성을 분석해 장면과 정밀하게 맞아떨어지는 현실적인 효과음을 생성한다는 점에서 차별성을 가진다.
연구팀은 이번 기술이 ‘물리적으로 일관된 생성 AI(Physical AI)’ 분야의 새로운 가능성을 제시했다고 설명했다. 물리적으로 일관된 생성 AI는 단순히 그럴듯한 결과를 만드는 수준을 넘어, 현실 세계의 물리 법칙과 인과관계까지 이해하는 AI를 의미한다.
향후 이 기술은 콘텐츠 음향 제작 자동화는 물론, 증강현실(AR)·가상현실(VR) 콘텐츠, 메타버스, 로보틱스 시뮬레이션 등 다양한 분야에서 더욱 몰입감 있는 사용자 경험을 제공할 수 있을 것으로 기대된다.
오태현 교수는 “기존 생성 AI가 데이터와 모델 규모를 키우는 방식으로 발전해 왔다면, 이번 연구는 AI가 물리량과 인과관계를 직접 이해하도록 설계했다는 점에서 의미가 있다”며 “향후 텍스트·영상·음성 등 다양한 정보를 동시에 이해하고 처리하는 차세대 멀티모달 AI의 핵심 기반 기술로 확장될 수 있을 것”이라고 말했다.
이번 연구에는 POSTECH 오현빈 통합과정 학생이 제1저자로 참여했으며, KAIST 오태현 교수와 소니 AI의 타키다 유타(Yuta Takida), 토시미츠 우에사카(Toshimitsu Uesaka), 미츠후지 유키(Yuki Mitsufuji) 연구원이 공동 저자로 참여했다. 이번 연구는 컴퓨터 비전(영상 기반 인공지능 기술) 분야 세계 최고 권위 학술대회인 ‘CVPR 2026(Computer Vision and Pattern Recognition 2026)’에서 전체 논문 중 상위 1% 이내만 선정되는 오랄(Oral) 발표 논문으로 채택돼 연구의 우수성을 인정받았다. 발표는 오는 6월 6일 진행될 예정이다.
※ 논문명 : PAVAS: Physics-Aware Video-to-Audio Synthesis, DOI: https://arxiv.org/abs/2512.08282
또한 이번 연구는 과학기술정보통신부 기초연구사업 중견연구, 미래창조과학부 미래유망융합기술 파이오니어사업, 과학기술정보통신부 AGI 사업, KAIST 이노코어(InnoCORE) 사업의 지원을 받아 수행됐다.
“의사 만나기 전 AI와 먼저 대화”...KAIST, 정신과 초진 면담 지원 기술 개발
흔히 ‘정신과 문턱이 높다’고 말한다. 환자는 자신의 아픈 마음을 처음 꺼내놓는 과정에 부담을 느끼고, 의료진은 제한된 진료 시간 안에 환자의 방대한 과거력과 증상을 정확히 파악해야 한다. 국내 연구진이 정신과 진료의 첫 단계인 초진 면담 과정을 지원하는 인공지능(AI) 기술을 개발했다.
우리 대학은 전산학부 이의진 교수, 산업디자인학과 이탁연 교수 연구팀과 강남세브란스병원(원장 김용욱) 정신건강의학과 김은주 교수 연구팀이 공동으로 거대언어모델(Large Language Model, LLM) 기반의 정신과 초진 면담 지원 기술을 개발했다고 24일 밝혔다.
이번 연구는 환자가 의사를 만나기 전 AI와 먼저 대화하며 자신의 증상과 상태를 구조화하는 방식으로 진행됐다.
연구팀은 AI가 환자 응답에 따라 대화의 흐름을 조정할 수 있도록 시스템을 설계했다. AI는 환자의 답변을 정신건강의학 분야의 전문 의료 지식과 대조해 실시간으로 분석하고, 다음에 물어봐야 할 핵심 질문을 생성하는 방식이다. 특히 이 시스템은 단순한 문답을 넘어 공감 표현, 환자의 말을 다시 정리해주는 재진술, 모호한 내용을 짚어주는 명확화와 같은 실제 상담 기법을 적용했다. 환자가 보다 편안하게 자신의 상태를 이야기할 수 있도록 하기 위해서다.
성능 검증을 위해 진행한 1,440명의 가상 환자 실험 결과, 대부분 사례에서 단 30분 이내에 진료에 필요한 핵심 임상 정보를 효과적으로 확보하는 결과를 확인했다.
AI는 수집된 대화 내용을 바탕으로 증상과 잠재적 질환을 한눈에 보여주는 임상 대시보드(Clinical Dashboard)를 생성해 의료진에게 제공한다. 이를 통해 의사는 환자가 진료실에 들어오기 전 환자의 상태를 보다 체계적으로 파악할 수 있어, 실제 진료 시간에는 환자와의 심층 상담에 더욱 집중할 수 있게 됐다.
이번 연구의 핵심은 AI를 의사의 대체재가 아닌 ‘똑똑한 보조자’로 정의했다는 점이다. AI는 반복적이고 구조적인 정보 수집 과정을 담당하고, 의사는 이를 바탕으로 최종적인 진단과 처방을 내리는 협력 모델이다.
연구팀은 AI가 감정의 미묘한 변화를 파악하거나 민감한 주제를 다루는 데는 여전히 한계가 있다는 점을 분명히 하며, 최종 판단은 반드시 숙련된 전문 의료진이 수행해야 한다고 강조했다.
이의진 교수는 “AI가 초진 단계의 부담을 줄이면, 의료진은 환자와 더 깊이 있는 상담에 더욱 집중할 수 있다”며 “의료 현장에서 인간과 AI가 협력하는 새로운 진료 방식으로 발전할 가능성을 보여준다”고 밝혔다.
이번 연구에는 정유경 박사과정 학생이 제1저자로 참여했으며, 연구 결과는 인간-컴퓨터 상호작용 분야 최고 권위 학회인 ACM CHI 2026 (ACM Conference on Human Factors in Computing Systems)에 4월 13일 발표됐다.
※ 논문명: Toward Flexible Psychiatric History-Taking and Visualization: Exploring Clinician Perspectives with Large Language Models,DOI: https://dl.acm.org/doi/10.1145/3772318.3790970
※ 저자 정보: 정유경(KAIST, 1저자), Thu Hoang Anh Vo(KAIST, 2저자), 문현승(KAIST, 3저자), 최재영 (KAIST, 4저자), 오향경(강남세브란스병원, 5저자), 이어진(강남세브란스병원, 6저자), 김은주(강남세브란스병원, 7저자), 이탁연(KAIST, 교신저자), 이의진(KAIST, 교신저자)
이번 연구는 정보통신기획평가원 디지털 콜럼버스 프로젝트 사업 (과제명: 복합질병 사전 예측과 비대면 진료 확대 해결을 위한 디지털 혁신요소기술 개발) 의 지원을 받았다.
Wi-Fi 기반 국가 라디오맵 구축 기반 기술 개발...‘위치 주권’ 확보 신호탄
스마트폰의 와이파이 신호와 라디오 맵(신호 지문 지도)*을 결합해서 실내 위치를 정밀하게 파악할 수 있는 기술이 국내 연구진에 의해 개발됐다. 우리 대학 연구진이 8년간 개발한 이번 기술은 실종자 수색의 골든타임을 확보하고, 구글·애플 등 글로벌 빅테크 중심의 위치 서비스 구조를 바꿀 ‘위치 주권’ 기술로 평가된다.
*라디오맵: 특정 공간에서 수집되는 무선랜 신호와 해당 위치 정보를 연계해 구축한 데이터베이스로, 각 장소마다 고유한 신호 패턴을 기반으로 위치를 추정하는 기술임. 건물 단위로 구축되는 것이 일반적이나, 도시나 국가 단위로 확장될 경우 보다 정밀하고 범용적인 위치 서비스 구현 가능
우리 대학은 전산학부 한동수 교수 연구팀이 스마트폰의 무선랜(Wi-Fi) 신호와 실제 주소 정보를 결합해 전국 단위의 무선랜 라디오맵을 구축할 수 있는 원천 기술이자, 이를 기반으로 정밀 위치 인프라를 구현하는 핵심 기술을 개발했다고 2일 밝혔다. 이번 성과는 연구팀이 8년간 10여 건의 특허를 출원하며 완성도를 높여온 결과다.
이번 기술은 일상에서 스마트폰이 수집하는 무선랜(Wi-Fi) 신호를 활용한다는 점이 핵심이다. 별도의 대규모 장비나 추가 인프라 구축 없이도 전국 어디서나 정밀한 위치 정보를 제공할 수 있으며, GPS가 취약한 실내·지하·고층 건물 밀집 지역에서도 높은 정확도를 확보할 수 있다.
특히 이번 연구는 글로벌 플랫폼 기업들이 주도해 온 위치 서비스 구조에 도전하는 기술로 평가된다. 현재 전 세계 위치 데이터는 소수 빅테크 기업에 의해 축적·관리되고 있으며, 국내 역시 이들 플랫폼에 대한 의존도가 높은 상황이다.
무엇보다 이번 연구는 국가 단위 라디오맵을 우리 스스로 구축·관리할 수 있는 기반을 마련했다는 점에서 의미가 크다.
최근 ‘1:5,000 정밀지도(건물·도로 등을 상세하게 담은 국가 핵심 공간 데이터)’의 해외 반출 논란과 맞물려 데이터 주권 확보의 중요성이 커지는 가운데, 이번 기술은 글로벌 빅테크 의존도를 낮추고 ‘위치 주권’을 실현할 수 있는 대안으로 주목받고 있다.
다만 이러한 정밀 위치 서비스는 전국 단위 라디오맵 구축을 전제로 하며, 본 기술은 이를 단기간·저비용으로 실현할 수 있는 핵심 기반 기술이라는 점에서 의미가 크다.
연구팀은 스마트폰 앱 사용 과정에서 수집되는 무선랜 신호와 해당 위치의 실제 주소 정보를 자동으로 결합하는 방식을 제안했다. 이를 통해 특정 장소마다 고유한 ‘신호 패턴 지도(신호 지문)’를 구축할 수 있으며, 이러한 라디오맵이 충분히 축적될 경우 정밀 위치 인식이 가능해진다. 데이터가 축적될수록 라디오맵의 완성도가 높아지고 위치 정확도 또한 지속적으로 향상되는 구조다.
실제로 대전시에서 가스 검침 앱을 활용한 실증 결과, 아파트 가정마다 평균 30여 개의 무선랜 신호가 탐지됐으며, 도시 단위 라디오맵을 빠르게 구축할 수 있음을 확인했다. 이와 같이 구축된 라디오맵을 기반으로, 이 기술은 실종자 수색 등 긴급 구조 상황에서 수백 미터에 달하던 위치 오차를 크게 줄여 골든타임 확보에 기여할 것으로 기대된다. 또한 특정 장소에서만 결제가 가능하도록 하는 ‘위치 기반 인증’ 기술로 활용될 경우, 명의 도용이나 원격 결제 등 금융사고 예방에도 도움을 줄 수 있다.
아울러 자율주행, 로봇, 물류 등 미래 AI 산업에서도 정밀 위치 데이터는 핵심 인프라로 꼽힌다. 이번 성과는 관련 산업 전반의 경쟁력을 높이는 기반이 될 것으로 전망된다.
한동수 교수는 “이와 같은 국가 단위 라디오맵 구축은 특정 기업 단독으로 수행하기 어려운 만큼, 정부를 중심으로 통신사, 플랫폼 기업, 연구기관이 협력하는 민관 공동 인프라 구축이 필요하다. 위치 인프라는 단순한 편의 기술을 넘어 국가 데이터 주권과 직결되는 핵심 자산”이라며 “정부와 통신사, 플랫폼 기업이 협력해 독자적인 국가 위치 인프라를 구축해야 할 시점”이라고 말했다.
한편 이번 연구는 과학기술정보통신부와 한국연구재단, 그리고 소방청 및 산업기술기획평가원(KEIT) 연구비(RS-2025-02313957) 지원을 받아 수행됐다.
안테나 하나로 AI ‘설계도’ 훔쳐본다... 대응 기술도 제시
스마트폰 얼굴 인식부터 자율주행차까지, 인공지능(AI)은 ‘블랙박스’로 보호돼 왔다. 하지만 KAIST·국제 연구진이 벽 너머에서 AI의 ‘설계도’를 훔쳐볼 수 있는 새로운 보안 위협을 밝혀냈다. 대응 기술도 함께 제시했다. 향후 자율주행·의료·금융 등 다양한 분야에서 AI 보안을 강화하는 데 활용될 것으로 기대된다.
우리 대학 전산학부 한준 교수 연구팀은 싱가포르국립대(NUS), 중국 저장대(Zhejiang University)와의 공동 연구를 통해 소형 안테나만으로 원거리에서 인공지능(AI) 모델 구조를 탈취할 수 있는 공격 시스템 ‘모델스파이(ModelSpy)’를 개발했다고 31일 밝혔다.
이 기술은 마치 도청 장치처럼 인공지능이 작동할 때 발생하는 미세한 신호를 포착해 내부 구조를 분석하는 방식이다. 연구팀은 인공지능 연산을 담당하는 그래픽 처리 장치(GPU)에서 발생하는 전자기파에 주목했다.
AI가 복잡한 연산을 수행할 때 GPU에서는 미세한 전자기 신호가 발생하는데, 연구팀은 이 신호의 패턴을 분석해 모델의 층 구성과 세부 설정값을 복원하는 데 성공했다.
실험 결과, 최신 GPU 5종을 대상으로 벽 너머나 최대 6m 거리에서도 인공지능 모델 구조를 높은 정확도로 파악할 수 있었다. 특히 딥러닝 모델의 핵심 구조인 레이어를 최대 97.6%의 정확도로 추정했다.
이번 기술은 기존 해킹처럼 서버에 직접 침투하거나 악성코드를 설치할 필요 없이, 가방에 넣을 수 있는 소형 안테나만으로도 공격이 가능하다는 점에서 큰 보안 위협으로 평가된다.
연구팀은 이러한 기술이 악용될 경우 기업의 핵심 AI 자산이 외부로 유출될 수 있다고 보고, 전자기파 교란이나 연산 난독화 등 대응 기술도 함께 제시했다. 단순한 공격 시연을 넘어 현실적인 방어 방안을 제안했다는 점에서 책임 있는 보안 연구 사례로 평가된다.
한준 교수는 “이번 연구는 AI 시스템이 물리적 환경에서도 새로운 공격에 노출될 수 있음을 입증한 사례”라며 “자율주행이나 국가 기반 시설과 같은 중요한 AI 인프라를 보호하기 위해 하드웨어와 소프트웨어를 아우르는‘사이버-물리 보안’체계 구축이 중요하다”고 밝혔다.
이번 연구는 KAIST 전산학부 한준 교수가 공동 교신저자로 참여했으며, 컴퓨터 보안 분야 최고 권위 학술대회인 ‘NDSS(Network and Distributed System Security Symposium) 2026’에서 발표됐다. 또한 연구의 혁신성을 인정받아 최우수 논문상을 수상했다.
※ 논문명: Peering Inside the Black-Box: Long-Range and Scalable Model Architecture Snooping via GPU Electromagnetic Side-Channel,
논문 링크: https://www.ndss-symposium.org/ndss-paper/peering-inside-the-black-box-long-range-and-scalable-model-architecture-snooping-via-gpu-electromagnetic-side-channel/
GPU 덜쓰고 챗GPT 쓴다..카카오 AI 육성 프로젝트 대상 수상
지금의 챗GPT 등 대규모 언어모델(LLM) 서비스는 대부분 고가의 GPU 서버에 의존해 운영되고 있다. 이러한 구조는 서비스 규모가 커질수록 비용과 전력 소모가 급격히 증가하는 한계를 안고 있다. 우리 대학 연구진이 이러한 문제를 해결할 수 있는 차세대 AI 인프라 기술을 개발했다.
우리 대학은 전산학부 박종세 교수를 중심으로 한 애니브릿지(AnyBridge) AI 팀이 GPU에만 의존하지 않고, 다양한 AI 가속기를 통합해 LLM을 효율적으로 서비스할 수 있는 차세대 AI 인프라 소프트웨어를 개발했다고 30일 밝혔다. 해당 기술은 카카오가 주최한 ‘4대 과학기술원×카카오 AI 육성 프로젝트’에서 대상을 수상했다.
이번 프로젝트는 카카오와 KAIST, GIST, DGIST, UNIST 등 4대 과학기술원이 공동으로 추진한 산학 협력 프로그램으로, AI 기술을 기반으로 한 예비 창업팀들의 기술력과 사업성을 종합적으로 평가해 우수 팀을 선발했다. 대상 팀에는 총 2,000만 원의 상금과 함께 최대 3,500만 원 규모의 카카오클라우드 크레딧이 제공된다.
애니브릿지 AI는 KAIST 전산학부 박종세 교수(대표)를 중심으로 권영진 교수, 허재혁 교수가 함께 참여한 기술 창업팀으로, AI 시스템과 컴퓨터 아키텍처 분야에서 축적한 연구 성과를 바탕으로 실제 산업 현장에서 활용 가능한 기술 개발을 목표로 하고 있다. 또한 미국 실리콘밸리 AI 반도체 시스템 스타트업 삼바노바(SambaNova)의 공동창업자이자 스탠포드대 교수인 쿤레 올루코툰(Kunle Olukotun) 교수가 자문위원으로 참여해, 글로벌 시장을 염두에 둔 기술 및 사업 확장을 함께 추진하고 있다.
애니브릿지 팀은 현재 대부분의 LLM 서비스가 고가의 GPU 인프라에 의존하고 있어, 서비스 규모가 확대될수록 운영 비용과 전력 소모가 급격히 증가하는 구조적 한계를 안고 있다는 점에 주목했다. 연구진은 이러한 문제의 근본 원인이 특정 하드웨어 성능이 아니라, GPU 뿐만 아니라 NPU(AI 계산에 특화된 반도체), PIM(메모리 안에서 AI 연산을 처리하는 차세대 반도체) 등 다양한 AI 가속기를 효율적으로 연결·운용할 수 있는 시스템 소프트웨어 계층의 부재에 있다고 분석했다.
이에 애니브릿지 팀은 가속기 종류와 관계없이 동일한 인터페이스와 런타임 환경에서 LLM을 서비스할 수 있는 통합 소프트웨어 스택을 제안했다. 특히 GPU 중심으로 고착화된 기존 LLM 서빙 구조의 한계를 지적하고, 여러 종류의 AI 가속기를 하나의 시스템에서 함께 활용할 수 있는 ‘멀티 가속기 LLM 서빙 런타임 소프트웨어’를 핵심 기술로 제시해 높은 평가를 받았다.
이 기술을 통해 특정 벤더나 하드웨어에 종속되지 않으면서도, 작업 특성에 따라 가장 적합한 AI 가속기를 선택·조합할 수 있는 유연한 AI 인프라 구조 구현이 가능하다. 이는 LLM 서비스의 비용과 전력 소모를 줄이고, 확장성을 크게 높일 수 있는 장점으로 평가된다.
또한 애니브릿지 팀은 다년간 축적한 LLM 서빙 시스템 시뮬레이션 연구를 바탕으로, 실제 대규모 인프라를 구축하지 않고도 다양한 하드웨어·소프트웨어 설계 조합을 사전에 검증할 수 있는 연구 기반을 갖추고 있다. 이러한 점은 기술의 완성도와 산업적 실현 가능성을 동시에 보여줬다는 평가를 받았다.
박종세 KAIST 전산학부 교수는 “이번 수상은 GPU 중심 AI 인프라의 한계를 넘어, 다양한 AI 가속기를 통합하는 시스템 소프트웨어의 필요성을 인정받은 결과”라며 “연구 성과를 산업 현장과 창업으로 확장할 수 있었다는 점에서 의미가 크다”고 말했다. 이어 “산업 파트너들과의 협력을 통해 차세대 LLM 서빙 인프라 핵심 기술로 발전시켜 나가겠다”고 밝혔다.
이번 수상은 KAIST의 연구 성과가 논문을 넘어 차세대 AI 인프라 기술과 창업으로 이어지고 있음을 보여주는 사례로 평가된다. 애니브릿지 AI 팀은 향후 카카오 및 관련 산업 파트너들과의 협력을 통해 기술 고도화와 실증을 진행하고, 차세대 AI 인프라 소프트웨어 분야의 핵심 기술로 발전시켜 나갈 계획이다.
AI도 ‘경력직’ 시대...배운 지식 쉽게 가르친다
새 스마트폰을 바꿀 때마다 연락처와 사진을 처음부터 다시 옮겨야 한다면 얼마나 불편할까. 지금의 인공지능(AI) 모델들도 이와 비슷한 상황에 놓여 있다. 성능이 더 좋은 새로운 ChatGPT 같은 AI 모델이 등장할 때마다, 특정 분야의 지식을 갖추기 위해 막대한 데이터와 비용을 들여 다시 학습해야 했기 때문이다. 한국 연구진이 이러한 비효율을 해결할 수 있는 AI 모델 간 ‘지식 이식’ 기술을 개발했다.
우리 대학은 전산학부 김현우 교수 연구팀이 고려대학교(총장 김동원) 연구팀과 공동연구를 통해, 서로 다른 인공지능 모델 사이에서 학습된 지식을 효과적으로 ‘이식’할 수 있는 새로운 기술을 개발했다고 27일 밝혔다.
최근 인공지능 분야에서는 사진과 글을 함께 이해하는 시각–언어 모델(Vision-Language Model, VLM)이 빠르게 발전하고 있다. 이는 사용자가 사진을 보여주며 질문하면 설명을 해주는 ChatGPT와 같은 멀티모달 AI를 떠올리면 이해하기 쉽다. 이러한 모델들은 대규모 이미지와 언어 데이터를 사전 학습해, 적은 양의 데이터만으로도 새로운 분야에 비교적 빠르게 적응할 수 있다는 장점을 지닌다.
그러나 새로운 AI 모델이 나올 때마다 이러한 ‘적응 과정’을 처음부터 다시 수행해야 한다는 점이 큰 비효율로 지적돼 왔다. 기존의 적응 기법들 역시 모델 구조가 조금만 달라져도 그대로 활용하기 어렵거나, 여러 모델을 동시에 사용해야 해 메모리와 연산 비용이 크게 증가하는 한계를 안고 있었다.
연구팀은 이러한 문제를 해결하기 위해 모델의 구조나 크기에 상관없이 학습된 지식을 재사용할 수 있는 전이 가능한 적응 기법(Transferable adaptation)인 ‘TransMiter’를 제안했다. 이 기술의 핵심은 한 AI가 학습하며 쌓은 ‘적응 경험’을 다른 AI 모델로 직접 옮기는 것이다.
연구진 기술은 AI의 복잡한 내부 구조를 뜯어고치지 않고, 예측 결과(output)만 보고 배운 요령을 다른 AI에게 전해주는 방식이다. 서로 생김새가 다른 AI 모델이라도 같은 질문에 내놓은 답변을 기준으로 정리해 주면, 한 AI가 익힌 노하우를 다른 AI도 바로 활용할 수 있다. 그래서 복잡하고 시간이 많이 드는 학습 과정을 다시 거칠 필요가 없고, 속도도 거의 느려지지 않는다.
이번 연구는 그동안 모델 구조나 크기가 다르면 재사용이 거의 불가능하다고 여겨졌던 AI의 적응 지식을 모델 종류에 상관없이 정밀하게 이식할 수 있음을 처음으로 입증했다는 점에서 의미가 크다. 이를 통해 반복적인 학습 비용을 줄일 수 있을 뿐 아니라, 필요한 분야에 맞춰 거대언어모델을 실시간으로 업데이트하는 이른바 ‘지식 패치(patch)’ 기술로의 활용도 기대된다.
김현우 교수는 “이번 연구를 확장하면, 빠르게 발전하는 초거대언어모델이 등장할 때마다 반복적으로 수행해야 했던 후학습(post-training)의 비용을 크게 줄일 수 있다”며, “특정 분야의 전문 지식을 손쉽게 추가하는 ‘모델 패치’가 가능해질 것”이라고 설명했다.
이번 연구에는 KAIST 전산학부 송태훈 석사과정 학생, 이상혁 박사후연구원, 고려대학교 박지환 박사과정 학생이 공동 저자로 참여했으며, 김현우 교수가 교신저자를 맡았다. 연구 결과는 인공지능 분야 최고 권위의 국제 학술대회인 AAAI 2026(Association for the Advancement of Artificial Intelligence)에 구두 발표(25년 기준 채택률 4.6%)로 채택돼, 1월 25일 발표됐다.
※ 논문명: Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization. DOI : https://doi.org/10.48550/arXiv.2508.08604
한편, 김현우 교수 연구실은 이번 논문을 포함해 구글 클라우드 AI와 공동 진행한 문서내의 테이블 이해를 고도화한 기술인 TabFlash 포함하여 해당 학회에 총 3편의 논문을 발표했다.
'이 생선 어디서 왔지?'...세계가 인정한 수산물 이력추적 기술 확보
우리가 마트에서 수산물을 살 때, 이 생선이 어디서 잡혔고 어떤 과정을 거쳐 내 식탁에 올랐는지 궁금했던 적이 있을 것이다. 하지만 복잡한 유통 과정으로 그 경로를 투명하게 확인하기 어려웠다. 우리 대학 연구진이 이러한 문제를 해결하고, 전 세계 어디서나 통용되는 국제 기준으로 수산물의 이동 경로를 한눈에 확인할 수 있는 디지털 기술을 개발했다.
우리 대학은 KAIST 오토아이디랩 부산혁신연구소 김대영 소장(전산학부 교수)이 개발한 GS1 국제표준 기반 디지털전환 솔루션 ‘올리오패스(OLIOPASS)’가 글로벌 수산물 이력추적 협의체인 GDST(Global Dialogue on Seafood Traceability)의 까다로운 성능 검증을 통과해, 국내 최초로 ‘GDST 호환 솔루션(Capable Solution)’ 인증을 획득했다고 19일 밝혔다.
이번 GDST 인증을 받은 기술은 전 세계에서 단 13개에 불과하다. 이 가운데 생산–가공–유통–판매에 이르는 전 과정을 빠짐없이 관리하는 ‘전 구간(Full Chain)’ 이력추적 기술을 지원하는 곳은 KAIST를 포함해 전 세계 7곳뿐이다.
GDST는 2015년 세계경제포럼(WEF)의 제안으로 설립된 국제 기구로, 수산물이 이동하는 모든 과정의 정보를 전 세계가 합의한 국제표준(GS1)에 따라 디지털로 기록하고 공유하도록 돕는다. 이는 전 세계가 함께 사용하는 ‘공급망 공통 언어’를 만드는 작업에 비유할 수 있다.
GDST는 수산물 이동 과정에서 반드시 기록해야 할 핵심 데이터(KDEs)와 언제·어디서·무엇이 이동했는지를 정의한 중요 사건(CTEs)을 국제 기준으로 정해, 수산물 이력 정보의 신뢰성을 높이는 글로벌 표준 체계다.
최근 미국과 유럽의 주요 식품유통 기업들이 GDST 기준 충족을 요구면서, 해당 기준은 글로벌 시장 진출을 위한 사실상의 필수 요건으로 자리 잡고 있다. KAIST는 2019년부터 GDST 창립 멤버로 참여해 수산물 이력추적 모델과 시스템 간 정보 연동(Interoperability) 설계에 핵심적인 역할을 해왔다.
특히 미국 식품의약국(FDA)이 2028년 7월부터 식품 이력추적 의무화(FSMA 204)를 예고한 상황에서, 이번 인증은 국내 기업들이 미국 등 글로벌 시장 규제를 충족할 수 있는 기술적 해법을 확보했다는 점에서 의미가 크다.
지난 11월 5일 인증을 받은 OLIOPASS는 KAIST의 IoT 기술과 국제표준(GS1 EPCIS 2.0, GS1 Digital Link)을 결합한 디지털 이력추적 플랫폼으로, 다양한 제품과 자산의 이동 정보를 표준화된 언어로 기록·공유하고 블록체인 기술로 위·변조를 원천 차단한다. 기업 간 시스템이 달라도 이력 데이터는 원활하게 연동된다.
또한 OLIOPASS는 AI 활용이 가능한 ‘AI-ready 데이터’ 인프라로 설계돼 대형 멀티모달 모델, AI 에이전트, 지식그래프, 온톨로지 등 차세대 AI 기술을 손쉽게 적용할 수 있다. 이를 통해 단순 이력관리를 넘어 디지털·AI 전환을 동시에 지원하는 플랫폼으로 활용된다.
김대영 KAIST 오토아이디랩 부산혁신연구소장은 “이번 인증은 글로벌 공급망 전반에서 신뢰 가능한 데이터 기술 역량을 국제적으로 인정받은 것”이라며 “OLIOPASS를 수산·식품을 넘어 의약품, 물류, 국방, 스마트시티 등 다양한 분야로 확산시켜 KAIST 기술이 세계가 함께 쓰는 플랫폼으로 성장하도록 하겠다”고 말했다.
※관련 링크: https://thegdst.org/verified-gdst-capable-solutions/
영상 속 1등이 어디죠? ‘딱 그 순간’을 찾아내는 AI 기술 세계 1위
‘카메라가 다른 곳을 비추는 사이 사라진 물체는 무엇 인가요?’라는 복잡한 질문이 나오면 AI는 많은 경우 영상 속 실제 상황을 보고 판단하는 것이 아니라, 언어 패턴에 의존해 ‘그럴듯한 답’을 추측하는 문제가 있다. 우리 대학 연구진은 이 한계를 해결하기 위해 영상 속 ‘딱 중요한 순간(Trigger moment)’을 AI가 스스로 찾아내도록 하는 기술을 개발했고, 이 기술로 국제 AI 대회에서 우수성을 입증했다.
우리 대학은 전산학부 윤성의 교수 연구팀이 이화여대 노준혁 교수 연구팀과 공동 연구를 통해, 세계적 권위의 컴퓨터 비전 학회 ICCV 2025에서 열린 Perception Test Challenge의 영상 근거 기반 질의응답(Grounded Video Question Answering) 트랙에서 1위를 차지했다고 28일 밝혔다.
이번 ICCV 2025에서 열린 인지 테스트 대회(Perception Test Challenge)는 구글 딥마인드(Google DeepMind)가 주관하여 총 상금 50,000 유로(한화 약 8,300만원)가 걸린 대회로, 영상·음성·텍스트 등 다양한 데이터를 종합적으로 이해하는 멀티모달 AI의 인지 및 추론 능력을 평가한다. 특히 언어 중심 편향을 벗어나 실제 영상 근거를 바탕으로 판단하는 능력이 핵심 평가 요소다.
우리 대학 연구팀은 영상 전체를 무작정 분석하는 기존 방식과 달리, AI가 정답을 위해 꼭 필요한 핵심 장면(Trigger moment)을 먼저 찾아내도록 만드는 새로운 기술을 개발했다. 쉽게 말하면, “이 질문에 답하려면 이 장면이 결정적이야!”를 AI가 스스로 찾아내도록 설계한 기술이다.
이 프레임워크를 연구팀은 CORTEX(Chain-of-Reasoning for Trigger Moment Extraction)라고 부른다.
연구팀의 시스템은 서로 다른 기능을 수행하는 세 모델이 순차적으로 작동하는 3단계 구조로 구성된다. 먼저 추론 AI(Gemini 2.5 Pro)가 질문에 답하기 위해 어느 순간을 봐야 하는지 사고하고 딱 그 순간(Trigger moment) 후보를 찾는다. 다음으로 객체 위치 찾기 모델(Grounding 모델, Molmo-7B)이 해당 순간 화면 속 사람·차·사물의 정확한 위치(좌표)를 파악한다. 마지막으로 추적 모델(Tracking 모델, SAM2)이 선택된 한 장면을 기준으로 앞뒤 시간대의 객체 움직임을 정밀하게 추적해 오류를 줄인다.
즉, ‘핵심 장면 한 컷을 정확히 찍고, 그 장면을 중심으로 정답 근거를 추적하는 방식’덕분에 영상 초반 오판이나 가려짐 같은 문제도 크게 줄었다.
총 23개 팀이 참여한 영상 근거 기반 질의응답(Grounded VideoQA) 트랙에서 KAIST팀 SGVR Lab(Scalable Graphics, Vision & Robotics Lab)은 ‘고차 추적 정확도(HOTA, Higher Order Tracking Accuracy)’지표에서 0.4968점을 기록하며 2등 미국 콜럼비아대의 0.4304점을 압도적인 점수 차로 상회하며 1위를 차지했다. 이는 전년도 우승 기록 0.2704점보다도 약 두 배에 가까운 성과다.
이 기술은 실생활에서도 넓게 쓰일 수 있다. 자율주행차는 사고 위험이 있는 순간을 정확히 보고, 로봇은 주변 상황을 더 똑똑하게 이해한다. 또 보안·감시 시스템은 중요한 장면을 빠르게 찾아내고, 미디어 분석에서는 사람이나 사물의 행동을 시간 순서대로 정확히 추적할 수 있다.
즉, AI가 “영상 속 실제 근거”를 보고 판단할 수 있도록 만드는 핵심 기술이다. 특히 영상 속 객체가 시간에 따라 어떻게 행동하는지 정확히 짚어내는 능력은 향후 AI의 실제 현장 적용을 크게 확장할 것으로 기대된다.
이번 연구는 ICCV 2025, the 3rd Perception Test Challenge 학회에서 10월 19일자 발표하였다.
이 성과는 과학기술정보통신부 기초연구사업 중견연구와 SW스타랩 사업 ‘오픈 월드 로봇 서비스를 위한 불특정 환경 인지·행동·상호작용 알고리즘 개발’ 및 AGI 사업 ‘체화형 AGI를 위한 현실 세계 구축과 인지 에이전트 기반 이원 역량 접근법’ 과제의 지원을 받아 수행되었다.