AI 환각 줄이고 정확도 78% 높였다... 차세대 데이터베이스 기술 개발
기업의 방대한 데이터를 읽고 이해하는 AI 에이전트의 가장 큰 약점은 ‘환각(Hallucination·사실과 다른 정보를 그럴듯하게 생성하는 현상)'이다. 우리 대학 연구진이 문서와 데이터, 개체 간 관계를 한 번에 이해할 수 있는 차세대 데이터베이스 기술을 개발해 AI 답변 정확도를 최대 78% 높이고 처리 속도는 최대 20배 향상시키며 기업용 AI 상용화의 핵심 난제 해결에 나섰다.
우리 대학은 전산학부 김민수 교수 연구팀이 교원창업기업인 (주)그래파이와 협력하여 벡터 DB, 그래프 DB, 관계형 DB 기능을 하나의 데이터베이스 관리 시스템(DBMS)에 통합한 차세대 데이터베이스 기술 '아카식DB(AkasicDB)'와 이를 기반으로 한 새로운 검색증강생성(RAG, Retrieval-Augmented Generation) 기법 '옴니RAG(Omni RAG)'를 개발했다고 19일 밝혔다.
아카식DB는 벡터 DB(문서나 이미지의 의미를 숫자 벡터로 변환해 유사한 정보를 찾는 DB), 그래프 DB(사람·기업·제품 등 개체 간 관계를 저장·분석하는 DB), 관계형 DB(표 형태의 데이터를 체계적으로 관리하는 전통적인 DB)의 기능을 하나의 데이터베이스 관리 시스템(DBMS, Database Management System·데이터를 저장·관리·검색하는 소프트웨어)에서 통합 실행할 수 있도록 설계됐으며, 이를 기반으로 개발된 옴니RAG는 문서의 의미 정보와 개체 간 관계, 구조화된 데이터를 동시에 활용해 생성형 AI의 답변 정확도를 높인다.
최근 AI 에이전트는 기업이 보유한 방대한 문서와 전문 지식을 검색한 뒤 이를 바탕으로 답변을 생성하는 RAG 기술을 기반으로 빠르게 확산되고 있다. 그러나 실제 기업 데이터는 문서, 표, 개체 간 관계 등 다양한 형태로 분산돼 있어 AI가 이를 종합적으로 이해하고 활용하기 어렵다. 이 때문에 AI가 충분한 근거 없이 사실과 다른 답변을 생성하는 환각 문제가 발생하며, 이는 기업용 AI 확산을 가로막는 핵심 과제로 꼽혀 왔다.
기존 RAG는 사용자의 질문과 문서를 벡터로 변환한 뒤 의미적으로 유사한 문서를 검색해 대규모언어모델(LLM, Large Language Model·방대한 데이터를 학습해 인간과 유사한 언어를 생성하는 AI 모델)에 제공하는 방식이 일반적이다. 이러한 방식은 비정형 문서 검색에는 효과적이지만, 문서 속 개체 간 관계나 특정 기간·유형·범위와 같은 구조화된 조건을 함께 고려해야 하는 복합 질의에는 한계가 있었다.
예를 들어 "작년에 체결된 계약서 중 A사와 관련된 조항을 찾고, 해당 조항이 어떤 제품 공급 이슈와 연결되는지 설명해 달라"는 질의는 문서 의미를 찾는 벡터 검색, 개체 간 관계를 탐색하는 그래프 검색, 날짜와 유형을 필터링하는 관계형 질의가 동시에 필요하다. 기존 시스템에서는 이를 위해 여러 종류의 데이터베이스를 별도로 구축하고 응용프로그램 계층에서 결과를 결합해야 했기 때문에 관리 복잡성과 응답 지연이 발생했다.
연구팀은 이러한 문제를 해결하기 위해 벡터 유사도 검색, 그래프 탐색, 관계형 필터링을 하나의 질의와 실행 계획 안에서 통합 수행하는 옴니RAG를 제안했다. 옴니RAG는 문서의 의미 정보, 지식 그래프의 관계 정보, 표 형태 데이터의 구조적 조건을 동시에 활용해 보다 정확한 근거를 찾아내고 AI의 환각 현상을 크게 줄인다.
이를 지원하기 위해 개발된 아카식DB는 그래프 DB, 벡터 DB, 관계형 DB를 하나의 엔진으로 통합한 새로운 구조를 채택했다. 사용자는 벡터 검색, 그래프 탐색, 관계형 필터링이 결합된 복합 RAG 질의를 하나의 SQL/GQL* 질의문으로 표현할 수 있으며, 아카식DB는 이를 단일 실행 계획으로 최적화해 처리한다.
*SQL/GQL(구조화 질의어/그래프 질의어) : 데이터베이스에 저장된 정보를 검색하거나 수정하기 위한 명령 언어다. SQL은 표 형태의 데이터를 다루는 전통적인 언어이며, GQL은 사람·기업·제품 등 개체 간 연결 관계를 분석하기 위해 사용되는 그래프 데이터 전용 언어다.
이러한 통합 구조를 통해 아카식DB는 불필요한 중간 결과 생성과 데이터 이동을 최소화해 LLM의 토큰 사용량을 크게 줄이고 응답 지연시간도 단축한다. 실험 결과 기존 시스템에서 최대 21.3초가 소요되던 복합 검색 질의를 1초 이내로 처리해 최대 20배 이상의 성능 향상을 달성했다. 또한 옴니RAG는 기존 RAG 대비 답변 정확도를 최대 78% 향상시키는 것으로 나타났다. 이는 기업용 AI 에이전트의 핵심 과제인 환각 문제를 크게 완화할 수 있음을 보여준다.
김민수 교수는 "AI 에이전트가 기업의 방대한 데이터를 정확하게 이해하고 활용하기 위해서는 벡터, 그래프, 관계형 데이터를 하나의 시스템에서 통합 처리할 수 있는 데이터 인프라가 필수적"이라며 "아카식DB는 AI 에이전트 시대를 위한 차세대 데이터베이스 기술로, 국방·제조·금융·법률·과학기술 등 고도의 신뢰성이 요구되는 분야에서 핵심 데이터 인프라로 활용될 것으로 기대한다"고 말했다.
이번 연구에는 KAIST 전산학부 이건호 박사과정생이 제1저자로 참여하였으며, 연구 성과는 지난 6월 2일, 데이터베이스 분야 최고 권위 국제학술대회인 ACM SIGMOD 2026에서 데모 논문으로 발표되어, 학회 현장에서 글로벌 기업 및 연구자들로부터 뜨거운 관심을 받았다.
※ 논문명 : AkasicDB: Demonstrating Omni RAG with a Unified Vector-Graph-Relational DBMS, DOI: https://doi.org/10.1145/3788853.3801609
※ 저자 정보 : 이건호 (KAIST, 제1 저자), 박정호, 한동형 ((주)그래파이, 공동 저자) 김민수 교수 (KAIST, 교신저자)
※ 시연 동영상: https://www.youtube.com/watch?v=KD6MznZ61P4
AI ‘시간 오류’ 잡았다...의료·법률 분야 신뢰성 높인다
“지난달 취임한 장관이 누구냐”는 질문에 챗GPT가 1년 전 인물을 답한다면 어떨까. 최신 정보를 제대로 반영하지 못하는 AI의 한계를 보여주는 사례다. 우리 대학 연구진이 변화하는 현실 정보를 자동으로 반영하면서도, 겉으로는 맞아 보이는 ‘시간 오류’까지 잡아내는 새로운 평가 기술을 개발했다. AI 신뢰성을 획기적으로 높일 수 있을 것으로 기대된다.
우리 대학은 전기및전자공학부 황의종 교수 연구팀이 마이크로소프트연구소(Microsoft Research)와 공동연구를 통해, 시간 데이터베이스 기술을 활용해 거대언어모델(LLM)의 시간 추론 능력을 자동으로 평가·진단하는 시스템을 개발했다고 14일 밝혔다.
인공지능이 사용자의 신뢰를 얻기 위해서는 시시각각 변화하는 현실 정보를 정확히 이해하는 능력이 필수적이다. 그러나 기존 평가 방식은 정답 일치 여부만을 확인하거나 복잡한 시간 관계를 충분히 반영하지 못해, 실제 환경에서 발생하는 다양한 질문 상황을 제대로 평가하기 어렵다는 한계가 있었다.
연구팀은 이를 해결하기 위해 지난 40여 년간 검증되어 온 ‘시간 데이터베이스(Temporal Database)’ 설계 이론을 인공지능 평가에 최초로 도입했다. 데이터의 시간적 흐름과 관계 구조를 활용해, 사람이 평가용 문제를 일일이 작성하지 않아도 데이터베이스만으로 13가지 유형의 복잡한 시간 기반 문제가 자동으로 생성되도록 했다는 점이 핵심이다.
특히 이번 기술은 사람이 문제를 직접 만들던 기존 방식에서 벗어나, 데이터를 기반으로 평가 문제가 자동 생성되는 방식으로 전환했다는 점에서 가장 큰 혁신으로 평가된다. 또한 데이터베이스를 기준으로 문제 생성부터 정답 도출, 검증까지 전 과정을 자동화해, 기존처럼 문제를 일일이 수정할 필요 없이 유지보수 부담을 획기적으로 줄일 수 있다.
현실 정보가 변경될 경우에는 해당 내용을 데이터베이스에 업데이트하면 평가 문제와 정답, 검증 기준이 자동으로 반영된다. 다만 최신 정보의 입력 자체는 외부 데이터나 관리자를 통해 이루어지며, 본 기술은 이러한 데이터가 갱신된 이후 평가 전반을 자동으로 수행하는 구조다.
또한 연구팀은 단순히 최종 답이 맞는지 틀리는지 여부를 판단하는 기존 방식에서 나아가, 답변 과정에서 제시된 날짜나 기간의 논리적 타당성까지 검증하는 지표를 새롭게 도입했다. 이를 통해 겉보기에는 정답처럼 보이지만 시간적 근거가 잘못된 ‘시간 환각(Temporal Hallucination)’ 현상을 기존 대비 평균 21.7% 더 정확하게 탐지하는 성과를 보였다.
이 기술을 적용하면 정보 변경 시 데이터베이스만 갱신하면 되기 때문에 평가 유지 비용을 크게 절감할 수 있으며, 입력 데이터량 역시 기존 대비 평균 51% 줄어드는 효과를 보였다.
황의종 교수는 “이번 연구는 고전적인 데이터베이스 설계 이론이 최신 인공지능의 신뢰성 문제를 해결하는 데 중요한 역할을 할 수 있음을 보여준 사례”라며, “방대한 전문 데이터를 평가 자원으로 전환함으로써 향후 의료·법률 등 다양한 분야의 인공지능 성능 검증에 실질적인 기반이 될 것으로 기대한다”고 말했다.
이번 연구는 KAIST 김소연 박사과정이 제1저자로 참여했으며, 마이크로소프트연구소의 진동 왕(Jindong Wang, 現 윌리엄 앤 메리 대학교)과 싱 시에(Xing Xie) 연구원이 공동 저자로 참여했다. 연구 결과는 오는 4월 인공지능 분야 최고 권위 학술대회인 ‘ICLR 2026’에서 발표될 예정이다.
※ 논문명: Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models, 논문 링크: https://arxiv.org/abs/2508.02045
한편, 이번 연구는 마이크로소프트연구소, 한국연구재단, 정보통신기획평가원(IITP) 글로벌 AI 프론티어랩 과제(RS-2024-00469482, RS-2024-00509258)의 지원을 받아 수행됐다.
세계 최고 DB 통합기술로 진짜 똑똑한 AI 에이전트 현실로
기업들은 오랫동안 데이터를 관리하는 데 관계형 데이터베이스(DB)를 써왔다. 하지만 거대 AI 모델 활용이 늘면서, 이제는 그래프 DB와의 통합 운영이 요구된다. 그러나 이 과정에서 비용 부담, 데이터 불일치, 복합 질의 처리의 어려움 같은 한계가 드러난다. 우리 연구진은 이 같은 문제를 단번에 해결할 수 있는 차세대 그래프-관계형 DB 시스템 개발에 성공했으며, 곧바로 산업 현장에 적용될 것으로 기대된다. 이 기술이 적용되면 AI는 단순 검색을 넘어 복잡한 연결 관계까지 실시간으로 추론할 수 있어, 한층 똑똑한 AI 서비스 구현이 가능해질 것이다.
우리 대학 전산학부 김민수 교수 연구팀이 관계형 DB와 그래프 DB를 완전 통합하여 그래프-관계형 질의를 한층 효율적으로 실행할 수 있는 새로운 DB 시스템 ‘키마이라(이하 Chimera)’를 개발했다고 8일 밝혔다. Chimera는 국제 성능 표준 벤치마크에서 기존 시스템 대비 최소 4배에서 최대 280배 빠른 질의 처리 성능을 입증하며 세계 최고 수준을 기록했다.
기존 관계형 DB와 달리, 그래프 DB는 데이터를 정점(노드)과 간선(연결선)으로 표현하는 구조를 가지고 있어 사람·사건·장소·시간처럼 복잡하게 얽힌 정보를 분석하고 추론하는 데 강점을 지닌다. 이러한 특징 덕분에 최근에는 AI 에이전트, SNS, 금융, 전자상거래 등 다양한 분야에서 활용이 빠르게 확산되고 있다.
이와 함께 관계형 DB와 그래프 DB 간의 복합 질의 처리 수요가 커지면서, 관계형 질의 언어(SQL)에 그래프 질의 기능을 확장한 신규 표준 언어 ‘SQL/PGQ’도 제안됐다.
SQL/PGQ는 기존 데이터베이스 언어(SQL)에 그래프 탐색 기능을 추가한 새로운 표준 언어로, 표(테이블) 형태의 데이터와 사람·사건·장소 등 연결 관계 정보를 한 번에 질의(검색)할 수 있도록 설계됐다. 이를 활용하면 ‘이 사람의 친구의 친구가 어느 회사에 다니는가’와 같은 복잡한 관계도 기존보다 훨씬 간단하게 검색할 수 있다.
문제는 지금까지의 접근 방식이 그래프 탐색을 억지로 조인 연산으로 흉내 내거나, 메모리에 그래프 뷰(view)를 미리 구성해 처리하는 방법에 의존했다는 점이다. 전자의 경우 탐색 단계가 깊어질수록 성능이 급격히 떨어지고, 후자의 경우 데이터 규모가 조금만 커져도 메모리 부족으로 실행이 실패한다. 또 원본 데이터 변경이 뷰에 즉시 반영되지 않아 데이터 최신성이 떨어지고, 관계형 결과와 그래프 결과를 따로 결합해야 하는 비효율이 뒤따랐다.
우리 대학 연구팀이 개발한 ‘Chimera(키마이라)’는 이러한 한계를 근본적으로 해결했다. 연구팀은 데이터베이스의 저장 계층과 질의 처리 계층을 모두 새롭게 설계했다.
연구팀은 우선 그래프 전용 저장소와 관계형 데이터 저장소를 함께 운영하는 ‘듀얼 스토어 구조’를 도입했다. 여기에 그래프 탐색과 관계형 연산을 동시에 처리하는 ‘탐색-조인 연산자’를 적용해, 복잡한 연산을 단일 체계에서 효율적으로 실행할 수 있도록 했다. 덕분에 Chimera는 데이터 저장부터 질의 처리까지 전 과정을 하나로 통합한 세계 최초의 그래프-관계형 DB 시스템으로 자리매김했다.
그 결과, 국제 성능 표준 벤치마크인 ‘LDBC Social Network Benchmark(SNB)’에서 기존 시스템 대비 최소 4배에서 최대 280배 빠른 성능을 기록하며 세계 최고 수준을 입증했다.
그래프 데이터의 규모가 아무리 커져도 메모리 부족으로 인한 질의 실패가 발생하지 않으며, 뷰를 사용하지 않기 때문에 데이터 최신성 측면에서도 지연 문제가 없다.
김민수 교수는 “데이터 간 연결 관계가 갈수록 복잡해지는 만큼, 그래프와 관계형 DB를 아우르는 통합 기술의 필요성이 커지고 있다”며 “Chimera는 이 문제를 근본적으로 해결한 기술로, 앞으로 AI 에이전트, 금융, 전자상거래 등 다양한 산업에서 널리 쓰일 것으로 기대한다”고 밝혔다.
이번 연구에는 전산학부 이건호 박사과정이 제1저자로, 김민수 교수의 창업기업 ㈜그래파이의 박정호 엔지니어가 제2저자로 참여했으며, 김 교수가 교신저자를 맡았다.
연구 성과는 지난 9월 1일, 세계적 권위의 데이터베이스 분야 국제학술대회 VLDB에서 발표됐다. 특히 새롭게 개발된 Chimera 기술은 ㈜그래파이가 출시 예정인 벡터-그래프-관계형 DB 시스템 ‘AkasicDB’에 적용돼, ‘RAG 기반 고성능 AI 에이전트(검색 능력을 갖춘 똑똑한 AI 비서)’ 구현을 위한 핵심 기술로 즉각적인 산업적 파급력이 기대된다.
※ 논문제목: Chimera: A System Design of Dual Storage and Traversal-Join Unified Query Processing for SQL/PGQ
※ DOI: https://dl.acm.org/doi/10.14778/3705829.3705845
한편, 이번 연구는 과기정통부 IITP SW스타랩과 한국연구재단 중견과제의 지원을 받아 수행됐다.
세계 최대 규모 암 데이터베이스 구축하다
디지털 암 정보 축적의 시대에는 데이터 생산을 넘어서, 데이터의 수집 및 관리 방법을 정립하고 거대 규모의 빅 데이터를 운용하는 것이 가장 큰 경쟁력이 될 수 있다. 전략적으로는 정밀 임상 정보와 연계할 수 있는 국내 생산 데이터와 다양성에 대한 이해를 도모할 수 있는 대규모 국제 데이터를 모두 수집해 통합하는 것은 매우 중요한 과제다.
우리 대학 의과학대학원 박종은 교수, 바이오및뇌공학과 최정균 교수 공동 연구팀(제1 저자: 강준호 박사, 이준형 박사)이 세계 최대 규모의 암 조직 단일세포 및 공간전사체* 데이터베이스를 구성하고, 이를 바탕으로 삼성서울병원 이세훈 교수 연구팀과 함께 면역 치료의 예후 예측에 중요한 세포 생태계 타입을 보고했다고 22일 밝혔다.
*단일세포 및 공간전사체: 모든 유전자의 발현 양상을 개별 세포 단위에서 혹은 3차원 조직 구조상에서 분석한 데이터
암은 우리 몸 안에서 스스로 진화하는 특성을 가지고 있어 암 조직 내의 세포 생태계를 구성하는 각 세포의 이질성과 이들의 상호작용을 파악하는 것이 가장 중요하다.
최근 발달하고 있는 단일세포 및 공간 전사체는 미세환경을 구성하는 세포들과 그들의 3차원적 배열 및 상호작용을 정량적으로 측정 및 표현한다는 점에서 미세환경의 이질성 개념을 생태계 수준으로 확장해 디지털 정보의 형태로 저장 및 분석할 수 있게 한다.
연구팀은 암세포 생태계 타입들을 전 암종(pan-cancer) 수준에서 규명하기 위해 약 1,000개의 암 환자 조직 샘플, 500여 명의 정상 조직 샘플에 대한 단일세포 전사체 데이터를 30종 이상의 암종에 대해 수집하여 모든 암에 대한 세포 지도가 총망라된 전 암종 단일세포 지도(pan-cancer single-cell atlas)를 구축했다.
내과 전문의가 포함된 연구진이 직접 데이터를 수집하고, 메타데이터 재처리 및 암종 분류를 진행함으로써 암 조직을 구성하는 100여 개의 세포 상태를 규정하고, 이들의 발생빈도를 바탕으로 각 암종별 조직의 상태를 분류했다. 또한 미국의 암 환자 공공 데이터베이스(TCGA) 등의 대규모 코호트 데이터를 활용해 각 세포 상태가 암 환자의 치료 및 예후에 미치는 영향을 분석했다.
특히 여러 세포 상태 간의 상호작용 분석을 통해서 암세포 생태계 네트워크를 구축하였고, 이 중에서 삼차 림프 구조(tertiary lymphoid structure)* 구성요소를 포함하는 인터페론 연관 생태계가 삼성서울병원 이세훈 교수 연구팀의 폐암 코호트를 포함해 면역관문 억제 치료(immune checkpoint inhibitor)**를 받은 여러 암종들에서 면역관문 억제 치료 반응 예측에 효과적임을 확인했다.
*삼차 림프 구조: 림프절과 유사하지만 건강한 조직에서는 형성되지 않고, 만성염증, 감염, 암 등이 있는 곳에서 면역 세포들이 조직화되어 형성되는 구조물
**면역관문 억제치료: T세포 혹은 암세포에서 발현되는 PD-1/PD-L1, CTLA-4와 같은 면역관문(immune checkpoint)을 차단하여 암세포와 싸우는 면역 반응을 활성화시키는 치료방법
연구를 주도한 박종은 교수는 “이번 연구를 통해 세계 최대 규모의 암 조직 데이터베이스를 구축하였고, 이를 바탕으로 면역 치료의 예후 예측에 중요한 영향을 줄 것이다. 또한 소수의 환자에게 아주 좋은 치료반응을 보이나 일부의 경우 면역 관련 부작용을 나타내는 면역 관문 억제제의 치료 대상군 선정에 큰 도움을 줄 것으로 기대된다.”고 말했다.
이번 연구 결과는 국제 학술지 ‘네이쳐 커뮤니케이션즈(Nature Communications)’ 지에 5월 14일 자 출판됐으며, KAIST 세포 아틀라스 웹 포탈 https://cellatlas.kaist.ac.kr 을 통해 공개되고 있다.
한편 이번 연구는 한국연구재단의 차세대바이오유망범용기술연구지원사업과 우수신진연구사업, 한국보건산업진흥원 연구중심병원 육성사업, 융합형의사과학자양성사업 및 포스코사이언스펠로우십의 지원을 받아 수행됐다.
세계 최고 성능을 지닌 데이터베이스 관리 시스템(DBMS) 기술 개발
우리 연구진이 방대한 정보를 저장하고 목적에 맞게 검색, 관리할 수 있는 시스템을 통칭하는 데이터베이스관리시스템(DBMS, DataBase Management System)을 세계 최고 수준의 성능으로 끌어올렸다.
우리 대학 전산학부 김민수 교수 연구팀이 데이터베이스 질의 언어 SQL(Structured Query Language, 구조화 질의어) 처리 성능을 대폭 높인 세계 최고 수준의 DBMS 기술을 개발했다.
김 교수 연구팀은 데이터 처리를 위해 산업 표준으로 사용되는 SQL 질의를 기존 DBMS와는 전혀 다른 방법으로 처리함으로써 성능을 기존 옴니사이(OmniSci) DBMS 대비 최대 88배나 높인 신기술을 개발했다. 김 교수팀이 개발한 이 기술은 오라클·마이크로소프트 SQL서버·IBM DB2 등 타 DBMS에도 적용할 수 있어 고성능 SQL 질의 처리가 필요한 다양한 곳에 폭넓게 적용될 수 있을 것으로 기대된다.
대부분의 DBMS는 SQL 질의를 처리할 때 내부적으로 데이터 테이블들을 `왼쪽 깊은 이진 트리(left-deep binary tree)' 형태로 배치해 처리하는 방법을 사용한다. 지난 수십 년간 상용화돼 온 대부분의 DBMS는 데이터 테이블들의 배치 가능한 가지 수가 기하급수적으로 많기 때문에 이를 `왼쪽 깊은 이진 트리' 형태로 배치해 SQL 질의를 처리해 왔다.
임의의 두 테이블이 기본 키(primary key, PK)와 외래 키(foreign key, FK)라 불리는 관계로 결합(조인 연산)하는 경우에는 이러한 방법으로 SQL 질의를 효과적으로 처리할 수 있다. 여기서 기본 키는 각 데이터 행(row)을 유일하게 식별할 수 있는 열(column)이고, 외래 키는 그렇지 않은 열이다.
지난 수십 년간 산업에서 사용되는 DB의 구조가 점점 복잡해지면서 두 테이블은 PK-FK 관계가 아닌 FK-FK 관계, 즉 외래 키와 외래 키의 관계로 결합하는 복잡한 형태의 SQL 질의들이 많아지고 있다. 실제 DBMS의 성능을 측정하는 산업 표준 벤치마크인 TPC-DS에서 전체 벤치마크의 26%가 이런 복잡한 SQL 질의들로 구성돼 있고 기계학습(머신러닝), 생물 정보학 등 다양한 분야들서도 이러한 복잡한 SQL 질의 사용이 점차 증가하는 추세다.
이전에 나온 DBMS들은 두 테이블이 주로 PK-FK 관계로 결합한다는 가정하에 개발됐기 때문에 FK-FK 결합이 필요한 복잡한 SQL 질의를 매우 느리거나 심지어 처리하지 못하는 실패를 거듭해왔다.
김 교수팀은 문제 해결을 위해 테이블들을 하나의 커다란 `왼쪽 깊은 이진 트리' 형태가 아닌 여러 개의 작은 `왼쪽 깊은 이진 트리'를 `n항 조인 연산자'로 묶는 형태로 배치해 처리하는 기술을 개발했다. 이때 각각의 `작은 이진 트리' 안에는 FK-FK 결합 관계가 발생하지 않도록 테이블들을 배치하는 것이 핵심이다.
각각의 `작은 이진 트리'의 처리 결과물을 `n항 조인 연산자'로 결합해 최종 결과물을 구하는 것도 난제로 꼽히는데 연구팀은 `최악-최적(worst-case optimal) 조인 알고리즘'이라는 방법으로 이 문제를 해결했다.
`최악-최적 조인 알고리즘'은 그래프 데이터를 처리할 때 이론적으로 가장 우수하다고 알려진 알고리즘이다. 김 교수 연구팀은 세계에서 가장 먼저 이 알고리즘을 SQL 질의 처리에 적용해 난제를 해결하는 데 성공했다.
김민수 교수 연구팀은 새로 개발한 DBMS 기술을 GPU 기반의 DBMS 개발업체인 미국 옴니사이(OmniSci)社 제품에 적용한 결과, OmniSci DBMS보다 성능이 최대 88배나 향상된 결과를 얻었다. 또 TPC-DS 벤치마크에서도 세계 최고 수준의 성능을 가진 기존의 상용 DBMS보다 5~20배나 더 빠른 사실을 확인했다. TPC-DS는 DBMS의 성능을 측정하기 위한 산업 표준의 최신 벤치마크이다.
교신저자로 참여한 김민수 교수는 "연구팀이 개발한 새로운 기술은 대부분의 DBMS에 적용할 수 있기 때문에 산업적 측면에서 파급 효과가 매우 클 것으로 기대한다ˮ 라고 말했다.
이번 연구에는 김 교수의 제자이자 미국 옴니사이(OmniSci)社에 재직 중인 남윤민 박사가 제1 저자로, 김 교수가 교신저자로 참여했으며 지난 18일 미국 오리건주 포틀랜드에서 열린 데이터베이스 분야 최고의 국제학술대회로 꼽히는 `시그모드(SIGMOD)'에서 발표됐다. (논문명 : SPRINTER: A Fast n-ary Join Query Processing Method for Complex OLAP Queries).
한편, 이 연구는 한국연구재단 선도연구센터 사업 및 중견연구자 지원사업, 과기정통부 IITP SW스타랩 사업의 지원을 받아 수행됐다.
조광현 교수, 대장암 유발하는 돌연변이 유전자의 네트워크 원리 규명
〈 왼쪽위부터 시계방향으로 이종훈 박사과정, 공정렬 박사과정, 조광현 교수, 신동관 연구교수 〉
우리 대학 바이오및뇌공학과 조광현 교수 연구팀이 대장암이 발병하는 과정에서 생기는 유전자 네트워크의 원리를 규명하는 데 성공했다.
이를 통해 대장암의 근본적인 발병 원리를 밝혀낼 뿐 아니라 향후 새로운 개념의 효과적인 항암제의 분자표적을 찾는데 활용될 것으로 기대된다. 또한 4차 산업혁명의 핵심 기술로 주목받는 IT와 BT의 융합연구인 시스템생물학 연구로 규명해냈다는 의의를 갖는다.
신동관 박사, 이종훈, 공정렬 학생연구원 등이 함께 참여한 이번 연구는 ‘네이처 커뮤니케이션즈(Nature Communications)’ 2일자 온라인 판에 게재됐다.
인간의 암은 유전자 돌연변이에 의해 발생한다. 이 돌연변이의 빈도는 암종에 따라 차이가 나는데 백혈병, 소아암은 10여 개 정도이지만 성인 고형암은 평균 50여 개, 폐암 등의 외부인자로 인한 경우는 수백 개에 이른다.
전 세계 암연구자들은 암 치료를 위해 환자들에게서 빈번하게 발견되는 유전자 돌연변이들을 파악하고 이 중 주요 암 유발 유전자를 찾아내 표적 항암제를 개발하고자 노력했다.
그러나 유전자 돌연변이는 해당 유전자의 기능에만 영향을 주는 게 아니라 그 유전자와 상호작용하는 다른 유전자에게도 영향을 끼친다. 따라서 이러한 유전자 네트워크의 원리를 모른 채 소수의 암 유발 유전자를 대상으로 하는 현재의 치료법은 일부에게만 효과가 있고 쉽게 약물의 내성을 일으키는 한계가 있다.
조 교수 연구팀은 대장암 환자의 대규모 유전체 데이터를 이용해 유전자 상호작용 네트워크에서 나타나는 다중 돌연변이의 협력적 효과에 대한 수학모형을 구축했다.
이는 국제 암유전체컨소시엄에서 발표한 전암 유전체데이터베이스(TCGA: The Cancer Genome Atlas)를 토대로 구축한 것으로, 유전자 네트워크에서 나타나는 돌연변이의 영향력을 정량화하고 이를 이용해 대장암 환자 군을 임상 특징에 따라 군집화 하는데 성공했다.
또한 대규모 컴퓨터 시뮬레이션 분석을 통해 암 발생 과정에서 나타나는 임계전이(critical transition) 현상을 밝혀내 숨겨진 유전자 네트워크의 원리를 최초로 규명했다.
임계전이란 상전이와 같이 물질의 상태가 갑작스럽게 변화하는 현상을 말한다. 암 발생 과정에서는 유전자 돌연변이의 발생 순서를 추적하기 어렵기 때문에 전이 현상이 존재하는지 확인할 수 없었다.
연구팀은 시스템생물학 기반의 연구방법을 이용해 확인한 결과 기존의 대장암에서 잘 알려진 암 유발 유전자 돌연변이의 발생 순서를 따르는 경우에 임계전이 현상을 보임을 발견했다.
이번에 개발한 수학모형을 활용하면 암환자에게 발생하는 다수 유전자 돌연변이의 영향을 가장 효과적으로 저해할 수 있는 새로운 항암 표적 약물이 개발될 것으로 기대된다.
특히 주요 암 유발 유전자 뿐 아니라 돌연변이의 영향을 받는 다른 모든 유전자들을 대상으로 종합적으로 평가해 효과적인 약물 표적을 찾아낼 수 있다.
조 교수는 “지금껏 다수 유전자들의 돌연변이가 암 발생에 어떻게 기여하는지 밝혀진 바가 없었다”며 “이번 연구에서는 시스템생물학으로 암세포의 발달과정에서 유전자 네트워크의 원리를 최초로 밝힘으로써 새로운 차원의 항암제 표적을 발굴할 수 있는 가능성을 제시했다”고 말했다.
이번 연구는 과학기술정보통신부와 한국연구재단의 중견연구자지원사업과 바이오의료기술개발사업의 지원을 받아 수행됐다.
□ 그림 설명
그림1. 유전자 돌연변이의 영향력 전파에 의한 거대 클러스터의 형성
그림2. 암발생 과정에서 돌연변이 협력효과의 임계전이 현상
우운택 교수, 스마트 관광 증강현실 어플리케이션 개발
〈 우 운 택 교수 〉
우리 대학 문화기술대학원 우운택 교수 연구팀이 스마트 관광 지원을 위한 증강 및 가상현실 어플리케이션을 개발했다.
‘케이 컬처 타임머신(K-Culture Time Machine)’ 어플리케이션은 창덕궁을 대상으로 한 시범 서비스로 iOS 앱스토어에 5월 23일 공개됐다.
개발된 케이 컬처 타임머신은 웨어러블 360도 비디오를 통해 문화유산이나 유적지에 대한 시공간을 넘는 원격 체험을 제공한다.
사용자는 VR기기에 스마트폰을 장착해 제공되는 360도 비디오로 문화 유적지를 원격으로 체험하고 해당 문화유산 및 연관관계가 있는 인물, 장소, 사건 등에 대한 정보를 확인할 수 있다. 또한 소실된 문화유산에 대한 3차원 디지털 복원도 체험할 수 있다.
웨어러블 기기 활용 없이도 모바일 모드를 통해 사용자 주변 유적지 확인, 카메라에 인식된 문화유산을 인식하고 관련된 정보와 콘텐츠를 제공하는 증강현실 기반의 문화유산 가이드가 가능하다.
사용자는 자신의 위치에서 창덕궁 돈화문을 시작으로 인정문, 인정전, 희정당에 이르는 창덕궁 내부를 이동하며 360도 파노라마 이미지나 비디오를 통해 현장을 가상체험 할 수 있다.
현재는 존재하지 않는 인정전 동쪽의 궐내 곽사 지역에는 3D모델을 통한 승정원의 가상 복원을 확인할 수 있다.
위 기능은 웨어러블 기기 없이 스마트폰 상에서도 체험 가능하며 개발 중인 증강현실 기능이 완성되면 현장에서 활용 가능한 수준의 어플리케이션이 될 것으로 기대된다.
우 교수 연구팀은 문화유산 데이터베이스와 증강-가상현실 콘텐츠의 표준화된 메타데이터를 구축하고 이를 적용했다. 이를 활용해 일시적으로 개발 후 소비되는 기존 어플리케이션과는 달리 추가적인 콘텐츠 생성 및 추가가 가능하다.
우 교수는 “증강현실 콘텐츠의 상호 활용성과 재활용성을 증진해 스마트관광 분야의 새로운 시장을 선점할 수 있을 것이다”며 “콘텐츠 개발 비용 절감과 증강현실 콘텐츠 생태계 활성화를 가능하게 하는 다양한 부가 효과도 기대한다”고 말했다.
이번 연구는 ㈜포스트미디어(대표 홍승모)와 문화체육관광부 CT R&D 사업과의 공동 수행을 통해 이뤄졌으며, 관련 연구 성과는 올 7월 캐나다에서 진행되는 HCII 2017 학회를 통해 발표될 예정이다.
□ 그림 설명
그림1. 360 VR 서비스 개념도
그림2. K-Culture Time Machine의 모바일 증강현실 기능 구동 화면
그림3. K-Culture Time Machine의 360도 파노라마 이미지-비디오 기능 화면
스마트폰으로 시공간 뛰어넘는 문화유산 관람한다
〈 우 운 택 교수 〉
우리 대학 문화기술대학원 김정화, 우운택 교수 공동연구팀이 문화체육관광부의 지원을 받아 스마트 관광 지원을 위한 모바일 증강현실 플랫폼 ‘K-컬쳐 타임머신(K-Culture Time Machine)’을 개발했다.
이 기술은 1월 27일부터 3일간 강원도 하이원리조트에서 열리는 한국 HCI(인간-컴퓨터 상호작용) 학회에서 발표될 예정이다.
이번에 개발한 플랫폼은 증강현실을 통해 문화유산이나 유적지의 과거를 체험하고 엿볼 수 있는 기능을 제공한다.
위치 혹은 객체를 인식한 후 단순한 부가정보만을 제공했던 기존 모바일 증강현실을 넘어 향후 모바일 증강현실 응용 생태계를 구축하는 초석이 될 것으로 기대된다.
연구팀의 핵심 기술은 문화유산 데이터베이스를 연계하는 메타데이터 모델을 구축하고, 이를 기반으로 문화유산 공간의 현재와 과거 정보를 체험할 수 있는 기술이다.
스마트폰에 설치된 플랫폼을 실행한 후 유적지나 문화유산을 스마트폰에 비추면 관련 문화재에 대한 설명이 제공된다. 데이터베이스가 연계됐기 때문에 문화재청, 박물관포탈의 E-뮤지엄, 한국민족문화대백과사전 등의 정보를 한 눈에 볼 수 있다.
연구팀은 또한 문화유산과 관련된 인물, 유물, 장소, 사건 등을 정의하고 연관관계를 분석해 온톨로지를 설계하고 구현했다. 창덕궁 인정전을 예로 들면 유물 카테고리에서 ‘인정전을 구성하는 이화문 장식’을, 사건 카테고리에서 ‘인정전에서 발생한 왕세자탄강진하례’등을 검색할 수 있다.
이를 통해 각자 독립적으로 구축된 정보 간의 연계가 가능하고, 개발 후 소비되는 기존 시스템과 달리 지속적인 서비스를 제공할 수 있다.
K-컬쳐 타임머신은 이름처럼 문화유산의 과거와 현재를 오가며 시공간을 넘나드는 체험을 할 수 있다. 각 시대에 있었던 사건, 사진, 연관성을 지닌 정보를 확인할 수 있고, 증강현실을 통해 현재 문화유산의 모습에서 과거 모습을 투영하는 것이 가능하다.
이 증강현실 플랫폼의 기반인 데이터모델 및 메타데이터 표준은 작년 12월 한국정보통신기술협회로부터 정식 인준됐다.
박물관, 도서관 등 각기 다양한 문화유산을 다루는 기관을 통합하는 유럽의 유로피아나 프로젝트(Europeana Data Model : EDM)처럼 국내의 다양한 문화유산 데이터베이스를 연계하고 활용할 수 있는 온톨로지 데이터 모델 KCHDM(Korean Cultural Heritage Data Motel)을 개발해 표준화했다.
우 교수는 “증강현실 콘텐츠의 메타데이터 체계를 개발하고 표준화해 다양한 증강현실 콘텐츠의 재사용 및 개별 플랫폼과 독립적으로 콘텐츠 공유가 가능케 할 것이다”며 “향후 우리나라의 문화유산 정보시스템과 소셜미디어 기반의 신뢰성 높은 추천 정보, 사용자 프로파일을 증강현실 콘텐츠로 연계 활용해 지속 가능한 증강현실 생태계를 구축하고 일상에 확산할 수 있을 것이다”고 말했다.
이번 기술 개발은 ㈜포스트미디어(대표 홍승모)와의 공동연구를 통해 진행됐다.
연구팀의 모바일 기반 스마트 투어지원 플랫폼과 관련된 기술 논문은 인간-컴퓨터 상호작용 관련 국제학술대회인 HCI International 2015에서 발표될 예정이다.
□ 그림 설명
그림 1. 스마트 유적지 투어 지원 플랫폼 ‘K-Culture Time Machine’의 개념도
그림2. 본 플랫폼을 활용한 모바일 증강현실 어플리케이션에서의 서비스 구동 실제 화면
단백질 분해조절 효소 정보 담은 바이오마커 발굴 시스템 개발
- Mol Cell Proteomics지 게재, “바이오마커 개발의 새로운 패러다임 제시” -
단백질의 분해를 조절하는 효소와 기질에 대한 관계정보를 담은 바이오마커* 발굴 시스템(E3Net)이 국내 연구진에 의해 개발되어, 고부가가치의 새로운 바이오마커 개발에 가능성이 열렸다.
※ 바이오마커(Biomarker) : 유전자, 단백질 등에서 유래된 특이한 패턴의 분자적 정보로, 유전적․후천적 영향으로 발생한 신체의 변화를 감지할 수 있는 생물표지인자
우리학교 바이오및뇍 이관수 교수(49세)가 주도하고, 한영웅 박사과정생, 이호동 박사 및 박종철 교수가 참여한 이번 연구는 교육과학기술부(장관 이주호)와 한국연구재단(이사장 이승종)이 추진하는 선도연구센터지원사업(NCRC), 신기술융합형성장동력사업 및 교육과학기술부의 KAIST 미래형 시스템 헬스케어 연구개발사업의 지원으로 수행되었고, 단백질체 연구 분야의 권위 있는 학술지인 ‘Molecular and Cellular Proteomics"지 4월호(4월 1일자)에 게재되었다. (논문명: A system for exploring E3-mediated regulatory networks of cellular functions)이관수 교수 연구팀은 전 세계 바이오 관련 DB(데이터베이스)와 논문(약 2만 편)으로부터 정보를 추출해 단백질 분해를 조절하는 효소(E3 효소)와 기질*들 간의 네트워크를 집대성하여, 이와 관련된 세포의 기능과 질병을 분석하는 ‘E3Net’ 시스템을 개발하였다.
※ 기질(substrate) : 효소와 특이적으로 결합하여 화학반응을 일으키는 분자로, 소화작용은 우리의 몸속에서 일어나는 효소와 기질간의 반응의 대표적인 사례
세포는 시시각각 변하는 환경에 대응하여 필요한 단백질들을 생산, 폐기 및 재활용하는 정교한 시스템을 가지고 있는데, 만일 이 과정에서 오류가 생기면 ‘질병’으로 이어질 수 있다.
따라서 단백질 분해를 조절하는 E3 효소와 기질 간의 관계를 파악하면 관련 질병을 치료하거나 예방할 수 있게 된다. 특히 E3 효소는 단백질 분해의 80%를 담당하는 것으로 알려져 수많은 질병이 관련되어 있을 것으로 예측되고 있다.
그러나 E3 효소와 기질 간의 정보들이 개별 논문과 DB에 흩어져 있어, 단백질 분해 조절과 관련된 세포의 기능과 질병의 특성을 종합적․체계적으로 분석할 수 없었다.
이 교수팀은 모든 E3 효소(2,201개)와 기질(4,896개) 및 그 조절관계(1,671개)에 대한 정보를 통합하여 E3 효소 조절 네트워크 내에 존재하는 관련된 세포의 기능과 질병을 시스템적으로 분석할 수 있는 E3Net을 구축하는데 성공하였다.
이 네트워크는 지금까지 구축된 조절정보를 모두 합친 것보다 무려 10배에 이르는 방대한 양으로, E3 효소가 독자적으로 또는 협력해서 조절하는 세포의 기능과 관련 질병을 정확히 파악할 수 있는 토대가 마련된 첫 사례로서 의미가 크다.
연구팀은 E3Net을 이용하면 각각의 질병과 관련된 단백질들의 분해조절을 담당하는 E3 효소들을 찾을 수 있고, 분해조절 원리와 세포기능 네트워크를 함께 파악하여 질병의 발생 원인이나 환자에 적합한 맞춤형 치료방법을 제공할 수 있는 바이오마커를 발굴할 수 있을 것으로 기대한다.
실제 연구팀은 E3Net을 활용해 암, 뇌심혈관 질환 및 당뇨병 등 현대인의 대표적 질환과 관련된 E3 바이오마커 후보 수십 개를 새롭게 발견하는 등 눈에 띄는 성과를 거두었고, 현재 이를 검증할 후속 연구를 계획하고 있다. 이관수 교수는 “이번 연구결과로 E3 효소와 관련된 단백질 분해조절의 네트워크가 구축되고, 이 네트워크에 존재하는 세포의 기능과 질병의 특이성을 시스템적으로 분석할 수 있게 됨에 따라, E3 효소와 관련된 세포의 기능 연구와 질병 연구에 새로운 전기가 마련되었다”고 연구의의를 밝혔다.