AI 에이전트의 ‘숨은 전력 비용’ 세계 최초 규명
AI가 스스로 생각하고 행동하는 ‘AI 에이전트' 시대가 열리면서 데이터센터의 전력 소비가 새로운 과제로 떠오르고 있다. 우리 대학 연구진이 세계 최초로 AI 에이전트의 계산 비용과 에너지 소비를 분석한 결과, 기존 생성형 AI보다 질문 한 건당 최대 136.5배 많은 에너지를 사용하는 것으로 나타났다. 이번 연구는 AI 시대의 경쟁력이 모델 성능을 넘어 데이터센터와 전력 인프라의 효율성으로 확대되고 있음을 보여준다.
우리 대학은 전기및전자공학부 유민수 석좌교수 연구팀은 AI 에이전트가 실제 서비스 환경에서 얼마나 많은 계산 자원과 전력을 사용하는지를 세계 최초로 체계적으로 분석했다고 5일 밝혔다.
최근 챗GPT(ChatGPT)와 같은 대형 언어 모델(LLM, Large Language Model·사람의 언어를 이해하고 글을 생성하는 인공지능 모델) 기반 어플리케이션은 단순히 질문에 답하는 수준을 넘어 스스로 계획을 세우고, 인터넷 검색이나 계산기, 코드 실행 등 다양한 외부 도구를 활용해 복잡한 문제를 해결하는 AI 에이전트(AI Agent·여러 도구를 스스로 활용해 목표를 수행하는 차세대 인공지능) 로 빠르게 발전하고 있다.
이러한 AI 에이전트는 소프트웨어 개발, 연구, 업무 자동화 등 다양한 분야에서 활용이 확대되고 있지만, 이를 실제 운영하기 위해 얼마나 많은 전력과 비용이 필요한지는 거의 알려져 있지 않았다.
연구팀은 AI 에이전트를 단순한 프로그램이 아니라 데이터센터의 서버와 GPU(Graphics Processing Unit·대규모 AI 계산을 수행하는 고성능 반도체) 가 지속적으로 처리해야 하는 새로운 형태의 작업인 워크로드(Workload·컴퓨터가 수행해야 하는 전체 계산 작업) 로 정의하고, 실제 실행 과정에서 발생하는 계산량과 에너지 소비를 분석했다.
분석 결과, AI 에이전트는 기존의 단계별 추론(Chain-of-Thought, CoT·AI가 사람처럼 생각 과정을 하나씩 전개하며 답을 찾는 방식)과 달리 반복적으로 여러 차례 대형 언어 모델 호출(LLM Invocation·AI가 언어 모델에 새로운 판단이나 답변 생성을 요청하는 계산 과정)을 수행하는 것으로 나타났다.
이처럼 언어 모델을 반복적으로 호출하면서 응답 시간도 크게 증가했다. AI 에이전트의 답변 시간은 최대 153.7배 늘어났으며, 외부 도구가 작업을 수행하는 동안 GPU는 전체 실행 시간의 최대 54.5% 를 아무 계산도 하지 못한 채 대기하는 것으로 분석됐다. 즉, AI가 더 복잡한 일을 수행할수록 고가의 GPU를 충분히 활용하지 못하는 새로운 비효율이 발생하는 것이다.
연구팀은 AI 에이전트가 사용하는 전력도 데이터센터 규모에서 분석했다. 현재 상용 AI 서비스 수준인 700억 개의 매개변수(파라미터, Parameter·AI가 학습한 지식과 능력을 저장하는 값) 를 가진 대형 언어 모델을 사용하는 AI 에이전트는 질문 한 건을 처리하는 데 평균 348.41와트시(Wh·전기를 얼마나 사용했는지를 나타내는 에너지 단위) 의 전력을 소비했다. 이는 기존 생성형 AI의 단순 질의응답 방식보다 136.5배 높은 수준이다.
또한 하루 137억 건의 AI 에이전트 요청이 발생하는 미래 환경을 가정해 분석한 결과, 데이터센터 전력 수요는 약 198.9기가와트(GW·국가 단위 전력망에서 사용하는 매우 큰 규모의 전력 용량) 에 이를 것으로 추정됐다. 이는 현재 세계 각국이 추진 중인 수 기가와트(GW) 규모의 AI 데이터센터를 크게 뛰어넘는 수준이며, 미국 전체 평균 전력 소비량의 약 절반에 해당하는 규모다.
이번 연구는 AI 시대의 경쟁력이 '더 똑똑한 AI'에서 '더 효율적인 AI'로 옮겨가고 있음을 보여준다. 앞으로는 AI 모델만 발전시키는 것이 아니라 AI 반도체, 데이터센터, 전력 인프라를 함께 최적화하는 '공동 설계(Co-design)'가 필수 전략이 될 것으로 기대된다. 이는 AI 서비스의 운영 비용을 낮추고, 지속가능한 AI 인프라를 구축하는 핵심 기술이 될 전망이다.
유민수 석좌교수는 “이번 연구는 단순히 AI가 더 똑똑해지는 것을 넘어, 그 지능을 구현하고 유지하기 위해 얼마나 많은 전력과 비용이 필요한지를 정량적으로 제시한 첫 사례”라며, “향후 AI 에이전트가 보편화되는 시대에는 AI 데이터센터 인프라 뿐만 아니라 AI 에이전트 모델과 전력 인프라까지 통합적으로 공동 설계(co-design)하여 최적화하는 접근이 더욱 중요해질 것”이라고 밝혔다. 이어 “이를 통해 최종 사용자가 AI 서비스를 활용하는 데 소요되는 비용을 획기적으로 절감하고, 동시에 지속가능한 AI 인프라를 구축하기 위한 연구와 투자가 필수적”이라고 강조했다.
이번 연구는 KAIST 전기및전자공학부 김지인 박사과정 학생이 제1저자로 수행했으며, 컴퓨터 시스템 설계 분야 최고 권위 국제학회인 32회 IEEE HPCA(International Symposium on High-Performance Computer Architecture)에서 지난 2월 발표됐다. 연구팀은 논문에서 활용한 AI 에이전트 구현 기술과 벤치마크(Benchmark·AI 성능을 객관적으로 비교·평가하기 위한 표준 시험 환경)를 오픈소스로 공개해 전 세계 연구자들이 후속 연구에 활용할 수 있도록 했다.
※ 논문명 : The Cost of Dynamic Reasoning: Demystifying AI Agents and Test-Time Scaling from an AI Infrastructure Perspective
※ 오픈소스 : https://github.com/VIA-Research/AgentBench
※ 논문 링크: https://doi.org/10.1109/HPCA68181.2026.11408569
본 연구는 정보통신기획평가원(IITP)의 SW스타랩(Starlab), AI 반도체를 활용한 K-클라우드기술개발사업, AI 반도체 기반 데이터센터 고도화 선도기술개발사업 및 삼성전자 미래기술육성센터의 지원을 받아 수행됐다.
챗GPT 등 대형 AI모델 학습 최적화 시뮬레이션 개발
최근 챗GPT, 딥시크(DeepSeek) 등 초거대 인공지능(AI) 모델이 다양한 분야에서 활용되며 주목받고 있다. 이러한 대형 언어 모델은 수만 개의 데이터센터용 GPU를 갖춘 대규모 분산 시스템에서 학습되는데, GPT-4의 경우 모델을 학습하는 데 소모되는 비용은 약 1,400억 원에 육박하는 것으로 추산된다. 한국 연구진이 GPU 사용률을 높이고 학습 비용을 절감할 수 있는 최적의 병렬화 구성을 도출하도록 돕는 기술을 개발했다.
우리 대학 전기및전자공학부 유민수 교수 연구팀은 삼성전자 삼성종합기술원과 공동연구를 통해, 대규모 분산 시스템에서 대형 언어 모델(LLM)의 학습 시간을 예측하고 최적화할 수 있는 시뮬레이션 프레임워크(이하 vTrain)를 개발했다고 13일 밝혔다.
대형 언어 모델 학습 효율을 높이려면 최적의 분산 학습 전략을 찾는 것이 필수적이다. 그러나 가능한 전략의 경우의 수가 방대할 뿐 아니라 실제 환경에서 각 전략의 성능을 테스트하는 데는 막대한 비용과 시간이 들어간다.
이에 따라 현재 대형 언어 모델을 학습하는 기업들은 일부 경험적으로 검증된 소수의 전략만을 사용하고 있다. 이는 GPU 활용의 비효율성과 불필요한 비용 증가를 초래하지만, 대규모 시스템을 위한 시뮬레이션 기술이 부족해 기업들이 문제를 효과적으로 해결하지 못하고 있는 상황이다.
이에 유민수 교수 연구팀은 vTrain을 개발해 대형 언어 모델의 학습 시간을 정확히 예측하고, 다양한 분산 병렬화 전략을 빠르게 탐색할 수 있도록 했다.
연구팀은 실제 다중 GPU 환경에서 다양한 대형 언어 모델 학습 시간 실측값과 vTrain의 예측값을 비교한 결과, 단일 노드에서 평균 절대 오차(MAPE) 8.37%, 다중 노드에서 14.73%의 정확도로 학습 시간을 예측할 수 있음을 검증했다.
연구팀은 삼성전자 삼성종합기술원와 공동연구를 진행하여 vTrain 프레임워크와 1,500개 이상의 실제 학습 시간 측정 데이터를 오픈소스로 공개(https://github.com/VIA-Research/vTrain)하여 AI 연구자와 기업이 이를 자유롭게 활용할 수 있도록 했다.
유민수 교수는 “vTrain은 프로파일링 기반 시뮬레이션 기법으로 기존 경험적 방식 대비 GPU 사용률을 높이고 학습 비용을 절감할 수 있는 학습 전략을 탐색하였으며 오픈소스를 공개하였다. 이를 통해 기업들은 초거대 인공지능 모델 학습 비용을 효율적으로 절감할 것이다”라고 말했다.
이 연구 결과는 방제현 박사과정이 제1 저자로 참여하였고 컴퓨터 아키텍처 분야의 최우수 학술대회 중 하나인 미국 전기전자공학회(IEEE)·전산공학회(ACM) 공동 마이크로아키텍처 국제 학술대회(MICRO)에서 지난 11월 발표됐다. (논문제목: vTrain: A Simulation Framework for Evaluating Cost-Effective and Compute-Optimal Large Language Model Training, https://doi.org/10.1109/MICRO61859.2024.00021)
이번 연구는 정부(과학기술정보통신부)의 재원으로 한국연구재단, 정보통신기획평가원, 그리고 삼성전자의 지원을 받아 수행되었으며, 과학기술정보통신부 및 정보통신기획평가원의 SW컴퓨팅산업원천기술개발(SW스타랩) 사업으로 연구개발한 결과물이다.
세계 최초 개인정보 보호 기술이 적용된 인공지능(AI) 반도체 개발
우리 대학 전기및전자공학부 유민수 교수 연구팀이 세계 최초로 `차등 프라이버시 기술이 적용된 인공지능(AI) 어플리케이션(Differentially private machine learning)'의 성능을 비약적으로 높이는 인공지능 반도체를 개발했다고 19일 밝혔다.
빅데이터 및 인공지능 기술의 발전과 함께 구글, 애플, 마이크로소프트 등 클라우드 서비스를 제공하는 기업들은 전 세계 수십억 명의 사용자들에게 인공지능 기술을 기반으로 여러 가지 서비스(머신러닝 애즈 어 서비스, ML-as-a-Service, MLaaS)를 제공하고 있다. 이러한 서비스 중에는, 대표적으로 유튜브나 페이스북 등에서 시청자의 개별 취향에 맞춰 동영상 콘텐츠나 상품 등을 추천하는 `개인화 추천 시스템 기술(예- 딥러닝 추천 모델, Deep Learning Recommendation Model)' 이나, 구글 포토(Photo) 와 애플 아이클라우드(iCloud) 등에서 사진을 인물 별로 분류해주는 `안면 인식 기술 (예- 합성곱 신경망 네트워크 안면 인식, Convolutional Neural Network based Face Recognition)' 등이 있다.
이와 같은 서비스는 사용자의 정보를 대량으로 수집해, 이를 기반으로 인공지능 알고리즘의 정확도와 성능을 개선한다. 이 과정에서 필연적으로 많은 양의 사용자 정보가 서비스 제공 기업의 데이터 센터로 전송되고, 민감한 개인정보나 파일들이 저장되고 사용되는 과정에서 정보가 유출되는 문제가 발생하기도 한다.
또한 이러한 문제는 최근 주목받는 대형 인공지능 모델의 경우에 더 쉽게 발생하는 경향이 있으며, 실제 구글에서 사용하는 대화형 인공지능 모델인 GPT-2의 경우, 특정 단어들을 이야기했을 때 사용자의 개인정보 등을 유출하는 문제를 보였다. [참고1] 유사사례로서 국내에서 2020년 화제가 되었던 스캐터랩의 인공지능 챗봇 이루다의 경우에도 비슷한 문제가 불거진 적이 있다. [참고2]
[참고1] https://ai.googleblog.com/2020/12/privacy-considerations-in-large.html
[참고2] https://n.news.naver.com/mnews/article/092/0002243051?sid=105
이에 애플, 구글, 마이크로소프트 등 빅 테크 기업에서는 `차등 프라이버시 (differential privacy)' 기술을 크게 주목하고 있다. 차등 프라이버시 기술은 학습에 사용되는 그라디언트(gradient, 학습 방향 기울기)에 잡음(노이즈)를 섞음으로써 인공지능 모델로부터 사용자의 개인정보를 유출하는 모든 종류의 공격을 방어할 수 있다.
하지만 이러한 장점에도 불구하고, 차등 프라이버시 기술 적용 시, 기존 대비 어플리케이션의 속도와 성능이 크게 하락하는 문제 때문에 아직까지 범용적으로 널리 적용되지는 못했다. 이는 차등 프라이버시 머신러닝 학습 과정이 일반적인 머신러닝 학습과 다른 특성을 보이고, 이로 인해 기존의 하드웨어에서 효과적으로 실행되지 않아 메모리 사용량, 학습 속도 및 하드웨어 활용도 (hardware utilization) 측면에서 비효율적이기 때문이다.
이에 유민수 교수 연구팀은 차등 프라이버시 기술의 성능 병목 구간을 분석해 해당 기술이 적용된 어플리케이션의 성능을 크게 시킬 수 있는 `차등 프라이버시 머신러닝을 위한 인공지능(AI) 반도체 칩'을 개발했다. 유민수 교수팀이 개발한 인공지능 반도체는 외적 기반 연산기와 덧셈기 트리 기반의 후처리 연산기 등으로 구성돼 있으며, 현재 가장 널리 사용되는 인공지능 프로세서인 구글 TPUv3 대비 차등 프라이버시 인공지능 학습 과정을 3.6 배 빠르게 실행시킬 수 있고, 엔비디아의 최신 GPU A100 대비 10배 적은 자원으로 대등한 성능을 보인다고 연구팀 관계자는 설명했다. 또한 이번 개발을 통해서 기존 하드웨어의 한계로 널리 쓰이지 못했던 차등 정보보호 기술의 대중화에 도움을 줄 수 있을 것으로 기대된다고 전했다.
우리 대학 전기및전자공학부 박범식, 황랑기 연구원이 공동 제1 저자로, 윤동호, 최윤혁 연구원이 공동 저자로 참여한 이번 연구는 미국 시카고에서 열리는 컴퓨터 구조 분야 최우수 국제 학술대회인 `55th IEEE/ACM International Symposium on Microarchitecture(MICRO 2022)'에서 오늘 10월 발표될 예정이다. (논문명 : DiVa: An Accelerator for Differentially Private Machine Learning)
또한 이번 연구는 지금까지는 없던 차등 프라이버시가 적용된 인공지능 반도체를 세계 최초로 개발했다는 점에서 의의가 있으며, 차등 프라이버시 인공지능 기술을 대중화해 인공지능 기반 서비스 사용자들의 개인정보를 보호하는 데에 큰 도움을 줄 수 있을 것으로 보인다. 또한, 가속기의 성능 향상은 인공지능 연구 효율을 높여 차등 프라이버시 인공지능 모델의 정확도 개선에도 기여할 것으로 보인다.
한편 이번 연구는 한국연구재단, 삼성전자, 그리고 반도체설계교육센터 (IDEC, IC Design Education Center)의 지원을 받아 수행됐다.
메모리-중심 인공지능 가속기 시스템 개발
삼성미래기술육성재단이 지원한 우리 대학 연구진이 세계 최초로 `프로세싱-인-메모리(Processing-In-Memory, 이하 PIM)' 기술을 기반으로 한 인공지능 추천시스템 학습 알고리즘 가속에 최적화된 지능형 반도체 시스템 개발에 성공했다.
전기및전자공학부 유민수 교수 연구팀은 PIM 기술 기반의 메모리-중심 인공지능 가속기 반도체 시스템을 개발했다고 16일 밝혔다. 유 교수는 관련 분야에서 그동안의 탁월한 연구 성과를 인정받아 올해 아시아에서 유일하게 페이스북 패컬티 리서치 어워드(Facebook Faculty Research Award)를 수상했다.
인공지능 기술을 기반으로 고안된 추천시스템 알고리즘은 구글(Google), 페이스북(Facebook), 유튜브(YouTube), 아마존(Amazon) 등 빅테크 기업들이 콘텐츠 추천 및 개인 맞춤형 광고를 제작하는데 기반이 되는 핵심 인공지능 (AI) 기술이다. 온라인 광고를 통한 수입은 구글과 페이스북과 같은 실리콘밸리의 빅테크 기업의 주 수익 모델인 만큼 고도화된 추천 인공지능 기술에 대한 수요는 최근 들어 급상승하는 추세다.
페이스북이 최근 공개한 자료에 따르면 페이스북 데이터센터에서 처리되는 인공지능 연산의 70%가 추천 알고리즘을 처리하는 데에 사용되며, 인공지능 알고리즘 학습을 위한 컴퓨팅 자원의 50%를 추천 알고리즘을 학습하는 데 사용하고 있다.
유민수 교수 연구팀은 최근 메모리 반도체에 인공지능 연산 기능이 추가된 프로세싱-인-메모리(PIM) 기술 기반의 지능형 반도체 시스템을 개발하는 데 성공했다. 유 교수팀이 개발한 이 시스템은 인공지능 추천시스템 알고리즘의 학습 과정을 엔비디아(NVIDIA)의 그래픽카드(GPU)를 사용하는 기존 인공지능 가속 시스템 대비 최대 21배까지 빠르다고 연구팀 관계자는 설명했다.
지능형 메모리 반도체 기술은 우리나라의 AI 반도체 세계시장 공략을 위한 핵심기술로 주목받고 있다. 특히 정부에서도 `AI 종합 반도체 강국 실현'이라는 비전 아래 막대한 국가적 투자를 아끼지 않는 핵심 투자 분야다. 따라서 유 교수팀의 연구 성과는 향후 막대한 수요와 급성장이 예상되는 세계 AI 반도체 시장에서 메모리-중심으로 설계된 PIM 기술의 상용화 및 성공 가능성을 시사한다는 점에서 의미가 크다고 전문가들은 평가하고 있다.
유민수 교수는 서강대와 KAIST에서 각각 학사와 석사를 거쳐 미국 텍사스 오스틴 주립대에서 박사학위를 취득한 후 지난 2014년 인공지능 컴퓨팅 기술 기업인 미국 엔비디아(NVIDIA) 본사에 입사했다. 엔비디아에 입사한 이후 줄곧 인공지능 컴퓨팅 가속을 위한 다양한 하드웨어 및 소프트웨어 시스템 연구를 주도했으며 지난 2018년부터 우리 대학 전기및전자공학부 교수로 재직 중이다.
전기및전자공학부 권영은 박사과정이 제1 저자, 이윤재 석사과정이 제2 저자로 참여한 이번 연구 결과는 세계 최초의 추천시스템 학습용 가속기 시스템 개발 성과라는 학술 가치를 인정받아 컴퓨터 시스템 구조 분야 최우수 국제 학술대회인 IEEE International Symposium on High-Performance Computer Architecture(HPCA)에서 `Tensor Casting: Co-Designing Algorithm-Architecture for Personalized Recommendation Training' 이라는 논문 제목으로 내년 2월에 발표된다.