본문 바로가기 대메뉴 바로가기

24시간 말하는 AI비서 가능성 여는 '스피치SSM' 개발​
조회수 : 124 등록일 : 2025-07-03 작성자 : 홍보실

(왼쪽부터) 전기및전자공학부 노용만 교수, 박세진 박사과정

< (왼쪽부터) 전기및전자공학부 노용만 교수, 박세진 박사과정 >

최근 음성 언어 모델(Spoken Language Model, SLM)은 텍스트 없이 인간의 음성을 학습해 음성의 언어적, 비언어적 정보를 이해 및 생성하는 기술로 텍스트 기반 언어 모델의 한계를 넘어서는 차세대 기술로 각광받고 있다. 하지만 기존 모델은 장시간 콘텐츠 생성이 요구되는 팟캐스트, 오디오북, 음성비서 등에서 한계가 두드러졌는데, 우리 연구진이 이런 한계를 뛰어넘어, 시간 제약 없이 일관되고 자연스러운 음성 생성을 실현한 스피치SSM’을 개발하는데 성공했다. 

우리 대학 전기및전자공학부 노용만 교수 연구팀의 박세진 연구원(박사과정)이 장시간 음성 생성이 가능한 음성 언어 모델 스피치SSM(SpeechSSM)’을 개발했다고 3일 밝혔다. 

이번 연구는 국제 최고 권위 머신러닝 학회인 ICML(International Conference on Machine Learning) 2025에 전체 제출된 논문 중 약 1%만이 선정되는 구두 논문 발표에 확정돼 뛰어난 연구 역량을 입증할 뿐만 아니라 우리 대학의 인공지능 연구 능력이 세계 최고 수준임을 다시 한번 보여주는 계기가 될 전망이다.

음성 언어 모델(SLM)은 중간에 텍스트로 변환하지 않고 음성을 직접 처리함으로써, 인간 화자 고유의 음향적 특성을 활용할 수 있어 대규모 모델에서도 고품질의 음성을 빠르게 생성할 수 있다는 점이 큰 강점이다.

그림 1. SpeechSSM 개요. SpeechSSM의 하이브리드 상태공간 모델은 중첩된 고정 크기 윈도우로 인코딩된 의미 토큰(USM-v2)에 대해 LM 목표로 학습됨. 비자기회귀 방식의 음성 디코더(SoundStorm)는 중첩된 의미 토큰 윈도우를 화자 조건에 따라 음향 코덱(SoundStream)으로 변환함

< 그림 1. SpeechSSM 개요. SpeechSSM의 하이브리드 상태공간 모델은 중첩된 고정 크기 윈도우로 인코딩된 의미 토큰(USM-v2)에 대해 LM 목표로 학습됨. 비자기회귀 방식의 음성 디코더(SoundStorm)는 중첩된 의미 토큰 윈도우를 화자 조건에 따라 음향 코덱(SoundStream)으로 변환함 >

그러나 기존 모델은 음성을 아주 세밀하게 잘게 쪼개서 아주 자세한 정보까지 담는 경우, ‘음성 토큰 해상도가 높아지고 사용하는 메모리 소비도 증가하는 문제로 인해 장시간 음성의 의미적, 화자적 일관성을 유지하기 어려웠다. 

연구팀은 이러한 문제를 해결하기 위해 하이브리드 상태공간 모델(Hybrid State-Space Model)을 사용한 음성 언어 모델인스피치SSM’를 개발해 긴 음성 시퀀스를 효율적으로 처리하고 생성할 수 있게 설계했다. 

이 모델은 최근 정보에 집중하는 어텐션 레이어(attention layer)’와 전체 이야기 흐름(장기적인 맥락)을 오래 기억하는 순환 레이어(recurrent layer)’를 교차 배치한 하이브리드 구조를 통해 긴 시간 동안 음성을 생성해도 흐름을 잃지 않고 이야기를 잘 이어간다. 또한, 메모리 사용량과 연산량이 입력 길이에 따라 급격히 증가하지 않아, 장시간의 음성을 안정적이고 효율적으로 학습하고 생성할 수 있다. 

스피치SSM은 음성 데이터를 짧은 고정된 단위(윈도우)로 나눠 각 단위별로 독립적으로 처리하고, 전체 긴 음성을 만들 경우에는 다시 붙이는 방식을 활용해 쉽게 긴 음성을 만들 수 있어 무한한 길이의 음성 시퀀스(unbounded speech sequence)를 효과적으로 처리할 수 있게 했다. 

또한 음성 생성 단계에서는 한 글자, 한 단어 차례대로 천천히 만들어내지 않고, 여러 부분을 한꺼번에 빠르게 만들어내는 비자기회귀(Non-Autoregressive)’방식의 오디오 합성 모델(SoundStorm)을 사용해, 고품질의 음성을 빠르게 생성할 수 있게 했다. 

기존은 10초 정도 짧은 음성 모델을 평가했지만, 연구팀은 16분까지 생성할 수 있도록 자체 구축한 새로운 벤치마크 데이터셋인 ‘LibriSpeech-Long'을 기반으로 음성을 생성하는 평가 태스크를 새롭게 만들었다. 

기존 음성 모델 평가 지표인 말이 문법적으로 맞는지 정도만 알려주는 PPL(Perplexity)에 비해, 연구팀은 시간이 지나면서도 내용이 잘 이어지는지 보는 'SC-L(semantic coherence over time)', 자연스럽게 들리는 정도를 시간 따라 보는 'N-MOS-T(naturalness mean opinion score over time)' 등 새로운 평가 지표들을 제안해 보다 효과적이고 정밀하게 평가했다.

그림 2. 다양한 음성 언어 모델(Spoken LM)에서 고려된 최대 시퀀스 길이. 기존 음성 언어 모델은 최대 200초 길이까지 학습 및 평가가 이루어졌으나, SpeechSSM은 16분 길이의 음성을 학습하고 평가할 수 있음. 본 연구의 모델은 일정한 메모리 사용으로 이론적으로 무한 길이 생성이 가능하지만, 실험에서는 평가를 위해 16분으로 제한함

< 그림 2. 다양한 음성 언어 모델(Spoken LM)에서 고려된 최대 시퀀스 길이. 기존 음성 언어 모델은 최대 200초 길이까지 학습 및 평가가 이루어졌으나, SpeechSSM은 16분 길이의 음성을 학습하고 평가할 수 있음. 본 연구의 모델은 일정한 메모리 사용으로 이론적으로 무한 길이 생성이 가능하지만, 실험에서는 평가를 위해 16분으로 제한함 >

새로운 평가를 통해 스피치SSM 음성 언어 모델로 생성된 음성은 긴 시간 생성에도 불구하고 초기 프롬프트에서 언급된 특정 인물이 지속적으로 등장하며, 맥락적으로 일관된 새로운 인물과 사건들이 자연스럽게 전개되는 모습을 확인했다. 이는 기존 모델들이 장시간 생성 시 쉽게 주제를 잃고 반복되는 현상을 보였던 것과 크게 대조적이다. 

박세진 박사과정생은 기존 음성 언어 모델은 장시간 생성에 한계가 있어, 실제 인간이 사용하도록 장시간 음성 생성이 가능한 음성 언어 모델을 개발하는 것이 목표였다이번 연구 성과를 통해 긴 문맥에서도 일관된 내용을 유지하면서, 기존 방식보다 더 효율적이고 빠르게 실시간으로 응답할 수 있어, 다양한 음성 콘텐츠 제작과 음성비서 등 음성 AI 분야에 크게 기여할 것으로 기대한다라고 밝혔다.

그림 3. 임베딩 유사도(SC-L)를 이용하여 측정한 10초 프롬프트와 16분 생성 결과의 100단어 구간 간 의미 유사도. 생성 길이가 길어짐에 따라 의미 일관성이 저하되는 기존 방법들과 달리 SpeechSSM은 실제 음성과 비슷한 추이로 의미 일관성을 유지함

< 그림 3. 임베딩 유사도(SC-L)를 이용하여 측정한 10초 프롬프트와 16분 생성 결과의 100단어 구간 간 의미 유사도. 생성 길이가 길어짐에 따라 의미 일관성이 저하되는 기존 방법들과 달리 SpeechSSM은 실제 음성과 비슷한 추이로 의미 일관성을 유지함 >

이 연구는 제1 저자인 우리 대학 박세진 박사과정 학생이 구글 딥마인드(Google DeepMind)와 협력해, ICML(국제 머신러닝 학회) 2025에서 716일 구두 발표로 소개될 예정이다. 

논문제목: Long-Form Speech Generation with Spoken Language Models

DOI: 10.48550/arXiv.2412.18603 

한편, 박세진 박사과정생은 비전, 음성, 언어를 통합하는 연구를 수행하며 CVPR(컴퓨터 비전 분야 최고 학회) 2024 하이라이트 논문 발표, 2024ACL(자연어 처리 분야 최고 학회)에서 우수논문상(Outstanding Paper Award) 수상 등을 통해 우수한 연구 역량을 입증한 바 있다.

그림 4. SpeechSSM의 연산 효율성. (좌) TPU v5e에서 모델별 및 생성 길이별 배치 디코딩 최대 처리량 (우) TPU v5e에서 단일 샘플(batch size 1)을 목표 길이까지 디코딩하는 데 소요된 시간

< 그림 4. SpeechSSM의 연산 효율성. (좌) TPU v5e에서 모델별 및 생성 길이별 배치 디코딩 최대 처리량 (우) TPU v5e에서 단일 샘플(batch size 1)을 목표 길이까지 디코딩하는 데 소요된 시간 >

[데모 페이지 링크]

https://google.github.io/tacotron/publications/speechssm/

관련뉴스