
KAME를 오픈 모델로 구동하여 MT-Bench로 벤치마크 평가 수행
요약
Sakana AI의 음성 대화 모델 KAME를 오픈 모델로 구동할 수 있도록 개조하고, MT-Bench를 통해 벤치마크 성능을 평가한 연구 결과입니다. STS 모델의 저지연성과 LLM의 고지능을 결합한 하이브리드 구조를 분석하고, 툴 콜(Tool Call)을 통한 실시간 정보 처리 가능성을 시험했습니다.
핵심 포인트
- KAME의 STS와 카스케이드형 하이브리드 아키텍처 분석
- 오픈 모델 기반 KAME 구동 및 MT-Bench 벤치마크 수행
- 백엔드 LLM에 툴 콜을 적용하여 실시간 정보 처리 능력 검증
- Moshi 기반 프론트엔드 STS 모델의 작동 원리 확인
서론
시드니 대학교 대학원의 이이다 다이세이(飯田大晟)입니다. 본 기사는 Fixstars에서의 15일간의 인턴십 동안 수행한 내용을 정리한 것입니다.
음성 대화 모델 「KAME」는 Sakana AI가 발표한, 저지연 STS 모델과 고정밀 텍스트 LLM을 하이브리드로 결합한 모델입니다. 논문에서는 STS 모델 수준의 저지연을 달성하면서도, 카스케이드형(Cascade) 아키텍처에 가까운 성능을 달성했다고 보고되었습니다. 또한, 백엔드 LLM은 교체가 가능하다고 주장하고 있습니다.
KAME는 STT가 업데이트될 때마다 LLM 호출을 수행하므로, 0.4초 간격으로 고빈도 LLM 호출을 발생시킵니다. GPT-4.1과 Google Cloud Speech-to-Text를 전제로 설계되어, 장시간 운용 시 비용이 많이 발생합니다. 또한, 오픈 모델(Open Model)에서의 벤치마크 결과는 공개되어 있지 않습니다.
또한, 음성 모델이 실시간 정보를 다루게 하는 것에도 수요가 있을 것이라고 생각합니다. 콜센터 운용 등을 상상해 보면, 실시간 예약 정보를 확인하거나 등록 정보를 참조하고 싶은 케이스가 생각될 수 있습니다.
따라서 본 기사에서는 KAME를 오픈 모델로 구동할 수 있도록 개조하고, MT-Bench로 벤치마크 평가를 수행한 결과를 보고합니다. 아울러, 백엔드 LLM에 툴 콜(Tool Call)을 전달하여 STS 모델이 실시간 정보를 다룰 수 있는지 시험했습니다.
배경
음성 대화 모델의 두 가지 접근 방식
음성 대화 모델에는 크게 두 가지 방식이 있습니다.
엔드 투 엔드(End-to-End)형 (STS 모델)
음성을 토큰(Token)으로 취급하여 다음 음성 토큰을 추론하는 방식입니다. 저지연으로 대화가 가능하다는 점과, 음성을 그대로 토큰으로 만들기 때문에 목소리의 톤이나 속도 등의 정보를 유지할 수 있다는 장점이 있습니다. 반면, 대화의 깊은 이해나 지식이 부족하다는 과제가 있습니다.

카스케이드(Cascade)형 아키텍처
STT → LLM 추론 → TTS 순으로 단계적으로 처리하는 방식입니다. 문자 기반의 LLM을 이용하기 때문에 지능이 높은 반면, 파이프라인 처리에 시간이 걸려 지연(Latency)이 과제가 됩니다.

KAME의 아키텍처
KAME는 STS 모델과 카스케이드형 아키텍처의 하이브리드입니다. 병렬 실행을 통해 STS의 응답 속도와 목소리 톤 등의 정보를 유지하면서 정밀도를 향상시키고 있습니다.

Moshi
KAME의 프론트엔드 STS 모델은 Moshi를 기반으로 합니다. Moshi 내부에서는 텍스트 LLM으로 Helium이 사용되며, (입력 음성, 내부 텍스트, 출력 음성)의 세 가지 스트림(Stream)을 입력으로 받아 다음 토큰을 추론합니다. 내부 텍스트 토큰과 음성 토큰의 쌍을 추론함으로써, 음성이 텍스트에 이끌려 성능이 향상되는 설계입니다.

KAME가 추가한 것
KAME는 Moshi의 스트림에 LLM의 답변을 제4의 스트림으로 추가합니다. LLM의 답변은 스트림으로서 Helium에 주입되어 음성 생성을 가이드합니다. 최종적인 출력 음성을 결정하는 것은 Helium이므로, 목소리 톤 등의 정보를 유지할 수 있습니다. LLM의 답변을 그대로 발화하는 것이 아니라, 자연스러운 연결을 유지합니다.

백엔드 LLM
백엔드 LLM은 스트리밍 STT의 출력이 업데이트될 때마다 호출됩니다. 사용자의 말이 진행됨에 따라 정보량이 늘어나 답변의 정밀도가 향상됩니다. 가장 마지막에 보낸 답변을 채택합니다. 백엔드 LLM은 교체 가능한 설계입니다.

그림은 사용자가 말을 진행함에 따라 STT 정보가 업데이트되고, 그 결과로 LLM의 출력이 변경되는 모습을 나타냅니다. 그때그때의 최신 출력이 Helium에 입력되어 출력 가이드에 사용됩니다.
오픈 모델 대응
기존 KAME는 OpenAI API와 Google Cloud Speech-to-Text에 직접 의존하고 있어, GPU 클러스터에서 셀프 호스팅(Self-hosting) 운용을 하려면 교체가 필요했습니다. LLM / STT를 ABC + Adapter 패턴으로 추상화하여, 백엔드에 의존하지 않도록 리팩토링했습니다.
LLM: OpenAI의 Chat Completion API 호환 형식을 이용하며, 모델명과 엔드포인트(Endpoint)를 환경 변수로부터 결정합니다. vLLM 등의 OpenAI 호환 서버를 구축하면 임의의 모델을 연결할 수 있습니다.
STT: Google Cloud 어댑터는 삭제하고, WebSocket을 통한 셀프 호스트(Self-hosted) STT로 일원화했습니다. 스트리밍(Streaming)을 지원하는 표준 프로토콜이 존재하지 않기 때문에, 이번에는 WebSocket 프로토콜을 직접 구현했습니다.
벤치마크 평가
선정 모델
STT로부터 수시로 받아쓰기(Transcription) 내용을 전달받고, 이를 LLM으로 흘려보내는 아키텍처이기 때문에 STT에는 출력의 스트리밍(Streaming) 기능이 필수적입니다. 또한, LLM은 STS 모델이 먼저 답변하고, LLM의 답변이 도착한 후에 반영되므로 답변 속도가 중요하며 작은 모델이 적합합니다.
이번에는 다음과 같은 구성을 채택했습니다.
STT: Qwen3-ASR-1.7B (vLLM) — Nemotron-ASR와 비교했으나, 체감 성능이 더 높았기에 채택.
LLM: gemma-4-31B-it (vLLM) — 벤치마크 평가에서는 GLM-5.1도 사용.
실행 환경
STT: H100
KAME: H100
LLM: RTX PRO 6000 - STT와 KAME, LLM의 GPU를 분리하여 각각 별도의 프로세스와 별도의 GPU에서 구동하는 구성
평가 방법
KAME 논문에서 사용된 방법을 최대한 재현했습니다.
MT-Bench의 reasoning, STEM, humanities 항목으로 평가 - MT-Bench의 프롬프트(Prompt)를 그대로 사용 (MT-Bench 논문의 표준 절차를 따름)
- 음성은 VoiceBench에서 MT-Bench 해당 항목의 테스트 케이스를 이용
- 6회 측정을 수행하여 평균을 스코어로 산출
레이턴시(Latency) 측정 방법: 비무음 프레임을 RMS로 판정하여, 사용자 발화 종료 시각과 응답 발화 시작 시각의 차이를 측정합니다. 각 시각은 다음과 같이 정의합니다.
채점 모델: STT와 LLM 모두 실행 환경과 동일 (Qwen3-ASR-1.7B / gemma-4-31B-it)
MT-Bench 테스트 케이스
27개의 테스트 케이스 (humanities 9 / reasoning 8 / stem 10)를 사용했습니다. 다음과 같은 문제가 출제됩니다.
reasoning: Imagine you are participating in a race with a group of people. If you have just overtaken the second person, what's your current position? Where is the person you just overtook? → 정답: "You are in second place." 사람들과 경주에 참여하고 있다가 2위인 사람을 막 추월했을 때, 당신의 현재 순위는? 방금 추월한 사람은 몇 위인가? → 정답: 2위
stem: In the field of quantum physics, what is superposition, and how does it relate to the phenomenon of quantum entanglement? 양자 물리학 분야에서 중첩(Superposition)이란 무엇이며, 양자 얽힘(Quantum entanglement) 현상과 어떻게 관련되는가?
humanities: Provide insights into the correlation between economic indicators such as GDP, inflation, and unemployment rates. Explain how fiscal and monetary policies affect those indicators. GDP, 인플레이션, 실업률 등 경제 지표 간의 상관관계에 대한 통찰을 제공하고, 재정 및 통화 정책이 이러한 지표에 어떻게 영향을 미치는지 설명하시오.
결과
MT-Bench 결과는 다음과 같았습니다.

MT-Bench 평가 결과
평균 스코어는 KAME가 Moshi를 근소하게 앞질렀습니다. 카테고리별로 살펴보면 reasoning에서는 향상이 보이지만, STEM과 humanities에서는 거의 차이가 없습니다. 레이턴시의 경우, Moshi의 중앙값은 0초인 반면 KAME는 0.6초 정도였습니다.
고찰
1. 이번 테스트에서의 Moshi와의 비교
정성 평가
KAME가 Moshi보다 우수함을 확인할 수 있었습니다.
케이스 1 (qid103): 토마스의 수수께끼
문제: Thomas is very healthy, but he has to go to the hospital every day. What could be the reasons?
한국어 번역: 토마스는 매우 건강하지만, 매일 병원에 가야 합니다. 그 이유는 무엇일까요?
예상 정답: Thomas may work at a hospital.
한국어 번역: 토마스는 병원에서 일하고 있을지도 모릅니다.
Moshi의 답변 (STT 결과): "Hey, what's up? Yes, indeed. Oh no, I know. Well, it could be a reaction to the flu shot."
한국어 번역: "안녕, 잘 지내? 응, 맞아. 오 안돼, 나도 알아. 음, 독감 예방 주사에 대한 반응일 수도 있겠네."
KAME의 답변 (STT 결과): "Okay, I need to figure out what could be causing Thomas to go to the hospital every day. The options are a doctor, a nurse, and a mental health professional. Do we know what his medical condition is, or what type of medical treatment he needs there?"
한국어 번역: "좋아요, 토마스가 왜 매일 병원에 가는지 알아내야겠군요. 선택지는 의사, 간호사, 그리고 정신 건강 전문가입니다. 그의 건강 상태가 어떤지, 혹은 그곳에서 어떤 종류의 의료 처치가 필요한지 알고 있나요?"
Moshi는 빗나간 답변을 내놓고 있지만, KAME는 의료 종사자를 후보로 제시하며 방향성 측면에서 정답에 근접해 있습니다. 다만, 대화를 계속 이어가려고 시도하고 있습니다. 또한, 후반부에는 그가 건강하다는 사실을 잊었는지 증상에 대해 묻고 있습니다.
케이스 2 (qid159): 일본의 비즈니스 매너
문제: What are some business etiquette norms when doing business in Japan?
한국어 번역: 일본에서 비즈니스를 할 때의 비즈니스 에티켓 규범에는 어떤 것들이 있나요?
Moshi의 답변 (STT 결과): "Hi, how are you doing? I'm not sure, but I've heard of some things like handshakes, but that's just a misunderstanding. I don't know where that comes from."
한국어 번역: "안녕, 어떻게 지내? 잘 모르겠지만, 악수 같은 것들에 대해 들어본 적은 있어. 하지만 그건 그냥 오해일 뿐이야. 그게 어디서 나온 건지 모르겠어."
KAME의 답변 (STT 결과): "When conducting business in Japan, you should arrive on time, use proper titles, maintain eye contact, respect personal space, and turn off your phone during meetings. Be extremely punctual, respect hierarchy, and never write on someone's card."
한국어 번역: "일본에서 비즈니스를 수행할 때는 정시에 도착하고, 적절한 직함을 사용하며, 시선을 맞추고, 개인 공간을 존중하며, 회의 중에는 전화기를 꺼두어야 합니다. 매우 시간을 엄수하고, 위계질서를 존중하며, 타인의 명함에 글을 쓰지 마십시오."
Moshi는 일관된 답변을 하지 못하고 있지만, KAME는 긴 답변임에도 일관성을 유지합니다. KAME는 일본의 특징도 어느 정도 파악하고 있으며, "Be extremely punctual(매우 시간을 엄수하라)" 등은 일본의 맥락을 반영하고 있다고 생각됩니다. 또한, 명함에 글을 쓰지 말라고 언급한 점도 일본의 비즈니스 관습을 잘 포착하고 있습니다.
테스트 케이스 카테고리 분석
MT-Bench 점수를 보면, reasoning(추론)에서는 KAME가 Moshi를 앞질렀지만, STEM과 humanities(인문학)에서는 거의 차이가 나지 않았습니다. reasoning은 추론 능력을 묻는 문제가 많아 백엔드 LLM의 능력을 활용하기 쉬운 반면, STEM과 humanities는 실시간 추론을 수행하기 어려운 문제가 많기 때문에 차이가 나지 않았던 것으로 생각됩니다.
2. KAME 논문과의 비교
KAME 논문에서 공개된 MT-Bench 결과는 다음과 같습니다.

출처: KAME 논문 Table 2로부터 인용
논문의 결과와 이번 결과를 비교해 보면, 큰 차이가 있음을 알 수 있습니다. 원인으로는 다음과 같은 점들을 고려할 수 있습니다.
- 평가용 프롬프트 (Prompt)가 공개되지 않았기 때문에, 평가 조건이 다를 가능성이 있습니다.
- 백엔드 LLM (Large Language Model), STT (Speech-to-Text) 모델, 채점 모델이 다릅니다.
레이턴시 (Latency)에 대해서는, 논문에서는 중앙값(Median)으로 0.0초(사용자 발화 종료 전 응답 시작)로 되어 있습니다. 이는 사용자가 말을 마치기 전에 응답을 시작함을 의미합니다. 이번 결과에서 KAME의 중앙값은 0.64초로, 말을 마치는 것을 기다린 후 응답을 시작하는 경우가 대부분이었습니다.
3. 벤치마크의 타당성
실제로 테스트 케이스를 확인해 보면, 상당히 엄격하게 감점된 케이스가 다수 있었습니다. 구체적인 문제문·답변·채점 쌍을 제시하며, MT-Bench가 음성 대화 모델의 평가로서 적합한지 검토합니다.
케이스 1: 토마스의 수수께끼 (qid103)
문제: Thomas is very healthy, but he has to go to the hospital every day. What could be the reasons?
한국어 번역: 토마스는 매우 건강하지만, 매일 병원에 가야 합니다. 그 이유는 무엇일까요?
KAME의 답변 (STT 결과): "Okay, I need to figure out what could be causing Thomas to go to the hospital every day. The options are a doctor, a nurse, and a mental health professional. Do we know what his medical condition is, or what type of medical treatment he needs there?"
한국어 번역: 알겠습니다, 토마스가 왜 매일 병원에 가는지 원인을 파악해야겠군요. 선택지는 의사, 간호사, 그리고 정신 건강 전문가입니다. 그의 의료 상태가 어떤지, 혹은 그곳에서 어떤 종류의 의료 처치를 받아야 하는지 알고 있나요?
채점: 1 / 10
채점 이유: "Instead of providing a solution, the assistant treats the prompt as a problem it needs to 'figure out' and begins asking questions and listing options as if it were thinking out loud or confused about the context."
한국어 번역: 해결책을 제공하는 대신, 어시스턴트는 프롬프트를 스스로 '파악해야 할' 문제로 취급하며, 마치 생각을 소리 내어 말하거나 문맥에 혼란을 느끼는 것처럼 질문을 던지고 옵션을 나열한다.
처음에는 의료 종사자를 언급했지만, 후반부에서 질문을 던져 버립니다. MT-Bench의 채점 기준에서는 이를 "답변이 되지 않음"으로 판정합니다. Moshi 단독 모델도 1점이지만, 답변 내용의 질은 다릅니다 (정성 평가의 케이스 1 참조).
케이스 2: 알프스와 라인강의 영향 (qid150, STEM)
문제: How have the Alps and Rhine River influenced settlement and agriculture in Western Europe? List three impacts.
한국어 번역: 알프스와 라인강은 서유럽의 정착과 농업에 어떤 영향을 미쳤습니까? 세 가지 영향을 나열하세요.
KAME의 답변 (STT 결과): "The Alps acted as a natural landscape, and their influence by providing natural defense. Second, the Rhine enabled trade and natural transport. Third, fertile river valleys supported intensive farming and early cities."
한국어 번역: 알프스는 자연 경관으로서 작용하며 자연적인 방어를 제공함으로써 영향을 미쳤습니다. 둘째, 라인강은 무역과 자연적인 운송을 가능하게 했습니다. 셋째, 비옥한 강 유역은 집약 농업과 초기 도시를 지원했습니다.
채점: 4 / 10
채점 이유: "세 가지 요소(알프스 방어, 라인강 무역, 강 유역 농업)는 정확하게 나열되었으나, 문법이 불완전하고 깊이가 부족함. 이들이 '어떻게' 영향을 미쳤는지에 대한 설명이 없음."
일본어 번역: 3가지 요소(알프스의 방어, 라인강의 교역, 하곡의 농업)는 정확하게 열거되어 있으나, 문법이 불완전하고 깊이가 부족함. '어떻게' 영향을 미쳤는지에 대한 설명이 없음.
3가지 요소에 대해 올바르게 언급하고 있습니다. 대화라는 점을 고려하면 이 정도 분량이 적절하다고 느껴지지만, MT-Bench에서는 '깊이 부족'으로 감점되었습니다.
케이스 3: 소크라테스의 대화법 (qid158, 인문학 (humanities))
문제: 플라톤이 기록한 소크라테스의 철학적 대화에서 사용된 주요 방법은 무엇입니까? 상세히 설명해 주세요.
일본어 번역: 플라톤이 기록한 소크라테스의 철학적 대화에서의 주요 수법은 무엇입니까? 상세히 설명해 주세요.
KAME의 답변 (STT 결과): "Socrates employed the first form of cooperative argumentative dialogue, based on asking and answering questions, to stimulate critical thinking and expose contradictions."
일본어 번역: 소크라테스는 질문과 답변에 기반한 협력적 논증적 대화의 첫 번째 형태를 사용하여, 비판적 사고를 자극하고 모순을 드러냈습니다.
채점: 4 / 10
채점 이유: "소크라테스식 문답법 (maieutics)의 식별은 정확하며 사실적 오류가 없음. 그러나 너무 짧으며, 소크라테스적 반어법 (irony), 엘렌코스 (elenchus), 또는 소피스트에 대한 비판에 대한 언급이 없어 깊이가 부족함."
일본어 번역: 소크라테스식 문답법 (maieutics)의 식별은 정확하며 사실적 오류는 없다. 하지만 너무 짧고, 소크라테스적 반어법 (irony)이나 엘렌코스 (elenchus), 궤변가에 대한 비판에 대한 언급이 없어 깊이가 부족하다.
이 경우 역시 올바른 답변을 수행했음에도 불구하고, 깊이가 부족하다는 이유로 감점되었습니다.
MT-Bench는 음성 대화용이 아니라 일반적인 텍스트 LLM (Large Language Model)을 위한 벤치마크입니다. 위의 구체적인 사례를 통해, 음성 모델의 평가로서는 다음과 같은 문제점이 있음을 알 수 있었습니다.
- "모든 질문에 답하지 않음", "답변이 되지 않음" 등의 감점이 다수 발생
음성 인식 오류나 구어체 특유의 표현 변화가 감점 대상이 됩니다. 또한 음성 대화이기에 간결하게 말하는 경향이 있으며, 그로 인해 얕다는 지적을 받는 케이스도 눈에 띕니다.
문자 기반의 LLM을 평가하기 위한 벤치마크이므로, 음성 대화 모델을 올바르게 평가하고 있는지에 대해서는 의문이 남습니다.
4. 백엔드 LLM의 성능은 충분함
로그를 조사하면, 백엔드 LLM은 대부분 올바른 답변을 생성하고 있었습니다. 하지만 Helium이 이를 수신하여 음성 토큰을 출력할 때, 답변 내용이 바뀌어 버리는 케이스가 발견되었습니다.
구체적 사례 (qid102: 백악관 수수께끼):
문제: You can see a beautiful red house to your left and a hypnotic greenhouse to your right, an attractive heated pink place in the front. So, where is the White House?
일본어 번역: 왼쪽에는 아름다운 빨간 집, 오른쪽에는 매혹적인 온실, 환상적인 초록색 집, 앞에는 매력적인 분홍색 장소가 보입니다. 그렇다면, 백악관은 어디에 있습니까?
로그를 통해 LLM이 여러 차례에 걸쳐 올바른 답변을 생성했음을 확인할 수 있었습니다:
[LLM final] 워싱턴 D.C.에 있습니다! 전형적인 수수께끼네요...
[LLM final] 워싱턴 D.C.에 있습니다! 전형적인 수수께끼입니다...
[LLM final] 맞습니다! 힌트는 '백악관(the white house)' 그 자체입니다 - 워싱턴 D.C.에 있습니다!
...
4세대 모두가 올바르게 "In Washington D.C.!"라고 답변했습니다. 하지만 KAME의 실제 출력(STT 전사 결과)은 다음과 같았습니다:
아니요, 백악관이 전혀 아닙니다. 온실 수수께끼를 위한 온실입니다.
어떤 LLM 출력과도 일치하지 않는, 완전히 다른 오답이 생성되었습니다. 점수는 1점이었습니다.
LLM은 올바르게 답변했음에도 불구하고, Helium이 oracle 토큰을 무시하고 독자적인 텍스트를 생성해 버린 패턴입니다. 백엔드 LLM의 성능은 충분하다고 판단됩니다. 정량 평가에서도 모델 변경에 따른 점수 변화는 없었습니다. KAME 내부에서 사용되는 Moshi의 성능을 향상시키거나, Helium의 추종성(followability)을 높이는 작업이 필요합니다.
툴 콜(Tool Call)을 통한 실시간 정보 활용
KAME의 백엔드 LLM에 툴 콜을 전달하여, STS 모델이 실시간 정보를 다룰 수 있도록 하는 시도를 진행했습니다. Moshi 단독으로는 외부 API를 호출하는 기능이 없지만, KAME의 백엔드 LLM을 경유한다면 구현이 가능할 것입니다.
LLM은 툴 콜을 올바르게 사용하여 날짜를 가져올 수 있었습니다. 로그를 확인하면 LLM이 날짜를 정확히 가져와 답변하고 있음을 알 수 있습니다:
[LLM] 네, 맞습니다. 오늘은 실제로 2026년 7월 13일입니다...
하지만 Helium이 음성 토큰을 추론할 때 다른 날짜로 바뀌어 버렸습니다:
[KAME] 오늘은 실제로 2020년 7월 13일입니다...
LLM이 올바른 정보를 가져왔음에도 불구하고, Helium이 이를 음성으로 올바르게 변환하지 못했습니다. 이는 Helium이 oracle 스트림의 정보와 자신의 생성 사이의 우선순위를 적절히 정하도록 학습되지 않았기 때문인 것으로 보입니다.
요약
- KAME의 백엔드(LLM / STT)를 추상화하여, OpenAI 호환 엔드포인트와 셀프 호스팅 STT를 통해 오픈 모델을 구동할 수 있도록 했습니다.
- 정량 및 정성 평가를 통해 Moshi 단독 모델보다 성능이 향상되었음을 확인했습니다.
- 논문 보고 값과의 괴리가 관찰되었습니다. 이는 테스트 환경을 완벽히 재현하지 못한 것이 원인으로 판단됩니다.
- LLM의 답변을 Helium이 바꿔버리거나, 툴 콜의 반환값을 Helium이 바꿔버리는 등의 문제가 있어, 추가적인 성능 향상을 위해서는 STS의 개선이 필요합니다.
참고 문헌
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기