Microsoft의 신규 음성 AI가 대화 에이전트의 대기 시간을 줄이는 방법
요약
Microsoft AI가 실시간 음성 대화 에이전트의 지연 시간을 줄이기 위해 MAI-Transcribe-2-Streaming과 MAI-Voice-2.1/Flash를 발표했습니다. 이 기술은 텍스트 변환 과정에서 중간 결과를 빠르게 반환하여, 에이전트가 발화 확정 전부터 추론 및 도구 준비를 병행할 수 있게 합니다. 이를 통해 기존 방식 대비 대기 시간을 줄이고 더욱 자연스러운 음성 상호작용을 구현하는 것이 핵심입니다.
핵심 포인트
- MAI-Transcribe-2-Streaming은 100ms부터 임시 문자열 반환으로 빠른 입력 처리 가능.
- 에이전트가 중간 결과를 활용해 추론 및 도구 준비를 선행할 수 있게 함.
- MAI-Voice-2.1-Flash는 응답 속도에 초점을 맞춰 낮은 지연 시간 구현.
- 기술의 공식적인 사용은 Public Preview 단계이며, 워크로드 권장 사항이 아님.
사람과 AI가 음성으로 대화할 때, 중요한 것은 단순히 지능(賢さ)만이 아닙니다.
상대방이 말을 마친 후에야 AI가 텍스트를 확정하고, 생각하고, 도구를 호출하며, 답변을 만드는 과정에서 발생하는 작은 대기 시간이 여러 단계로 누적되면, 대화는 갑자기 '기계와의 상호작용'처럼 느껴지게 됩니다.
Microsoft AI는 2026년 10월 1일, 실시간 텍스트 변환 모델인 MAI-Transcribe-2-Streaming과 음성 생성 모델인 MAI-Voice-2.1 / MAI-Voice-2.1-Flash를 발표했습니다.
이번 핵심은 음성의 입력(入口)과 출구(出口)를 동시에 빠르게 만든 것입니다. 텍스트 변환이 중간 결과를 반환하기 때문에, 에이전트는 발화가 완전히 확정되기 전부터 의도 검토나 도구 준비를 시작할 수 있습니다.
MAI-Transcribe-2-Streaming은 음성을 받는 동안 '임시 문자열(暫定の文字列)'을 반환하고, 나중에 안정적인 확정 결과로 업데이트합니다. Microsoft는 첫 번째 부분 결과가 음성 수신 후 약 100밀리초여서부터 나오기 시작한다고 설명했습니다.
이는 '답변이 100밀리초 만에 완성된다'는 의미가 아닙니다. 텍스트 변환의 일부가 빨리 보이기 때문에, 후속 추론이나 도구 준비를 병행할 수 있다는 이야기입니다.
기존 방식은 발화 종료를 기다린 후에야 텍스트 변환 → 추론 → 음성 생성 순서로 진행됩니다. 새로운 구성에서는 중간 결과를 받으면서 '예약 변경일 수도 있다', '고객 정보가 필요할 수도 있다'와 같이 미리 준비할 수 있습니다.
다만, 중간 결과는 수정될 수 있습니다. 예를 들어 '취소...가 아니라 일정 변경'과 같은 대화에서 너무 빨리 도구를 실행하는 것은 위험합니다. 빠르게 생각하기 시작하는 것과 확정되기 전에 되돌릴 수 없는 작업을 수행하는 것은 분리해야 합니다.
이번 3가지 모델은 음성 에이전트의 '귀'와 '입' 역할을 분담합니다.
- MAI-Transcribe-2-Streaming: 60개 언어 실시간 텍스트 변환. 연속적인 언어 감지 지원. -
- MAI-Voice-2.1: 23개 언어・26 로케일 음성 생성. 동일한 목소리 질감으로 여러 언어를 말할 수 있는 구성. -
- MAI-Voice-2.1-Flash: 응답 속도를 중시한 음성 생성. Microsoft는 45초 분량의 음성을 150밀리초의 end-to-end 지연 시간으로 생성한다고 합니다.
요금은 Microsoft AI 발표 시점 기준으로, Streaming 텍스트 변환이 연말까지 시간당 0.54달러, Voice 2.1이 백만 문자당 22달러, Voice 2.1 Flash가 백만 문자당 15달러로 책정되었습니다. Azure의 가격은 지역, 계약, 표시 통화에 따라 달라지므로, 도입 판단 시에는 실제 테넌트(tenant) 화면을 확인해야 합니다.
Microsoft는 MAI-Transcribe-2-Streaming이 Artificial Analysis의 스트리밍 음성 인식 평가에서 확정 결과와 중간 결과 모두 정확도 1위를 차지했다고 발표했습니다. 또한 사내 평가에서는 '가장 가까운 경쟁사보다 단어 표시 속도가 2배 빠르다'고 주장합니다.
여기서는 경계를 나누어 읽어야 합니다.
공식 카탈로그와 Microsoft Learn에서 확인할 수 있는 것은, 60개 언어 지원, 중간/확정 결과, Realtime API 및 Azure Speech SDK, 그리고 현재 **퍼블릭 프리뷰(public preview)**라는 점입니다. 프리뷰에는 SLA가 없으며, Microsoft도 본 서비스 워크로드(workload)를 권장하지 않습니다.
반면, '2배 빠르다', 'Voice Flash는 55% 빠르고 약 60% 저렴하다'는 것은 Microsoft의 비교 주장입니다. 비교 조건이나 대상 모델이 공개 정보만으로는 충분히 갖춰지지 않기 때문에, 독립적으로 검증된 일반 사실로 취급할 수 없습니다.
Artificial Analysis는 제3자 벤치마크이지만, 이번에 여기서 직접 확인할 수 있었던 상세 결과는 Microsoft가 인용한 범위까지입니다. 랭킹은 참고가 될 수는 있지만, 일본어, 고유명사, 잡음(雑音), 다중 화자 등 자신의 현장에서 동일한 정확도가 보장된다고 할 수 없습니다.
흥미로운 점은 단순히 음성 채팅보다는 '들으면서 업무를 진행하는' 사용 사례입니다.
- 취재나 회의에서 발화 중부터 핵심 후보/출처 후보 정리하기
- 상품 상담에서 요청을 들으며 필요한 자료나 확인 항목 준비하기
- 다국어 콘텐츠에서 목소리 일관성을 유지하며 여러 언어로 전개하기
- 음성 에이전트가 도구를 호출하기 전에, 중간 결과와 확정 결과를 2단계로 검증하기
MORI에게 중요한 것은 대기 시간의 짧음 그 자체라기보다, 사람이 말하는 시간과 AI의 준비 시간을 겹칠 수 있다는 점입니다. 기사 제작, 상담 대응, 조사 보조 등, 대화 다음에 반드시 다른 작업이 이어지는 상황일수록 효과적입니다.
다만, 음성 클론은 몇 초의 참조 음성으로 가능하다고 합니다. Microsoft는 동의 가드레일을 내장했다고 설명했지만, 본인 동의, 이용 목적, 저장 및 재사용 규칙은 운영 측에도 남아 있습니다.
Microsoft의 새로운 음성 모델군은 음성 에이전트가 '듣고-생각하고-말하기' 과정을 중첩하여 대기 시간을 줄이는 방향을 명확히 보여주었습니다.
특히 주목할 점은 발화 도중의 문자열을 사용하여 추론이나 도구 준비를 시작할 수 있다는 것입니다. 한편, 중간 결과는 변동될 수 있으므로, 되돌릴 수 없는(irreversible) 작업은 확정된 결과나 추가 확인을 기다리는 설계가 필수적입니다.
현재 시점에서는 퍼블릭 프리뷰 상태입니다. 속도에 대한 주장은 매력적이지만, 실제 운영 환경에서는 일본어, 고유명사, 잡음, 오작동 시 취소까지 포함한 평가가 필요합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기