Realtime-Venus, 최첨단 멀티모달 점수를 달성하다
요약
Realtime-Venus는 비디오 이해 및 음성 대화 벤치마크에서 최고 성능을 달성한 최첨단 멀티모달 모델입니다. 이 모델은 풀-듀플렉스 아키텍처를 통해 실시간 상호작용 능력을 보여주며, Gemini 3.1 Live와 GPT-4o 같은 기존 시스템보다 우수한 대화 연속성을 입증했습니다.
핵심 포인트
- 풀-듀플렉스(full-duplex) 아키텍처로 실시간 상호작용에 강점
- 비디오 및 음성 이해 벤치마크에서 다수 최고 점수 기록
- 사용자 끼어들기 등 복잡한 대화 상황에서도 높은 지속률 유지
Realtime-Venus가 여러 비디오 이해 및 음성 대화 벤치마크에서 새로운 최고 점수를 기록했습니다. 이 모델은 9B 오디오-비주얼 모델과 전용 음성 모델을 풀-듀플렉스(full-duplex)의 연속적으로 지각하는 아키텍처에 결합하여, 네이티브 음성 생성을 제공하는 동시에 도구 사용(tool use)을 비동기적으로 위임합니다.
이전까지 대부분의 멀티모달 에이전트는 하프-듀플렉스(half-duplex) 모드로 작동했거나, 백그라운드 계산을 위해 대화를 일시 중지하는 사후적 추론 파이프라인에 의존했습니다. Gemini 3.1 Live와 GPT-4o 같은 시스템은 인상적인 단일 모달 성능을 보여주었지만, 시각 및 청각 스트림 전반에 걸친 원활하고 실시간 상호작용에는 미치지 못했습니다.
Realtime-Venus-Omni는 8개의 비디오 벤치마크 중 6개에서 최고 점수를 기록하며 StreamingBench에서 70.2%를 달성했습니다. “[1]에 따르면, 평가된 온라인 모델 중에서 Realtime-Venus-Omni는 StreamingBench (70.2%), OVO-Bench (64.7%), Daily-Omni (81.3%)을 포함한 8개 비디오 벤치마크 중 6개에서 가장 높은 점수를 달성했습니다.” 이 모델의 성능 향상은 다양한 스트리밍 시나리오 전반에 걸쳐 이전 온라인 기준선(baseline) 대비 일관된 우위를 보여줍니다.
Realtime-Venus-Audio는 네 가지 음성 작업에서 선두를 차지하며 MMAU에서 78.0%를 기록했습니다. “[1]에 따르면, 8개 오디오 이해 및 음성 질의응답 벤치마크 전반에 걸쳐 Realtime-Venus-Audio는 MMAU (78.0%), MMAU-Pro (63.2%), Llama Questions (83.8%), Speech CMMLU (67.8%)에서 비교된 모델들을 능가했으며, VoiceBench AlpacaEval 최고 점수인 4.81과 동등한 수준을 보여주었습니다.” 이 성능은 지각(perception) 전용 모델과 음성 생성까지 해야 하는 완전 대화형 에이전트 사이의 격차를 줄이고 있습니다.
Full-Duplex-Bench v1.5에서 Realtime-Venus-Audio는 사용자 끼어들기(user interruptions)의 75%에 응답하며 최대 97%까지 지속률(continuation rates)을 유지합니다. “Full-Duplex-Bench v1.5에서 Realtime-Venus-Audio는 사용자 끼어들기에 75%로 응답하고, 백채널(backchannels), 다른 방향으로 향하는 발화(other-directed speech), 배경 음성(background speech) 조건에서 각각 97%, 88%, 86%의 지속률을 달성하여 Gemini 3.1 Live와 GPT-4o를 세 가지 지속률 지표 모두에서 능가했습니다.” []1[] 이는 사용자가 끼어들거나 시스템 위로 말을 할 때에도 고품질의 대화가 유지될 수 있음을 보여줍니다.
본 논문은 통제된 벤치마크 환경에서 단지 9B 체크포인트만을 평가했기 때문에, 더 큰 모델로 확장하는 것, 다양한 네트워크 조건에서의 지연 시간(latency), 그리고 분포를 벗어난 시각적 장면(out-of-distribution visual scenes)에 대한 견고성(robustness)에 대해서는 여전히 미해결 질문을 남깁니다. 이는 향후 연구가 외부 API가 예측할 수 없는 지연 시간을 보일 때 비동기 도구 위임(asynchronous tool delegation)이 어떻게 작동하는지, 그리고 유사한 아키텍처가 백조개-억 개 매개변수 규모(hundred-billion-parameter scale)에서도 장점을 유지할 수 있는지 탐구해야 함을 시사합니다.
만약 이러한 결과들이 실제 운영 환경에서 유지된다면, 멀티모달 에이전트의 벤치마크 스위트는 실시간 대화 연속성을 무시하는 불완전한 프록시(proxies)로 진척도를 측정하는 대신, 풀-듀플렉스 끼어들기 지표를 일급 평가 기준(first-class evaluation criterion)으로 통합해야 합니다.
참고문헌
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기