
AgiBot WITA-Omni, DailyOmni 벤치마크에서 85.21점 기록하며 Gemini를 능가
요약
AgiBot의 WITA-Omni가 새로운 Thinker-Talker-Actor 아키텍처를 통해 DailyOmni 벤치마크에서 85.21점을 기록하며 Gemini 등 주요 모델을 능가했습니다. 이 모델은 음성, 행동, 표정을 단일 타임라인에서 동기화하여 Embodied AI에 최적화된 성능을 보여줍니다.
핵심 포인트
- DailyOmni 벤치마크 8개 지표 중 6개에서 1위 달성
- Thinker-Talker-Actor 아키텍처로 음성과 행동의 시간적 불일치 해결
- 텍스트, 오디오, 모터 명령을 공통 타임라인에 결합하여 지연 시간 단축
- 모델 크기, 학습 연산량 및 가중치는 현재 미공개 상태
AgiBot WITA-Omni가 새로운 Thinker-Talker-Actor 아키텍처를 통해 DailyOmni 벤치마크에서 85.21점을 기록하며 Google Gemini, ByteDance Doubao, Alibaba Qwen을 앞질렀습니다.
AgiBot WITA-Omni는 DailyOmni 벤치마크에서 85.21점을 기록하며 Google Gemini와 ByteDance Doubao를 능가했습니다. 이 모델은 단일 타임라인 상에서 음성, 행동, 얼굴 표정을 동기화하는 Thinker-Talker-Actor 아키텍처를 사용합니다.
주요 사실 (Key facts)
- WITA-Omni는 DailyOmni 벤치마크에서 85.21점을 기록했습니다.
- 8개 벤치마크 지표 중 6개에서 1위를 차지했습니다.
- Google Gemini, ByteDance Doubao, Alibaba Qwen을 능가합니다.
- 시간적 동기화(temporal sync)를 위해 Thinker-Talker-Actor 아키텍처를 사용합니다.
- 모델 크기, 학습 연산량(training compute) 또는 가중치(weights)는 공개되지 않았습니다.
AgiBot의 WITA-Omni는 DailyOmni 벤치마크에서 85.21점을 기록하여 8개 지표 중 6개에서 1위를 차지했으며, Google Gemini, ByteDance Doubao, Alibaba Qwen을 능가했습니다 AgiBot WITA-Omni Full-Modal Mo에 따르면. 이 벤치마크는 시각(vision), 언어(language), 오디오(audio), 행동(action) 전반에 걸친 풀-모달(full-modal) 이해도를 테스트하며, 이는 인지, 음성, 물리적 움직임을 조정해야 하는 Embodied AI 시스템에 점점 더 중요해지는 영역입니다.
이 모델은 단일 타임라인 상에서 음성, 행동, 얼굴 표정을 동기화하는 Thinker-Talker-Actor 아키텍처를 사용합니다. 추론(inference) 시점에 모달리티(modalities)를 별개의 채널로 취급하여 병합하는 이전의 멀티모달(multimodal) 모델들과 달리, WITA-Omni는 모든 출력물에 대해 통합된 시간적 표현(temporal representation)을 생성합니다. AgiBot은 이 아키텍처가 휴머노이드 로봇과 대화형 에이전트(interactive agents)의 필수 요구 사항인 언어 출력과 물리적 움직임 사이의 실시간 조율을 가능하게 한다고 주장합니다.
이 아키텍처가 중요한 이유
Thinker-Talker-Actor 설계는 기존 풀-모달 (full-modal) 모델의 근본적인 한계인 음성과 행동 사이의 시간적 불일치 (temporal misalignment) 문제를 해결합니다. Google의 Gemini와 ByteDance의 Doubao는 정적인 멀티모달 (multimodal) 이해 능력은 뛰어나지만, 생성된 음성을 공유된 클록 (shared clock) 상의 물리적 행동과 네이티브하게 동기화하지는 못합니다. 반면, AgiBot의 방식은 텍스트, 오디오, 모터 명령의 토큰 레벨 (token-level) 생성을 공통된 타임라인에 결합함으로써, 사고(thinking)와 실행(doing) 사이의 지연 시간 (latency)을 줄입니다.
AgiBot은 모델 크기, 학습 연산량 (training compute), 또는 데이터셋 구성을 공개하지 않았습니다. 또한 회사는 발표 시점 기준으로 가중치 (weights)나 기술 논문 (technical paper)을 공개하지 않았습니다. 오픈 벤치마크 (open benchmarks)나 어블레이션 연구 (ablation studies) 없이는, DailyOmni 점수가 진정한 아키텍처적 이점을 반영하는 것인지 아니면 벤치마크 특화 튜닝 (benchmark-specific tuning)의 결과인지 검증하는 것이 불가능합니다.
경쟁 환경
이번 결과로 AgiBot은 임바디드 AI (embodied AI) 경쟁에서 세 명의 주요 라이벌보다 앞서게 되었습니다. Google은 Gemini의 멀티모달 (multimodal) 역량에 막대한 투자를 해왔으며, 당사의 지식 그래프 (knowledge graph)에 따르면 AI 에이전트 (AI agents) 및 로보틱스 (robotics) 분야에서 AgiBot과 경쟁하고 있습니다. ByteDance와 Alibaba 또한 활발한 풀-모달 (full-modal) 연구 프로그램을 유지하고 있습니다. 2026년 7월 25일에 출시된 Alibaba의 RynnBrain 1.1은 2B, 9B, 122B MoE 모델을 통해 로봇 조작 (robot manipulation)을 목표로 합니다.
Google이 불과 며칠 전인 2026년 7월 28일에 세 가지 Gemini Flash 모델을 출시하고, Gemini API Managed Agents에 백그라운드 실행 및 MCP 지원을 추가했다는 점을 고려하면 AgiBot의 승리는 주목할 만합니다. 이러한 타이밍은 AgiBot이 WITA-Omni를 클라우드 중심의 멀티모달 (multimodal) 시스템에 대한 임바디드 (embodied) 대안으로 포지셔닝하고 있음을 시사합니다.
미해결 과제
AgiBot은 WITA-Omni의 추론 지연 시간 (inference latency)이나 하드웨어 요구 사항을 발표하지 않았습니다. DailyOmni 벤치마크는 물리적 로봇에서의 실시간 성능을 측정하는 것이 아니라 오프라인 이해도 (offline comprehension)만을 측정합니다. Thinker-Talker-Actor 아키텍처가 로보틱스에서 흔히 발생하는 지연 시간 제약 조건 하에서 성능이 저하되는지 여부는 아직 알려지지 않았습니다.
또한 해당 기업은 WITA-Omni가 AgiBot의 자체 휴머노이드 로봇 중 하나에 배포되었는지, 아니면 순수하게 연구용 모델인지는 공개하지 않았습니다.
주목해야 할 점

AgiBot이 기술 논문(technical paper)이나 모델 가중치(model weights)를 공개할지 지켜봐야 합니다. 만약 Thinker-Talker-Actor 아키텍처가 100ms 미만의 지연 시간(latency)을 가진 실제 로봇 배포 환경에서도 일반화될 수 있다면, 이는 체화된 AI (Embodied AI)의 새로운 표준을 세울 수 있습니다. 또한 Google이나 ByteDance가 자체적인 시간 동기화 (temporal-sync) 아키텍처로 대응할지도 주목할 부분입니다.
출처: pandaily.com
원문 게시지: gentic.news
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기