Manus 팀이 Offloop를 통해 방금 보여준 것을 이해하시나요?
요약
Manus 팀의 Offloop는 단일 에이전트의 한계를 극복하기 위해 오케스트레이션 계층에 집중한 새로운 AI 에이전트 시스템을 선보였습니다. 3B 파라미터의 디스패처 모델 D1을 통해 태스크를 효율적으로 배분하며, 기존 도구 대비 압도적인 비용 효율성과 성능을 기록했습니다.
핵심 포인트
- D1 디스패처 모델을 통한 에이전트 오케스트레이션 최적화
- Claude Code 및 Codex 대비 높은 GDPval 벤치마크 점수 달성
- 태스크당 실행 비용을 기존 도구 대비 대폭 절감
- 단일 모델 성능보다 오케스트레이션 계층의 중요성 강조
Manus 팀이 Offloop를 통해 방금 보여준 것을 이해하시나요?
Fred는 Manus가 폭발적으로 성장하기 전에 떠났습니다. 그는 단일 에이전트 (single agents)의 한계에서 무너졌던 것들을 가져와 처음부터 다시 구축했습니다. Jin은 제품 코드를 한 줄도 작성하기 전에 Ipsos에서 100만 달러 이상의 실제 AI 자동화 주문을 성사시켰습니다.
단 4명의 인원이 2.4조 달러 규모의 미국 일자리를 다루는 지식 노동 벤치마크에서 Claude Code와 Codex를 모두 앞질러 GDPval 점수 84.9를 기록했습니다.
실제 작동 방식:
→ D1(3B 파라미터 디스패처 모델 (dispatcher model))은 매 단계마다 어떤 에이전트가 작동하고 어떤 에이전트가 대기할지를 결정합니다.
→ 전체 220개 태스크의 GDPval 실행 비용은 363달러였습니다. 동일한 실행에 대한 Claude Code의 청구 비용은 3,100달러였습니다.
→ 태스크당 비용: Offloop 1.65달러, Codex 5.20달러, Claude Code 14.38달러
→ GPT-5.4 Codex가 38.9를 기록한 JobBench에서 67.2를 기록했습니다.
→ 두 개의 태스크가 밤사이에 멈췄을 때, D1은 새벽 2시에 두 건 모두를 사람에게 에스컬레이션(escalated)했습니다. 그들은 이를 조용히 재실행하는 대신 로그에 그대로 남겨두었습니다.
진정한 베팅:
→ 모든 연구소(lab)는 더 나은 단일 모델 (single model)을 만들기 위해 경주하고 있습니다.
→ Offloop는 하부 구조보다 오케스트레이션 계층 (orchestration layer)이 더 중요하다고 베팅하고 있습니다.
이것들은 여전히 그들 자신의 수치이며, 팀 외부에서 이를 재실행해 본 사람은 아직 없습니다.
하지만 GDPval 골드 세트 (gold set)는 공개되어 있고 그들은 자신들의 하네스 설정 (harness config)을 공유하고 있으므로, 누구나 직접 확인할 수 있습니다. 그것이 바로 보도 자료로는 흉내 낼 수 없는 종류의 자신감입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @socialwithaayan (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기