
Kimi K3, 에이전트 지식 작업 벤치마크 AA-Briefcase에서 Fable 5에 이어 2위 기록, 하지만 Opus 4.8보다 높은 운영
요약
Moonshot의 Kimi K3 모델이 에이전트 지식 작업 벤치마크인 AA-Briefcase에서 Fable 5에 이어 2위를 기록했습니다. 뛰어난 분석 성능을 보여주었으나, 높은 운영 비용과 긴 작업 시간이라는 과제를 안고 있습니다.
핵심 포인트
- AA-Briefcase 벤치마크에서 Elo 1543 기록하며 2위 달성
- Claude Fable 5와 대등한 수준의 분석 품질 보유
- 작업당 평균 비용이 $10.57로 이전 세대 대비 약 10배 증가
- 높은 턴 수와 API 속도로 인해 작업당 평균 약 1시간 소요
Kimi K3는 우리의 에이전트 지식 작업 (agentic knowledge work) 벤치마크인 AA-Briefcase에서 Fable 5 다음으로 높은 성적을 거두었으나, 작업당 평균 거의 1시간이 소요되며 운영 비용은 Opus 4.8보다 더 많이 듭니다.
지난주 @Kimi_Moonshot은 Artificial Analysis Intelligence Index에서 57점을 기록한 2.8T 파라미터 모델 Kimi K3를 출시했습니다. 이는 Opus 4.8 및 GPT-5.5와 같은 모델들과 대등한 수준입니다. AA-Briefcase에서 Kimi K3는 1543의 Elo 점수를 기록했는데, 이는 Kimi K2.6 대비 +727의 향상된 수치이며, Claude Fable 5 (1574)에 이어 두 번째로 높은 기록입니다.
AA-Briefcase는 에이전트 지식 작업 (agentic knowledge work)을 위한 우리의 새로운 독점 벤치마크로, 수천 개의 복잡한 입력 파일에 걸친 현실적인 작업들로 구성된 완전 비공개 데이터셋을 통해 모델을 테스트합니다. 작업에는 스프레드시트, 프레젠테이션, UI 목업 (UI mock-ups)과 같은 결과물이 필요하며, 성능은 정확성, 분석 품질, 그리고 프레젠테이션 품질을 기반으로 단일 AA-Briefcase Elo로 통합됩니다.
AA-Briefcase에서 Kimi K3의 주요 결과:
➤ Fable 5에 이어 2위: Kimi K3는 1543의 AA-Briefcase Elo를 달성하여 전체에서 두 번째로 높은 점수를 기록했습니다. 이는 GPT-5.6 Sol (최대 1501), Claude Sonnet 5 (최대 1388), Claude Opus 4.8 (최대 1347)보다 앞선 수치입니다. 이는 이전 세대인 Kimi K2.6 (816) 대비 +727의 향상된 결과이며, Kimi K3를 Fable 5 바로 다음 순위에 올려놓았습니다.
➤ 강력한 객관적 및 분석적 성능, 상대적으로 약한 프레젠테이션: Kimi K3는 51%의 루브릭 통과율 (rubric pass rate)을 달성하여 Claude Fable 5 (56%)에 이어 2위를 기록했으며, Claude Sonnet 5 (최대 42.3%) 및 GPT-5.6 Sol (최대 41.8%)보다 앞섰습니다. 또한 1754의 분석 품질 (analytical quality) Elo를 기록하여 Claude Fable 5 (1744)와 대등한 수준을 보였습니다. 프레젠테이션 품질은 상대적으로 약하여, 프레젠테이션 Elo는 1471로 GPT-5.6 Sol (최대 1660) 및 Claude Opus 4.8 (최대 1492)보다 낮았습니다.
➤ 작업당 비용 약 10배 증가: Kimi K3의 작업당 평균 비용은 $10.57로, Kimi K2.6 대비 약 10배 증가하여 AA-Briefcase에서 실행 비용이 가장 높은 모델 중 하나로 분류되었습니다. 이는 모델 토큰 가격(token pricing), 출력 토큰(output tokens) 사용량 증가, 그리고 상대적으로 높은 턴(turn) 사용량에 기인합니다. Kimi K3는 작업당 평균 83턴을 사용하며, 이는 Claude Fable 5의 67턴 및 GPT-5.6 Sol (최대)의 50턴과 대조적입니다. Kimi K3의 가격은 입력/출력 토큰 1M(백만) 개당 $3/$15이며, 캐시된 토큰(cached tokens)에 대해서는 90% 할인이 적용됩니다.
➤ 작업당 평균 약 1시간 소요: Kimi K3의 AA-Briefcase 작업당 평균 시간(Time per AA-Briefcase Task)은 56.4분입니다. 이는 높은 턴 수, 높은 출력 토큰 사용량, 그리고 자체 제공되는 Kimi API의 낮은 속도로 인해 발생합니다.
[IMG:1]
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기