Fusion의 성능 분석 및 벤치마크 점수 관련 의견
요약
본 글은 Fusion 시스템의 성능 분석 및 벤치마크 점수 산정 방식에 대한 의견을 제시합니다. 특히, 발표된 벤치마크 점수는 특정 노력 수준(Artificial Analysis)으로 측정되었으며, 추천 구성과 실제 테스트 구성을 명확히 구분할 필요가 있음을 지적합니다.
핵심 포인트
- Fusion의 핵심 조합은 Fable 5.1 (xhigh) + SWE-2 (medium)이다.
- 벤치마크 점수는 발표된 'Artificial Analysis' 기준으로 측정되어야 한다.
- Fable xhigh + SWE-2 medium 조합이 비용 효율적인 강력한 결과임을 강조한다.
@kloss_xyz @DevinAI Fusion은 훌륭해 보입니다. 그리고 Fable과 SWE-2 조합이 사람들이 가장 먼저 시도해야 할 조합이라는 데 동의합니다. 다만, 제가 수정하고 싶은 부분은 벤치마크 점수에 부여된 노력 수준(effort level)입니다. 스크린샷에 있는 High 설정은 여러분이 추천하는 구성이지, 발표된 결과에 사용된 Artificial Analysis의 구성은 아닙니다.[1]
Artificial Analysis는 Fable 5.1을 xhigh로, SWE-2를 medium으로 테스트했습니다. 또한 Astra도 xhigh로, SWE-2를 medium으로 테스트했습니다.[1] 이들이 바로 Fable의 61.7점과 Astra의 58.9점을 기록한 Fusion 구성입니다. Fable High가 여전히 매우 잘 작동할 수는 있지만, 벤치마크는 그것이 61.7점에 도달했음을 보여주지 않습니다.
단독 비교(solo comparisons)는 훨씬 더 높은 노력 수준에서 실행되었습니다. Fable 5.1은 Claude Code에서 max와 fallback을 사용했고, Astra는 Codex에서 max를 사용했습니다.[2] 따라서 주장할 수 있는 내용은 xhigh 리드와 medium 사이드킥을 가진 Fusion이 비용을 덜 들여 최대 노력 단독 실행에 근접했다는 것입니다. 리드를 xhigh에서 High로 낮추면 점수와 절감액 모두가 달라질 수 있습니다.
이 모든 것이 Fusion의 가치를 떨어뜨리는 것은 아닙니다. Fable xhigh + SWE-2 medium 조합이 61.7점을 기록한 것이, Fable max 단독 실행의 62.2점 대비 측정 비용은 36% 낮다는 점을 고려하면 강력한 결과입니다.[2] 다만 적절한 라벨링이 필요합니다. 즉, 벤치마크 점수는 xhigh + medium 조합으로 얻어졌고, High + medium은 여러분의 실질적인 추천 사항이며 별도의 실행으로 평가되어야 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기