
모두가 공유하는 차트는 실제 이야기를 놓치고 있습니다
요약
일반적으로 공유되는 벤치마크 차트는 모델의 전체 성능을 오도할 수 있습니다. 특정 점수만 비교하는 것은 문제 해결에 필요한 단계 수나 토큰 사용량 같은 중요한 맥락적 정보를 놓치게 합니다. 따라서 단 하나의 리더보드 스냅샷만을 신뢰하기보다는, 실제 워크로드를 직접 테스트하여 모델 간의 진정한 격차를 파악해야 합니다.
핵심 포인트
- 벤치마크 점수만으로는 모델 성능을 완전히 판단할 수 없다.
- 실제 성능은 단계 수와 토큰 사용량 등 맥락적 정보가 중요하다.
- 하나의 벤치마크 차트는 전체 지능을 대변하지 않는다.
모두가 공유하는 차트는 실제 이야기를 놓치고 있습니다.
muse spark 1.3이 deepswe v1.1을 75.4%로 능가합니다. gpt-6 astra는 74.1%로 반 포인트 뒤에 위치합니다. gemini 3.8 flash가 1.6 포인트 차이로 뒤처집니다. claude fable 5.1은 이 특정 차트에서 가장 낮은 67.4%를 기록했습니다.
하지만 이 차트는 다음을 보여주지 않습니다. astra는 29단계에 걸쳐 30k 출력 토큰을 사용하여 74.1%를 달성했으며, 이는 실행당 약 $6.52입니다. gemini는 143k 토큰과 166단계라는 더 많은 단계를 사용해 거의 동일한 점수를 기록하며 astra와 1점 차이로 근접했습니다. (아무도 단계 수를 이야기하지 않습니다. 모두가 백분율만 스크린샷으로 찍습니다.)
이 특정 차트에서 최고 점수와 최저 점수는 3점 차이입니다. 이 3점이 이야기가 아닙니다. 실제 격차는 문제를 29단계 만에 해결하는 모델과 166단계를 필요로 하는 모델 사이의 간격입니다.
fable 5.1의 67.4% 역시 다른 곳에서의 성능과 일치하지 않습니다. fable은 astra가 61%인 반면, 더 광범위한 지능 지수에서는 66%로 선두를 달리고 있습니다. 하나의 벤치마크 차트는 스냅샷일 뿐이며, 어떤 모델이 귀하의 특정 워크로드에 실제로 더 좋은지에 대한 판결은 아닙니다.
여전히 전체 이야기를 알려주는 단 하나의 리더보드를 찾지 못했습니다. 스크린샷을 신뢰하기 전에 직접 작업을 실행해 보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @cyrilxbt (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기