IMO 2026에서 다양한 LLM들을 비교했습니다 [R]
요약
IMO 2026 문제를 활용하여 다양한 LLM의 수학적 추론 능력을 벤치마크한 연구 결과입니다. 프런티어 모델은 하네스 유무와 관계없이 높은 성능을 보였으나, 복잡한 문제에서는 여전히 핵심 아이디어 도출과 환각 문제라는 한계를 보였습니다.
핵심 포인트
- IMO 문제는 학습 데이터에 없는 새로운 문제로 일반 지능 측정에 적합함
- 프런티어 모델은 하네스(Harness)를 통해 성능이 개선되나 한계 존재
- 맞춤형 멀티 에이전트 하네스인 AutoFyn이 성능 향상에 기여함
- 수학적 검증 가능 영역에서도 모델의 환각 현상은 지속됨
- 가장 어려운 문제는 하네스조차 핵심적인 논리적 축약 과정을 제공하지 못함
국제 수학 올림피아드 (International Mathematical Olympiad)의 문제들이 LLM (Large Language Models)을 위한 좋은 벤치마크 (benchmark)로 기능하는 데에는 몇 가지 이유가 있습니다:
- 문제들이 새롭기 때문에 어떤 모델의 학습 데이터 (training data)에도 포함되어 있지 않습니다.
- 어려운 수학 문제들은 일반 지능 (general intelligence) 능력을 측정하는 매우 좋은 대리 지표 (proxy)가 됩니다.
- 이 문제들은 오케스트레이션 (orchestration) / 하네스 엔지니어링 (harness engineering)의 도움을 받을 수 있는 복잡한 다단계 작업 (multi-step tasks)입니다.
결과: 프런티어 모델 (Frontier models) (sol 및 fable)은 하네스 (harness)와 관계없이 완벽하거나 완벽에 가까운 점수를 얻을 수 있었습니다. sonnet과 opus 모두 웹앱 (webapp) 성능은 상당히 저조했으나, 제공업체 하네스 (claude code)를 통해 개선되었으며, 저희가 개발한 맞춤형 멀티 에이전트 (multi-agent) 하네스인 AutoFyn을 사용하여 더욱 개선되었습니다. 하네스를 사용하더라도 프런티어 모델의 성능에는 미치지 못했습니다. 오픈 웨이트 모델 (Open weight model)인 GLM은 하네스가 없는 sonnet과 거의 비슷한 수준의 성능을 보였으며, AutoFyn을 통해 유사하게 개선되었습니다. 수치 점수는 아래 첨부된 논문에서 확인할 수 있습니다.
채점은 다른 프런티어 모델과 수동 검증 (manual verification)을 통해 이루어졌습니다 (저희는 전직 IMO 메달리스트로서 결과의 타당성을 검토(sanity check)할 수 있습니다). 모델이 잘못된 솔루션을 주장하는 경우(예: sonnet의 P3 문제)가 있었으므로, 수학과 같은 검증 가능한 영역에서도 환각 (hallucination) 문제는 여전히 지속되고 있습니다. 가장 어려운 문제인 P3의 경우, 모든 하네스에서 모든 서브 프런티어 모델 (sub-frontier model)들이 핵심적인 축약 (key reduction) 과정을 놓쳤으며, 여기에는 다른 모든 과정은 증명했으나 동일한 단계에서 멈춰버린 20시간의 실행 결과도 포함됩니다. 하네스는 검색 (retrieval)과 검증 (verification)을 제공했지만, 솔루션에 필요한 핵심 아이디어 (key idea)를 제공하지는 못했습니다.
논문: https://github.com/SignalPilot-Labs/AutoFyn/blob/main/results/imo-2026/autofyn-beyond-model-imo26-report.pdf
감사 추적 (Audit Trails): https://github.com/SignalPilot-Labs/AutoFyn/tree/main/results/imo-2026
/u/pequalnp92가 r/MachineLearning에 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기