OpenAI o1, AIME 수학 문제에서 83% 점수 기록, 반면 FrontierMath는 모든 모델을 당혹케 함
요약
OpenAI o1이 AIME 수학 시험에서 83%의 높은 성적을 거두며 추론 능력의 진전을 보여주었으나, 박사급 난이도의 FrontierMath 벤치마크에서는 모든 모델이 한계를 드러냈습니다. DeepSeek-V3는 효율적인 MoE 구조와 강화학습을 통해 o1에 근접한 성능을 저비용으로 구현하며 오픈 웨이트 모델의 가능성을 입증했습니다.
핵심 포인트
- OpenAI o1은 AIME 수학 문제에서 83%의 성공률을 기록하며 추론 성능 향상 증명
- DeepSeek-V3는 MoE와 강화학습을 통해 저비용으로 높은 수학적 추론 능력 확보
- FrontierMath 벤치마크 결과, 박사급 수학 문제 해결률은 2% 미만으로 매우 낮음
- 추론 시간 스케일링(Inference-time scaling)이 고난도 연구 수학 해결의 핵심 과제
핵심 요약 (Key Takeaways)
- OpenAI의 기술 보고서에 따르면, OpenAI o1은 2024년 미국 수학 초청 시험 (AIME)에서 GPT-4o가 기록한 13%보다 향상된 83%의 성공률을 달성했습니다.
- DeepSeek-V3는 Mixture-of-Experts (MoE) 아키텍처와 강화학습 (RL)을 사용하여 MATH 벤치마크에서 90.2%를 기록했으며, 이는 560만 달러의 훈련 비용이 보고된 OpenAI o1의 94.4%와 비교됩니다.
- 60명 이상의 수학 전문가들이 구축한 Epoch AI의 FrontierMath 벤치마크는 OpenAI, Google, Anthropic의 선도적인 모델들이 새로운 박사급 (PhD-level) 문제의 2% 미만을 해결한다는 것을 보여주며, 추론 시간 스케일링 (inference-time scaling)만으로는 돌파하지 못할 수도 있는 단단한 한계를 드러냅니다. 고등학교 수학에서의 94%와 박사급 문제에서의 2% 미만 사이의 격차는 AI 추론 (reasoning)이 실제로 어디에 와 있는지를 보여주는 가장 정직한 요약입니다. OpenAI의 o1과 DeepSeek-V3 모두 경시대회 수준의 수학에서 실질적인 진전을 이루었지만, 2024년 말 Epoch AI가 발표한 벤치마크는 연구 수준의 수학이 완전히 다른 문제임을 명확히 보여줍니다.
추론 시간 추론 (Inference-Time Reasoning)으로의 전환
o1과 DeepSeek-V3 모두 추론 시간 (inference time)에 추가적인 연산 자원을 할당함으로써 표준적인 다음 토큰 예측 (next-token prediction)을 넘어섭니다. 때때로 "System 2 사고"라고 불리는 이 개념은 모델이 답변을 확정하기 전에 내부적인 사고 사슬 (chain of thought)을 생성한다는 것입니다. 모델은 사용자가 출력을 보기 전에 되돌아가거나, 단계를 점검하고, 수정할 수 있습니다. OpenAI의 기술 보고서에 따르면, o1은 고등학생을 위한 경시대회 수준의 테스트인 2024년 AIME 문제의 약 83%를 해결했습니다. 이러한 구조화된 추론 시간 없이 GPT-4o는 13%를 기록했습니다.
DeepSeek-V3는 다른 아키텍처 경로를 택합니다. 2024년 말에 발표된 기술 보고서(technical report)에 따르면, 이 모델은 총 6,710억 개의 파라미터 중 토큰당 약 370억 개의 파라미터를 활성화하는 전문가 혼합 (Mixture-of-Experts (MoE)) 프레임워크를 설명합니다. 수학적 증명과 코드에 대해 집중적으로 학습된 이 모델은 MATH 벤치마크에서 o1의 94.4%에 육박하는 90.2%를 기록했습니다. 폐쇄형 (closed-source) 모델과 오픈 웨이트 (open-weights) 모델 사이의 격차가 줄어들고 있다는 점은, 강화학습 (reinforcement learning)과 사고의 사슬 (chain-of-thought) 데이터를 결합한 핵심 레시피가 이제 OpenAI의 울타리 밖에서도 충분히 이해되고 있음을 시사합니다.
훈련 비용 또한 주목할 만한 수치입니다. DeepSeek-V3 기술 보고서에 따르면, 이 모델은 H800 GPU를 사용하여 약 560만 달러의 비용으로 훈련되었습니다. 이 수치가 정확하다면, 9자리 수(억 단위)의 컴퓨팅 예산을 감당할 수 없는 조직들도 고성능 수학적 추론 능력을 확보할 수 있음을 의미합니다. 트레이드오프 (trade-off)는 지연 시간 (latency)입니다. 추론 시간 (inference-time) 추론은 내부적으로 토큰을 소모하므로, 사용자는 더 높은 정확도를 얻는 대신 더 느린 응답을 받게 됩니다. 연구 개발 (R&D) 및 엔지니어링 워크로드의 경우, 이는 대개 적절한 선택입니다.
GSM8K 및 MATH 벤치마크의 포화 상태
지난 몇 년간 AI 연구를 형성해 온 벤치마크들은 이제 선도적인 모델들을 구분하는 데 더 이상 유용하지 않습니다. 약 8,000개의 초등학교 수준 문장제 문제 세트인 GSM8K는 이미 사실상 포화 상태에 도달했으며, 현재 여러 모델이 95% 이상의 점수를 기록하고 있습니다. MATH 벤치마크 또한 동일한 한계치에 도달하고 있습니다. 이 지점에 이르면, 몇 퍼센트 포인트의 점수 차이는 모델이 실제로 문제를 통해 추론하는 것인지, 아니면 단순히 훈련 과정에서 유사한 구조를 흡수한 것인지에 대해 거의 아무런 정보도 제공하지 못합니다.
2024 AIME는 테스트로서 더 견고하게 유지됩니다. 15문제 중 약 12문제를 해결하는 것은 모델을 미국 고등학생 경쟁자 중 최상위권에 위치시킵니다. 이 문제들을 어렵게 만드는 것은 다단계 구조 (multi-step structure)입니다. 즉, 3단계에서의 오류가 10단계의 정답을 소리 없이 망가뜨릴 수 있습니다. o1의 추론 체인 (reasoning chain)에 내장된 자기 수정 루프 (self-correction loop)가 AIME 점수가 급등한 주요 원인입니다. 이는 사용자가 출력을 보기 전에 스스로 오류를 식별하며, 마치 신중한 수학자가 증명을 검토하는 방식으로 작동합니다.
모든 공개 벤치마크 (benchmark)에서 데이터 오염 (Data contamination)은 실제적인 우려 사항입니다. GSM8K와 MATH는 수년 동안 공개되어 왔으며, 이 문제들의 변형들이 훈련 세트 (training sets)에 포함되었을 가능성이 높습니다. 2024 AIME 결과는 이 측면에서 더 신뢰할 수 있는데, 문제들이 모델의 훈련 컷오프 (training cutoffs) 이후에 발표되었기 때문입니다. 이는 추론 능력 (reasoning capability)이 암기된 것이 아니라 실제적임을 시사합니다. 이러한 차이는 문제가 교과서의 내용과 유사한 경우가 드문 공학 및 물리학 응용 분야에서 매우 중요합니다.
FrontierMath와 박사급 한계 (PhD Ceiling)
여기서 중요한 수치는 2% 미만입니다. 이는 OpenAI, Google, 그리고 Anthropic의 선도적인 모델들이 FrontierMath에서 기록한 합산 해결률입니다. FrontierMath는 Epoch AI가 여러 명의 필즈상 (Fields Medalists) 수상자를 포함하여 60명 이상의 전문가 수학자들과 협력하여 2024년 말에 출시한 벤치마크입니다. 이 문제들은 완전히 독창적이며 공개 인터넷에서 구할 수 없고, 인간 박사 학위 소지자가 해결하는 데에도 종종 몇 시간 또는 며칠이 걸립니다. 여기에는 오염을 통한 지름길이 존재하지 않습니다.
실패 양상은 매우 구체적입니다. 현재의 모델들은 논리의 사슬 (chain of logic)을 단계별로 따라갈 수는 있지만, 이른바 '전역적 전략 (global strategy)', 즉 증명을 작성하기 전에 그 증명의 형태를 미리 파악하는 능력에는 어려움을 겪습니다. 많은 FrontierMath 문제들은 관습을 벗어난 도약이나 서로 관련 없는 두 수학 분야의 결합을 요구합니다. 모델들은 문장 단위로는 올바르게 읽히지만, 핵심 부분에 치명적인 결함을 포함하는 증명을 생성하는 경향이 있습니다. 추론 시간 연산 (inference-time compute)을 확장하여 토큰 예산을 높이는 방식은 이 문제를 해결하지 못합니다.
Epoch AI의 데이터에 따르면, 단일 문제에 대해 매우 많은 시도를 하더라도 모델이 정답에 도달하는 경우는 드뭅니다. 이는 단순한 연산량 (compute)의 격차가 아니라, 표현력 (representational)의 격차를 시사합니다. 현재 활발히 연구되는 방향 중 하나는 LLM을 Lean이나 Isabelle과 같은 형식 검증 (formal verification) 시스템과 결합하는 것입니다. 이러한 시스템은 수학적 샌드박스 역할을 합니다. 모델이 증명 단계를 제안하면, 검증기가 논리적으로 유효하지 않을 경우 즉시 거부하고, 모델은 이를 조정합니다. Google DeepMind와 OpenAI 모두 이 분야에서 연구를 진행하고 있으나, 공개된 자료만으로는 어느 쪽이 얼마나 진전했는지 아직 명확하지 않습니다.
수학적 추론의 경제적 및 운영적 함의
강력한 수학 성능은 빌더(builders)들에게 매우 중요한데, 이는 여러 도메인에 걸친 신뢰할 수 있는 다단계 추론 (multi-step reasoning)과 상관관계가 있기 때문입니다. 경시대회 수준의 문제를 해결할 수 있는 모델은 복잡한 재무 감사나 여러 파일에 걸친 소프트웨어 리팩토링 (refactoring) 작업을 수행할 때 단계를 누락할 가능성이 더 낮습니다. 수학 벤치마크 점수와 코딩 성능 사이의 상관관계는 기술 평가에서 자주 인용되지만, 정확한 수치는 평가 방법에 따라 다르며 단일한 권위 있는 출처가 이를 명확하게 규정하고 있지는 않습니다.
비용 구조는 여전히 제약 사항입니다. o1을 실행하는 것은 GPT-4o보다 유의미하게 더 비용이 많이 드는데, 이는 사용자가 이를 직접 보지 못하더라도 제공업체가 내부 추론 토큰 (internal reasoning tokens)에 대해 비용을 청구하기 때문입니다. 어려운 문제는 짧은 최종 답변을 생성하기 위해 수천 개의 내부 토큰을 생성할 수 있습니다. 이로 인해 o1급 모델은 고객 서비스 채팅과 같이 거래량이 많고 마진이 낮은 사용 사례에는 적합하지 않지만, 정확도가 비용을 정당화하는 R&D, 구조 공학 및 법률 분석에는 잘 맞습니다. DeepSeek-V3는 이 계층으로 진입하는 더 저렴한 경로를 제공하지만, 많은 기업 팀은 데이터 처리 및 모델 가중치 (model weights)의 출처에 대해 여전히 신중한 태도를 유지하고 있습니다.
개발자들을 위한 단기적인 방향은 적응형 라우팅 (adaptive routing)입니다. 모든 쿼리에 강력한 추론 모델을 실행하는 대신, GitHub Copilot이나 Cursor와 같은 도구에서 이미 나타나고 있는 것과 같은 오케스트레이션 계층 (orchestration layer)이 작업 복잡도에 따라 모델을 선택합니다. 간단한 산술 연산은 작고 빠른 모델로 전달됩니다. 복잡한 최적화 문제는 추론 중심의 모델로 격상됩니다. 이는 오늘날 해결 가능한 공학적 문제이며, 실질적인 에이전트 워크플로우 설계 (agentic workflow design)가 나아가고 있는 방향이기도 합니다. 현재의 어떤 모델이 알려진 문제 유형을 더 신뢰성 있게 해결하는 것을 넘어, 궁극적으로 진정으로 새로운 수학에 기여할 수 있을지는 여전히 미해결 과제로 남아 있습니다. FrontierMath 수치는 그 이정표가 AIME 결과가 암시하는 것보다 더 멀리 있음을 시사합니다. AI 에이전트 및 자동화 도구에 대한 더 자세한 내용은 저희의 AI 에이전트 섹션 (AI Agents section)을 방문해 주세요.
원문 게시지: https://autonainews.com/openai-o1-scores-83-on-aime-math-while-frontiermath-stumps-all-models/
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기