하나의 모델 패밀리로 두 개의 최고 수준 결과 달성: IOI 및 IMO를 위한 Nemotron 미세 조정
요약
Nemotron 기반의 모델이 지도 학습(SFT), 강화학습(RL) 및 추론 루프를 통해 IOI 2026과 IMO 2026에서 최고 수준의 성과를 달성했음을 보여줍니다. 이는 강력한 기본 모델을 재사용 가능한 레시피로 전문화하여 까다로운 도메인에 적응할 수 있음을 입증합니다.
핵심 포인트
- Nemotron은 IOI 및 IMO와 같은 전문 분야에 적용하기 좋은 기반 모델입니다.
- SFT, RL, 그리고 생성-검증-개선(GenCorrect) 루프가 핵심 성능 향상 방법론입니다.
- 기반 모델을 재사용 가능한 레시피로 전문화하는 것이 중요합니다.
- 적응 방식은 규모와 목표에 따라 다르게 적용될 수 있습니다.
최근 저희의 연구 결과는 Nemotron이 세계적 수준의 전문 모델을 구축하기에 강력하고 적응성이 뛰어난 기반(foundation)임을 보여줍니다. Nemotron 3부터 저희 팀들은 지도 학습 기반 미세 조정(Supervised Fine-Tuning, SFT), 강화학습(Reinforcement Learning, RL), 그리고 피드백 기반 추론(feedback-driven inference)을 사용하여 IMO 2026과 IOI 2026 모두에서 금메달 수준에 도달한 시스템을 구축했습니다.
| 대회 | Nemotron 전문화 모델 | 결과 |
|---|---|---|
| IOI 2026 | SFT 및 GenCorrect를 적용한 Nemotron-3-Ultra-CC | 535.4/600점 (금 기준치 361.12점과 최고 인간 점수 498.27점을 상회) |
| IMO 2026 | 생성-검증-개선 시스템에 적용된 Nemotron 3 Ultra 일반, SFT 및 RL 체크포인트 | 30/42 (공식 금 기준치 29점을 상회) |
IOI 결과는 인간 참가자와 동일한 시간, 인터넷 접속, 제출 제약 조건 하에서 진행된 실시간의 잠재적(prospective) 실행을 통해 나왔습니다. 이는 비공식적인 비지도 기반 벤치마크였으며 공식 IOI 순위에 포함되지 않았습니다. IMO 시스템이 제출한 증명은 공식 IMO 채점관에 의해 평가되었습니다.
'쉽게 미세 조정 가능하다(Easy to fine-tune)'는 것은 단순히 체크포인트를 학습 가능하게 만드는 것 이상을 의미해야 합니다. 이는 유능한 기반 모델이 명확하고 재사용 가능한 레시피를 통해 까다로운 도메인에 적응될 수 있음을 의미합니다.
두 프로젝트 전반에 걸쳐, 그 레시피는 네 가지 부분으로 구성되었습니다:
- 강력한 Nemotron 기본 모델로 시작한다.
- 도메인별 문제와 고품질 추론 과정을 선별(curate)한다.
- SFT와 유용할 경우 RL과 같은 표준 사후 학습 방법(post-training methods)을 적용한다.
- 전문화된 모델을 생성, 평가 및 개선하는 추론 루프(inference loop)와 결합한다.
학습 및 추론 실행은 상당했지만, 근본적인 접근 방식은 친숙하고 재현 가능합니다. 우리는 모든 도전에 대해 새로운 기반 모델을 구축할 필요가 없었습니다. 대신 Nemotron을 해당 작업에 전문화시켰습니다.
경쟁 프로그래밍을 위해 22,000개의 문제를 선별하고 합성 추론 흔적(synthetic reasoning traces)을 생성하여 두 가지 전문 모델을 훈련했습니다. 총 파라미터가 300억 개이고 활성 파라미터가 30억 개인 Nemotron-3-Nano-CC는 SFT와 RL 모두를 거쳤습니다. 총 파라미터가 5,500억 개이고 활성 파라미터가 550억 개인 Nemotron-3-Ultra-CC는 SFT만 받았습니다.
IOI 2025에서의 성능 향상은 전문화의 가치를 명확하게 보여줍니다. Nano는 사후 훈련(post-training) 전 130점에서 SFT를 거쳐 280점, RL을 거쳐 291점으로 개선되었습니다. 반복적인 생성-평가-개선 전략인 GenCorrect를 사용하자 468점에 도달하며 금 기준점인 438.3점을 넘어섰습니다. Ultra-CC는 같은 테스트 시간 전략으로 502점에 도달했습니다.
이러한 실험들은 또한 적응(adaptation)이 모든 규모에서 동일하게 보일 필요가 없다는 것을 보여주었습니다. SFT가 Nano 성능 향상의 대부분을 차지했으며, RL은 더 작지만 일관된 개선을 추가했습니다. 더 강력한 Ultra 모델의 경우, 단 하나의 SFT 에포크만으로 IOI, ICPC, LiveCodeBench Pro 전반에 걸쳐 완전히 사후 훈련된 Nano 모델을 능가하기에 충분했습니다. 이 발견은 IOI 2026에 사용된 대회별 Ultra-CC 시스템 개발에 영향을 주었으며, 해당 시스템은 600점 만점에 535.4점을 기록했습니다.
IMO 프로젝트에서는 동일한 아이디어를 올림피아드 수학에 적용했습니다. Nemotron 3 Ultra를 시작으로, SFT를 거친 전문 모델 하나와 RL을 거친 전문 모델 하나를 훈련했습니다.
SFT 코퍼스에는 15,818개의 고유 증명 문제에 걸쳐 414,890개의 품질 필터링된 예시가 포함되었습니다. 이는 단순히 최종 답만 가르치는 것을 넘어섰습니다. 이 데이터는 증명 생성(proof generation), 개선(refinement), 검증(verification), 그리고 메타-검증(meta-verification)을 다루었기 때문에, 모델은 논거를 구성하고, 격차를 식별하며, 비판에 대응하고, 증명이 완전한지 판단하는 방법을 학습했습니다. RL 모델은 모델의 능력 경계 근처에서 선택된 9,597개의 증명 문제로 훈련되었습니다.
두 가지 모두 사후 훈련된 체크포인트는 개발 실험에서 일반 사용 가능 모델보다 성능이 우수했습니다. SFT 체크포인트가 첫 번째 검색 라운드에서 가장 강력했고, RL 체크포인트가 전반적인 단일 체크포인트 결과에서 최고를 달성했습니다. 이들의 강점은 상호 보완적이었기 때문에 최종 시스템에서는 두 전문 모델과 일반 모델을 모두 사용했습니다.
각 IMO 문제에 대해 모델들은 후보 증명을 생성하고, 점수를 매기고, 비평(critiques)을 작성하며, 가장 유망한 시도를 다듬었습니다. 별도의 고성능 컴퓨팅 단계에서 최종 제출물을 선택했습니다. 이 전체 시스템은 형식적 증명기(formal prover), 외부 도구 또는 인터넷 접속 없이 자연어만으로 작동했습니다. 총 42점 만점에 30점을 획득했으며, 6개 문제 중 4개에서 만점을 받아 공식 금메달 기준을 초과 달성했습니다.
이전 IOI 2025 Hugging Face 게시물에서는 테스트 시간 컴퓨팅(test-time compute)이 어떻게 오픈 웨이트 모델을 금 수준의 성능으로 끌어올릴 수 있는지 보여주었습니다. 이번 새로운 결과는 중요한 부분을 추가합니다: 더 나은 전문화가 추론 시스템에 더 나은 후보, 더 나은 비평가, 그리고 더 나은 다듬기를 제공한다는 것입니다.
IOI에서 GenCorrect는 미세 조정(fine-tuning)의 이점을 여러 피드백 라운드를 거치며 더욱 큰 개선으로 전환했습니다. IMO에서는 상호 보완적인 SFT 및 RL 체크포인트를 사용하는 것이 단일 체크포인트에서 더 많은 샘플을 추출하는 것보다 더 가치가 있었습니다. 두 경우 모두, 최고의 결과는 능숙한 전문 모델과 검색, 검증 및 개선이 가능한 시스템을 결합함으로써 나왔습니다.
이러한 차이는 중요합니다. 메달은 미세 조정만으로 만들어진 것이 아니었고, 무차별적인 샘플링(brute-force sampling)만으로도 만들어진 것이 아닙니다. 그것들은 모델, 데이터, 그리고 추론 루프를 공동 설계함으로써 얻어진 것입니다.
이러한 결과들이 대회에 국한되지 않고 유용하기를 바랍니다. Nemotron Labs의 IMO 2026 컬렉션은 SFT 및 RL 체크포인트, 두 가지 학습 데이터셋, 그리고 200개의 올림피아드 수준 문제로 구성된 새로운 벤치마크인 Nemotron-IMO-Bench를 통합합니다. IMO 논문은 학습 접근 방식과 generate-verify-refine 시스템을 설명하며, NeMo-Skills 저장소에는 IMO 추론 파이프라인, 프롬프트, 제출된 증명서, 그리고 재현 가능한 빠른 시작 가이드가 포함되어 있습니다. 경쟁 프로그래밍의 경우, Nemotron-3-Ultra-CC 모델은 Hugging Face에서 사용할 수 있으며, IOI 논문은 학습 레시피와 GenCorrect 방법론을 제공합니다. IOI 평가 및 추론 파이프라인 역시 NeMo-Skills에 제공됩니다.
종합적으로 볼 때, IMO와 IOI는 단순한 아이디어에 대해 이례적으로 까다로운 증거를 제시합니다. 바로 Nemotron이 세계적 수준의 도메인 전문가로 미세 조정될 수 있으며, 이를 투명한 추론 워크플로우와 결합하여 인간 경쟁의 최전선에 있는 문제를 해결할 수 있다는 것입니다.
Hugging Face 커뮤니티가 다음에 무엇을 구축할지 기대됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HuggingFace Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기