자가 개선 모델, 11개 분야 최고 기록 달성 요인 분석
요약
한 자가 개선(self-improving) 모델 계열이 수학, 과학, 법률 등 11개 분야에서 동시에 최고 수준의 벤치마크 기록을 달성했습니다. 이 성과는 외부 검증에 기반한 재귀적 자가 개선 루프(RSI)를 통해 가능했으며, 이는 모델이 스스로의 오류에 빠지는 것을 방지합니다.
핵심 포인트
- 외부 검증 기반의 '자가 개선 루프'가 핵심 동력입니다.
- 단일 모델 학습을 넘어 여러 분야에서 전반적인 성능 향상을 보였습니다.
- 결정 과정에서는 텍스트 생성 없이 프로브를 적용하는 제로 토큰 방식(ZTC)을 사용합니다.
- 관련된 추론 능력의 개선이 다른 영역으로 자연스럽게 전이되는 경향을 보입니다.
TL;DR
하나의 자가 개선(self-improving) 모델 계열이 수학, 과학, 법률, 구조화된 출력 및 의사 결정 등 여러 영역에서 동시에 공신력 있는 벤치마크 최고 기록을 11개 보유하게 되었습니다. 흥미로운 점은 단일 점수가 아니라, 외부 검증에 의해 제한되는 재귀적 자가 개선 루프(recursive self-improvement loop)가 광범위한 벤치마크들을 한 번에 최상위권으로 끌어올릴 수 있다는 것입니다.
11개 기록 요약
- 수학: AIME 2026 100%, HMMT 2026 100%
- 과학: GPQA Diamond 94.44%
- 지식 및 멀티모달: MMLU-Pro 88.12%, MMMU-Pro 79.48%
- 법률: LEXam 68.94%, LEXam-hard 45.72%
- 추출 및 구조화: ExtractBench 90.29%, IFStruct 98.95%
- 의사 결정: MDPBench 83.65%, S1MB Borda 89.58
자가 개선 루프를 통한 성과 달성 원리
단 한 번만 학습하는 모델은 본인이 본 데이터에 갇히게 됩니다. 반면, 자가 개선(RSI) 모델은 루프를 실행합니다: 문제를 시도하고, 외부 검증을 통과한 시도를 유지하며, 그 데이터를 가지고 재학습합니다. 보상은 모델 자체의 채점 기준이 아니라 코드 실행, 외부 증거 또는 정답지 등 모델 외적인 검증에 연결됩니다. 이것이 루프가 스스로의 확신에 찬 실수로 표류하는 것을 막아줍니다.
루프가 정직할 때, 한 가지 추론 능력에서의 개선은 다른 능력으로도 전이되는 경향이 있습니다. 이것이 기록들이 하나의 좁은 테스트가 아닌 관련 없는 여러 분야에 걸쳐 분포하게 된 이유입니다.
의사 결정 레이어
타입화된(typed) 결정을 내릴 때, 이 계열은 제로 토큰 방식(zero-token method)을 사용합니다: 문제를 한 번의 순방향 패스(forward pass)로 읽고 보정된 프로브(calibrated probe)를 적용하여 결정을 도출하며, 텍스트를 생성하지 않습니다. 이는 결정론적이고 비용 효율적이어서, 데이터가 있는 곳 근처에서 결정을 내리는 데 적합합니다.
사용 가능 정보
- S1MB 최고 기록 모델: https://github.com/final-bench/s1mb
- ZTC 방식: https://github.com/final-bench/ztc
- 온디바이스 모델: https://github.com/final-bench/pocket
FAQ
몇 개의 최고 기록을 세웠으며, 어떤 분야에서인가요?
수학, 과학, 법률, 구조화된 출력, 의사결정을 아울러 한 번에 11개의 최고 기록입니다.
자가 개선 모델(RSI)이란 무엇인가요?
문제를 해결하고, 외부 검증을 통과하는 해답들을 보존하며, 이를 학습하여 새로운 인간 레이블 없이도 스스로 향상되는 모델입니다.
왜 이 루프를 외부 검증에 연결해야 하나요?
모델이 자신의 작업을 평가할 경우, 그 루프는 자신감 있는 오류를 강화할 수 있습니다. 외부 검증은 개선을 실제로 유지하게 합니다.
오픈 소스인가요?
네, 의사결정 모델과 방법론은 Apache-2.0 하에 공개되어 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기