NVIDIA의 혁신적인 논문 발표
요약
NVIDIA가 에이전트 학습을 위한 혁신적인 논문을 발표했습니다. 이 시스템은 벤치마크를 루브릭 스코어링 기반의 재시작 가능한 샌드박스로 변환하고, 모델 가중치와 하네스를 공동으로 진화시키는 방식을 제시합니다. 이를 통해 높은 성능의 에이전트가 구현되었으며, 특정 벤치마크에서 Claude Opus 4.8을 능가하는 결과를 보여주었습니다.
핵심 포인트
- 에이전트 학습을 위한 검증 가능한 환경 구축 및 하네스 훈련 방법론 제시
- 모델 가중치와 하네스를 공동 진화시켜 지능 스택의 성능 극대화
- AutoCoWorkBench에서 Claude Opus 4.8을 능가하는 높은 점수 기록 (27B 규모)
- 환경 코퍼스는 오픈 소스로 공개되어 연구 커뮤니티에 기여
NVIDIA에서 나온 멋진 논문입니다.
제가 주목하는 흥미로운 트렌드 중 하나는 에이전트(agents)를 위한 검증 가능한 환경을 구축하고, 그와 동시에 하네스(harness)를 훈련시키는 것입니다.
하네스와 모델을 공동으로 진화시키는 것(Co-evolving the harness and the model)은 지능 스택(intelligence stack)을 소유하는 데 매우 중요한 부분입니다. 그리고 많은 선도적인 AI 회사들이 이를 시작하고 있습니다.
이 논문은 이것이 어떻게 작동하는지 보여줍니다:
VERA는 벤치마크 궤적(benchmark trajectories)을 루브릭 스코어링(rubric scoring)을 거쳐 9,000개 이상의 재시작 가능한 샌드박스(sandboxes)로 변환하며, 관찰 가능한 증거(observable evidence)로부터 실행되고 점수를 받을 수 있는 환경만 유지합니다.
그 후 모델 가중치(model weights)와 하네스를 모두 업데이트합니다.
하네스 수정 사항은 자체 테스트를 통과하고 개발 세트(development set)에서 최소 5점 이상을 추가할 때만 유지됩니다.
시스템은 점수가 20% 이상 떨어지는 모델 체크포인트(model checkpoint)는 거부합니다.
9B 규모에서는 공동 진화된 에이전트가 AutoCoWorkBench에서 가장 강력한 단일 축 기준선(single-axis baseline)보다 10.3점 높고, AutoMedBench에서 13.0점 높은 점수를 기록했습니다. 27B 규모에서는 AutoCoWorkBench에서 71.6점을 기록하여 Claude Opus 4.8을 능가합니다.
환경 코퍼스(environment corpus)는 오픈 소스로 공개됩니다.
논문 채팅: https://t.co/fXlmBpm4m6
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기