ExecuCritic: 검증 가능한 보상을 통한 코드 생성을 위한 교정된 Critic Shaping
요약
ExecuCritic은 코드 생성 모델의 성능 향상을 위해 제안된 공동 훈련 프레임워크입니다. 이 시스템은 코더와 크리틱이 동일한 실행 롤아웃에서 함께 업데이트되며, Critic은 통과/실패 예측 및 진단 피드백을 제공합니다. 이를 통해 기존 RLVR 방식의 어려운 크레딧 할당 문제를 해결하고 코드 생성 능력을 개선했습니다.
핵심 포인트
- ExecuCritic은 코더와 크리틱이 공동으로 훈련되는 프레임워크입니다.
- 실행 결과를 활용하여 정확한 크레딧 할당 문제를 해결합니다.
- 기존 방식 대비 더 적은 정책 기울기 단계와 실행을 요구하며 성능이 우수합니다.
실행 피드백은 단위 테스트가 객관적이며 프로그램의 정확도를 직접 측정하기 때문에 코드 모델에 유용한 지도 신호입니다. 하지만 그 약점은 전체 프로그램이 종종 한 번 통과 또는 실패 비트로 축소되어, RLVR(Reinforcement Learning from Verification and Review)이 어려운 크레딧 할당 문제(credit assignment problem)를 해결해야 한다는 것입니다. 동시에 코딩 시스템에는 종종 별도의 리뷰어 또는 테스터 역할이 포함되지만, 이러한 Critic들은 보통 훈련되기보다는 프롬프트를 통해 제공되며 실행에 대해 교정되지 않았습니다. 우리는 ExecuCritic을 제안합니다. 이는 코더(coder)와 크리틱(critic)이 동일한 실행 롤아웃(execution rollouts)에서 함께 업데이트되는 공동 훈련 프레임워크입니다. Critic은 통과 또는 실패 결과를 예측하고 짧은 진단 피드백을 제공하며, Coder는 Critic이 현재 롤아웃 그룹에 대해 Executor와 동의할 때만 이 신호를 사용합니다. 여덟 개의 코드 벤치마크와 두 개의 최근 오픈 백본(open backbones)에 걸쳐 ExecuCritic은 Critic 없이 GRPO를 수행했을 때, 프롬프트된 리뷰어 시스템 및 스칼라 보상 모델 베이스라인보다 개선되었으며, 더 적은 정책 기울기 단계(policy gradient steps)와 더 적은 샌드박스 실행을 요구합니다. Ablation 및 신뢰성 분석에 따르면 이러한 이점은 더 큰 샘플링 예산보다는 더 나은 크레딧 할당에서 비롯된 것으로 보입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기