코딩 에이전트의 자체 수정은 어느 정도의 증거를 가져야 하는가? 자기 증류를 위한 적응형 디리클레 증거
요약
본 논문은 코딩 에이전트가 자체 수정(self-correction)을 통해 학습할 때, 실행 피드백과 증거량을 분리하여 반영하는 Effective-Evidence Self-Distillation (EESD) 방법을 제안합니다. 이 방법론은 디리클레 사후 분포와 정규화된 실행 관련성을 사용하여 교정 학습 가중치를 계산하며, 관찰 가능한 증거가 증가할수록 미래 결과의 NLL이 크게 감소함을 입증했습니다.
핵심 포인트
- EESD는 코딩 에이전트의 자체 수정에 '실행 피드백'과 '증거량'을 분리하여 반영합니다.
- 관찰된 증거가 늘어날수록 Negative Log Likelihood (NLL)가 크게 감소하는 효과를 보였습니다.
- DeepSeek/CodeARC 테스트에서 교정 학습 라운드 후 Pass@1이 15.0%에서 20.4%로 증가했습니다.
- 증거 지원과 증거 질량을 분리하는 것이 에이전트의 확률 추정 및 학습에 중요함을 보여줍니다.
실행 피드백(Execution feedback)은 코딩 에이전트가 프로그램을 수정하고 자신의 교정으로부터 학습할 수 있게 합니다. 교정의 학습 가중치(learning weight)는 그 실행에 의해 지원되는 전이(transition)와 그 지원 뒤에 있는 증거량 모두를 반영해야 합니다. 우리는 이러한 양들을 별도로 나타내는 Effective-Evidence Self-Distillation (EESD)을 소개합니다. 정규화된 실행 관련성(Normalized execution relevance)은 상대적 전이 지원 및 효과적인 가짜 카운트 질량(effective pseudo-count mass)을 결정하며, 디리클레 사후 분포(Dirichlet posterior)는 KL 기반 교정 학습을 위한 불확실성 페널티가 적용된 가중치를 생성합니다. 대칭 사전 분포(symmetric prior) 하에서, 질량 변화는 범주 순서(category ordering)를 유지하고 효과적인 질량은 일치하는 고정 질량 대응물에 의해 경계 지어진 지도 감독 계수(supervised coefficient)를 산출합니다. 네 가지 모델-도메인 히스토리 스윕(model-domain history sweeps)을 거쳐, 관찰 가능한 증거가 1개에서 8개로 증가함에 따라 미래 결과의 NLL(Negative Log Likelihood)이 55.0–59.3% 감소했습니다. 8개의 관찰에서는 효과적인 질량이 네 가지 비교 모두에서 고정 질량보다 낮은 NLL을 달성했습니다. 주요 매칭된 DeepSeek/RunBugRun 연구에서, argmax 예측은 모든 3,000개 예제에 대해 일치했으며, 가장 큰 NLL 이득은 집중된 관련성(concentrated relevance) 하에서 나타났습니다. 한 번의 교정 학습 라운드 후, DeepSeek/CodeARC 전체 테스트의 Pass@1이 15.0%에서 20.4%로 증가했으며, 쌍을 이루는 95% 소스-부트스트랩 구간은 [+2.8, +8.0] 퍼센트 포인트였습니다. 열두 가지 설정 다운스트림 평가(twelve-setting downstream evaluation)는 이 업데이트의 모델-도메인 범위를 확립합니다. 이러한 결과들은 증거 지원과 증거 질량을 분리하는 것이 코딩 에이전트의 확률 추정 및 교정 학습을 어떻게 변화시키는지 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기