실제 프로그램에서의 정확한 출력 및 체크포인트 상태 예측 평가
요약
본 글은 소스 코드와 입력만을 사용하여 최종 출력 및 체크포인트 상태를 예측하는 새로운 벤치마크를 제시합니다. 이 벤치마크는 371개 프로그램의 400개 케이스로 구성되었으며, 모델의 추론 기능 활성화가 성능 향상에 크게 기여함을 보여줍니다. 특히 짧은 트레이스 최종 출력과 두 상태 작업에서 높은 정확도를 기록하며, 기존 평가 방식이 놓치던 오류들을 노출합니다.
핵심 포인트
- 소스 코드와 입력만으로 출력을 예측하는 새로운 벤치마크 제시
- 추론 기능(Reasoning-enabled) 활성화 시 성능 향상 폭이 매우 큼
- 짧은 트레이스 최종 출력에서 높은 정확도(93.0%)를 기록함
- 기존 평가 방식으로는 놓칠 수 있는 오류들을 효과적으로 노출함
우리는 소스 코드와 입력만으로 최종 출력 및 체크포인트 상태를 예측하기 위한 벤치마크를 제시합니다. 이 벤치마크는 짧은 트레이스와 긴 트레이스의 쌍을 이루는 입력과 루프 내부 및 외부의 체크포인트를 포함하는 CRUXEval 스타일의 출력 예측을 확장했습니다. 이 벤치마크는 371개의 Python 및 C++ 프로그램에서 가져온 400개 케이스를 포함하며, 도구나 코드 실행 없이 네 가지 모델 패밀리로부터 나온 일곱 가지 설정 하에 평가되었습니다. 계획된 총 11,200개의 예측 중 11,151개가 미분 가능한 응답을 생성했습니다. 추론 기능이 활성화된(Reasoning-enabled) 설정은 완료된 응답에서 해당 기능을 비활성화한 경우보다 각각 33.1%에서 55.2% 포인트 더 나은 성능을 보였습니다. 가장 강력한 설정은 짧은 트레이스 최종 출력에서 93.0%, 긴 트레이스 최종 출력에서 77.0%, 그리고 두 상태 작업(state tasks)에서 각각 65.5%와 63.5%의 점수를 기록했습니다. 이러한 점수는 누락된 응답이 오답으로 간주될 때도 유지됩니다. 동일한 소스를 가진 2,397개의 매칭된 Python 비교를 통해, 입력이 긴 트레이스로 변경될 경우 528개의 정답-오답 변화와 147개의 반전(reversals)이 발생했습니다. 소스 클러스터 분석은 이러한 정확도 격차를 유지하는 반면, 조정된 Python 모델은 누적 상태 부하와 오류 간의 긍정적인 증가 연관성을 보여주지 못했습니다. 변경된 입력 및 체크포인트 작업들은 여러 요인들을 함께 변화시키기 때문에, 이 격차들만으로는 트레이스 길이 또는 내부 상태 추적 메커니즘을 분리하여 설명할 수 없습니다. 본 벤치마크는 짧은 출력 점수만으로는 숨겨지는 오류들을 노출합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기