코드 최적화를 위한 강화학습 (Reinforcement Learning)
요약
코드의 실행 속도를 최적화하기 위해 강화학습(RL)을 적용하는 연구를 소개합니다. 측정 노이즈와 보상 희소성 문제를 해결하기 위해 DMC-Optim 프레임워크를 구축하여 Qwen 및 CWM 모델의 성능을 크게 향상시켰습니다.
핵심 포인트
- 실행 시간 보상 시 발생하는 노이즈와 GRPO 불안정성 문제 해결
- DMC-Optim을 통한 대규모 최적화 테스트 및 보정된 샌드박스 구축
- Qwen 2.5 7B 및 CWM 32B 모델에서 코드 최적화 성능 대폭 개선
- 표준 RLVR 대비 최대 200%의 성능 향상 달성
코드 정확성 (code correctness)을 위한 강화학습 (RL)은 이제 확립되었습니다. 모델이 프로그램을 생성하게 하고, 숨겨진 테스트 케이스에 대해 실행한 뒤, 통과하는 솔루션에 보상을 주는 방식입니다. 이를 코드 최적화로 확장하는 것은 간단해 보입니다. 보상에 실행 시간 (execution time)을 추가하기만 하면 됩니다. 하지만 실제로 실행 시간이 보상을 주도하게 되면, 측정 노이즈 (measurement noise), 보상 희소성 (reward sparsity), 또는 GRPO 불안정성 (GRPO instability)과 같은 작은 문제들이 신호를 압도하여 강화학습 (RL)을 실패하게 만듭니다. 즉, 생성된 솔루션의 속도가 거의 빨라지지 않으며, 오히려 실패하는 경우가 더 많아질 수 있습니다. 우리는 세 가지 단계를 통해 실행 시간을 학습 가능하게 만듭니다: (1) 대규모 최적화 테스트와 보정된 샌드박스 (sandbox)를 사용하여 DMC-Optim을 구축함으로써 코드가 테스트되는 방식, (2) RL 환경에서 정확성과 속도를 결합하고 오프라인 시뮬레이터 (offline simulator)를 사용하여 가장 유망한 구성을 예측함으로써 속도를 보상으로 전환하는 방식, (3) 더 희소하고 노이즈가 많은 시간 기반 실행 설정에 맞춰 GRPO와 평가를 조정함으로써 모델이 해당 보상으로부터 학습하는 방식입니다. DMC-Optim에서 가장 강력한 최적화 인식 구성 (optimization-aware configurations)은 Qwen 2.5 7B에서 엄격한 top-50% pass@1을 18.0%에서 31.3%로, CWM 32B에서 30.7%에서 50.4%로 개선했습니다. 이러한 이득은 top-30%와 같이 더 엄격한 백분위수에서 더욱 증가하며, CWM 32B의 경우 순수 정확성 점수를 유지하면서도 125%의 상대적 개선을 보였습니다. 타이밍 샌드박스 (timing sandbox)가 저하되었을 때, 견고한 최적화 RL은 평가 기준에 따라 표준 RLVR 대비 100%에서 200%의 개선을 달성합니다. LCB에서 CWM 32B는 표준 RLVR 대비 중앙값 샘플 속도 비교에서 최대 83%의 승률을 기록했습니다. 문제당 가장 빠른 정확한 인간 제출물과 비교했을 때, 복잡도 클래스 (complexity-class) 개선율 측면에서 인간 수준의 약 절반에 도달했습니다 (14% 대 28%).
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기