코드 생성의 기능적 정확성을 위한 Route-Align-Verify (RAV) 방법론
요약
LLM의 코드 생성 정확도를 높이기 위해 Route, Align, Verify의 세 단계로 구성된 RAV 프레임워크를 제안합니다. 백본 모델 수정 없이 프롬프트 라우팅, LoRA 적응, 실행 기반 검증을 통해 MBPP 벤치마크에서 유의미한 성능 향상을 달성했습니다.
핵심 포인트
- Route-Align-Verify(RAV) 모듈형 프레임워크 제안
- 백본 모델 수정 없이 코드 생성의 기능적 정확성 개선
- MBPP 벤치마크에서 최대 9.92%p 성능 향상 기록
- 작업 인식 라우팅과 정렬된 적응의 시너지 확인
대규모 언어 모델 (LLMs)은 코드 생성 능력을 실질적으로 향상시켰으나, 강력한 기능적 정확성 (functional correctness)을 달성하는 것은 여전히 어려우며, 특히 단일 프롬프팅 전략과 단일 직접 생성 출력이 불충분한 경우가 많은 이질적인 프로그래밍 작업에서 더욱 그러합니다. 본 논문에서는 고정된 백본 모델 (backbone model)을 사용하여 세 가지 조정된 단계인 Route, Align, Verify를 통해 코드 생성을 개선하는 가볍고 모듈화된 프레임워크인 RAV를 제시합니다. Route는 생성 전에 작업 인식 프롬프트 라우팅 (task-aware prompt routing)을 적용하며, Align은 정렬된 LoRA 적응 (aligned LoRA adaptation)을 통해 미세 조정 프롬프트와 추론 시점 프롬프트 사이의 불일치를 줄이고, Verify는 공개된 테스트에 여러 후보를 실행하여 최종 출력을 선택합니다. 우리는 Sanitized 및 Full 설정 모두에서 MBPP 벤치마크를 통해 RAV를 평가합니다. 전체 RAV 파이프라인은 평가된 모든 구성 중에서 가장 우수한 성능을 달성하여, MBPP Sanitized에서 0.8911, MBPP Full에서 0.8520을 기록했습니다. 기본 모델과 비교했을 때, 이 결과는 각각 6.35 및 9.92 퍼센트 포인트의 향상을 나타냅니다. 구성 요소별 절제 실험 (ablation experiments)을 통해 작업 인식 라우팅과 정렬된 적응이 실행 기반 검증 (execution-based verification)과 결합될 때 실질적으로 더 효과적임을 추가로 보여줍니다. 추가적인 강건성 (robustness) 및 오염 (contamination) 분석은 관찰된 개선 사항의 신뢰성을 뒷받침합니다. 전반적으로, 이 결과는 작업이 프롬프트되는 방식, 모델이 적응되는 방식, 그리고 최종 출력이 선택되는 방식을 공동으로 최적화함으로써 백본 아키텍처를 수정하지 않고도 코드 생성의 기능적 정확성을 유의미하게 개선할 수 있음을 나타냅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기