MRCoder: 저장소 수준 코드 생성을 위한 효율적인 컨텍스트 선택 접근 방식
요약
저장소 수준의 코드 생성을 위해 효율적인 컨텍스트 선택 프레임워크인 MRCoder를 제안합니다. Map-Reduce 패러다임을 활용하여 중복된 컨텍스트를 제거하고, 코드의 구조적 일관성을 유지하며 생성 품질과 추론 효율성을 동시에 높였습니다.
핵심 포인트
- Map-Reduce 패러다임을 통한 효율적인 컨텍스트 선택
- SADGS 전략으로 API 일관성 및 논리적 유사성 확보
- 토큰 소비량 30~50% 절감 및 추론 시간 최대 52% 단축
- Qwen2.5-Coder 및 DeepSeek-Coder 기반 성능 검증
대규모 언어 모델 (LLMs)은 코드 생성 분야에서 강력한 능력을 입증해 왔습니다. 그러나 저장소 수준 (repository-level) 코드 생성은 저장소 특유의 컨텍스트 (context)를 효과적으로 식별하고 활용해야 하기 때문에 여전히 어려운 과제로 남아 있습니다. 검색 증강 생성 (RAG)은 관련 코드 스니펫을 포함하지만, 종종 중복된 컨텍스트를 도입하여 관련 정보를 활용하는 LLM의 능력을 방해하며, 이는 생성 품질 저하와 계산 비용 증가로 이어집니다. 더욱이, 기존의 컨텍스트 선택 및 압축 방법들은 효율성과 품질 사이의 균형을 맞추는 데 어려움을 겪고 있으며, 추가적인 계산 오버헤드를 발생시키거나 유효한 컨텍스트를 효과적으로 선택하지 못합니다. 본 논문에서는 저장소 수준 코드 생성의 효과성과 효율성을 모두 향상시키는 효율적인 컨텍스트 선택 프레임워크인 MRCoder를 제안합니다. MRCoder는 Map-Reduce 패러다임을 채택합니다: Map 단계에서는 경량 초안 모델 (draft model)이 분할된 컨텍스트에 대해 초안을 생성하며, 구조 인식 초안 가이드 선택 (Structure-Aware Draft-Guided Selection, SADGS)이 API 일관성 및 논리적 유사성을 통해 초안을 기반으로 정보가 풍부한 컨텍스트를 선택합니다; Reduce 단계에서는 정제된 컨텍스트가 최종 생성을 위해 집계되며, 병렬 검증 전략을 통해 디코딩 (decoding) 속도를 더욱 가속화합니다. 우리는 Qwen2.5-Coder와 DeepSeek-Coder를 백본 LLM으로 사용하여 널리 사용되는 두 가지 저장소 수준 코드 생성 벤치마크인 CoderEval 및 DevEval에서 MRCoder를 평가합니다. 실험 결과에 따르면, MRCoder는 강력한 베이스라인 모델들보다 코드 생성 정확도를 향상시키는 동시에 토큰 소비량을 30~50% 줄이고 추론 시간을 최대 52%까지 단축합니다. 이러한 결과는 우리가 제안한 구조화 및 초안 가이드 컨텍스트 선택 전략이 저장소 수준 코드 생성의 품질과 효율성을 모두 개선하는 데 매우 중요하다는 것을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기