리더보드를 넘어: 자동 프로그램 복구(APR)을 위한 밀집 및 Mixture-of-Experts 모델의 다차원 평가
요약
본 논문은 자동 프로그램 복구(APR) 평가의 한계를 지적하며, 기능적 정확성 외에 유지보수성, 보안성 등을 결합한 Weighted Quality Index (QI)를 제안했습니다. Qwen2.5-Coder와 DeepSeek-Coder-V2-Lite MoE 모델을 다양한 버그 데이터셋으로 비교 평가하여, 단일 지표가 놓치는 상충 관계를 다차원적으로 분석했습니다.
핵심 포인트
- APR 평가는 기능적 정확성 외 유지보수성/보안성을 포함해야 함 (Weighted Quality Index 제안).
- MoE 모델은 적은 활성 매개변수로도 밀집 모델 대비 높은 성능을 보임.
- 모델의 순위는 평가 지표(가중치 체계)에 따라 달라질 수 있음.
- 희소 코드 모델에서는 총 매개변수보다 활성 매개변수가 더 중요함.
언어 모델을 활용한 자동 프로그램 복구(Automated Program Repair, APR)는 일반적으로 생성된 패치가 테스트 스위트를 통과하는지 여부로 평가되며, 이는 유지보수성, 보안성, 계산 비용 등의 차이를 가릴 수 있습니다. 우리는 기능적 정확성, 유지보수성, 보안성 및 생성 효율성을 구성 가능한 가중치 체계 하에 결합한 Weighted Quality Index (QI)를 제안하며, 이는 ISO/IEC 25010 소프트웨어 품질 모델에서 영감을 받았습니다. 우리는 세 가지 밀집 Qwen2.5-Coder 모델(3B, 7B, 14B)과 16B 매개변수의 DeepSeek-Coder-V2-Lite Mixture-of-Experts (MoE) 모델(활성 매개변수 2.4B)을 40개의 QuixBugs 및 90개의 Defects4J 버그에 대해 평가했으며, 모든 테스트는 인프라 효과를 통제하기 위해 동일한 하드웨어에서 로컬로 실행되었습니다. 가중치 체계에 따라 모델 순위가 달라지며, 이는 단일 지표 평가가 상충 관계(trade-offs)를 숨길 수 있음을 보여줍니다. MoE 모델은 7B 및 14B 밀집 모델과 정확성 면에서 통계적으로 유의미한 차이가 거의 없었으며 (McNemar's exact test), 활성 매개변수는 3~6배 적게 사용했지만, 세 가지 밀집 스케일 전반에 걸쳐 정확성은 크게 증가했습니다. 이러한 결과는 희소 코드 모델(sparse code models)의 경우 총 매개변수 수보다 활성 매개변수 수가 더 유익한 관점일 수 있음을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기