LangChoiceBench: LLM의 프로그래밍 언어 선택 측정 및 설명
요약
본 연구는 LLM이 프로젝트 수준 코드 생성 시 특정 언어(특히 Python)를 과도하게 선호하는 문제를 측정하기 위해 LangChoiceBench라는 벤치마크를 제안합니다. 이 벤치마크는 다양한 소프트웨어 영역에서 LLMs의 언어 선택, 추천-구현 일관성, 그리고 언어 다양성을 평가했습니다.
핵심 포인트
- LLM은 프로젝트 코드 생성 시 Python을 과도하게 선호하는 경향이 있습니다.
- LangChoiceBench는 7개 분야 28개 프로젝트를 다루며 LLMs의 언어 선택 능력을 측정합니다.
- 대부분의 Python 선택은 명시적 요구사항보다 용이성에 의해 주도됩니다.
- 작은 오픈 가중치 모델일수록 Python 선호도가 높고 언어 다양성이 낮았습니다.
대규모 언어 모델(LLMs)은 프로젝트 수준 코드를 생성할 때 강력한 Python 선호도를 보이는 것으로 나타났지만, 현재 새로운 모델 전반에 걸쳐 이러한 행동을 체계적으로 측정하는 방법은 없습니다. 이 격차를 해소하기 위해, 우리는 Python 선호도, 추천-구현 일관성(recommendation-implementation consistency), 그리고 언어 다양성을 측정하는 프로젝트 수준 코드 생성 벤치마크인 LangChoiceBench를 소개합니다. LangChoiceBench는 Python이 종종 부적절한 기본값인 7가지 소프트웨어 영역에 걸쳐 28개 프로젝트를 다룹니다. 우리는 25개의 다양한 LLMs를 평가했으며, Python이 여전히 과도하게 많이 선택되고(over-selected), 추천-구현 일관성이 낮으며, 더 작은 오픈 가중치 모델들이 일반적으로 더 강한 Python 선호도와 낮은 언어 다양성을 보인다는 것을 발견했습니다. 나아가 우리는 9,826개의 추론 흔적을 분석하여 대부분의 Python 선택이 프로젝트 요구 사항에 대한 명시적인 고려보다는 자동적이거나 주로 용이성에 의해 주도된다는 것을 발견했습니다. 작지만 중요한 사례에서는 모델들이 Python을 선택하기 위한 맥락적 지원을 꾸며내는데(우리가 팬텀 증거(phantom evidence)라고 부르는 실패 모드), 또는 자신들의 추론에서 선택된 언어와 모순되는 코드를 생성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기