프롬프트의 자연어 차이가 LLM을 이용한 자동 코드 생성에 미치는 영향 연구
요약
본 연구는 LLM 기반 자동 코드 생성 시 입력 프롬프트의 자연어가 성능에 미치는 영향을 정량적으로 분석했습니다. GPT-4o, Llama-3 등 7개 모델을 사용하여 AtCoder, LeetCode 등에서 영어, 일본어, 중국어 등 다양한 언어로 테스트한 결과, 문제 설명의 자연어 편향이 코드 생성 정확도에 유의미하게 영향을 미치는 것을 확인했습니다. 또한 번역은 일부 환경에서 성능 향상을 보였으나 일관적이지 않았습니다.
핵심 포인트
- 입력 프롬프트의 자연어가 LLM 코드 생성 정확도에 유의미한 영향
- 데이터셋 공식 지원 언어에서 가장 높은 중앙값 정확도 달성
- 번역은 언어 편향 완화 전략이 될 수 있으나 일관성은 부족
- 문제 설명의 서사적 스타일과 컨텍스트 길이가 중요한 요소
대규모 언어 모델(LLMs)은 자동 코드 생성 작업에서 놀라운 성능을 보여주었으며, 이로 인해 해당 분야의 새로운 연구를 장려하고 있습니다. 수많은 연구가 LLM 기반 코드 생성을 탐구했지만, 입력 프롬프트의 자연어가 미치는 영향(언어 편향)은 여전히 탐구되지 않은 영역입니다. 본 연구는 (1) 입력 프롬프트의 자연어가 LLM 기반 코드 생성 성능에 어떻게 영향을 미치는지 정량화하고, (2) 코드 생성에서 언어 편향을 줄이기 위한 완화 전략을 평가하는 것을 목표로 합니다. 우리는 AtCoder, LeetCode, BigCodeBench에서 코드 생성 정확도(Accuracy)를 평가합니다. 코드 생성에서의 언어 편향을 정량화하기 위해, 각 문제는 영어, 일본어, 중국어로 제시되었습니다. 우리는 일곱 개의 LLM(GPT-4o, o3-mini, DeepSeek-V3.2, Llama-3, Qwen2.5-Coder-14B, Qwen2.5-Coder-0.5B, 그리고 GitHub Copilot)을 사용하고 정확도(생성된 코드가 모든 테스트 케이스를 통과하는 문제의 수) 측면에서 성능을 평가합니다. 우리는 번역 전후의 정확도를 비교하여 완화 전략으로서의 번역 효과를 평가했습니다. 우리는 문제 설명의 자연어가 LLM 기반 코드 생성 성능에 영향을 미친다는 것을 관찰했습니다. 특히, 각 데이터셋이 공식적으로 지원하는 언어에서 가장 높은 중앙값(median) 정확도가 달성되었습니다. 또한, 번역은 정확도를 향상시켰지만, 그 효과는 데이터셋과 모델 유형 전반에 걸쳐 일관적이지 않았습니다. 우리는 AtCoder가 서사적 스타일의 문제 설명과 더 긴 문제 설명을 특히 많이 포함하고 있음을 발견했습니다. 자연어는 LLM 코드 생성 정확도에 유의미하게 영향을 미칩니다. 번역은 일부 환경에서 언어 편향을 완화할 수 있지만, 그 효과는 데이터셋과 모델 유형에 달려 있습니다. 나아가, 입력 프롬프트의 서사적 측면(narrative aspects)과 컨텍스트 길이(context length)는 언어 편향 및 완화 전략으로서 번역의 효과와 관련된 중요한 요소입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기