알고리즘 프로그래밍 과제에서 비용 효율적인 대규모 언어 모델(LLM)에 대한 경험적 평가
요약
본 연구는 비용 효율적인 LLM들이 명세서에 기반하여 엔터프라이즈 코드 생성의 신뢰성을 경험적으로 평가했습니다. Gemini Flash 3, GPT-5.4 mini, Claude Haiku 4.5 등 세 모델을 사용하여 992개 알고리즘 문제 해결을 요청한 결과, 구조적 준수도는 높았으나 실제 계산 정확도는 12.9%에 그쳤습니다.
핵심 포인트
- LLM의 코드 생성은 명세서 기반으로 가능하나, 실제 계산 정확도는 낮음 (12.9%).
- 응답 클래스별로 신뢰성과 정확도에 역의 관계가 관찰됨.
- 실제 계산을 수행한 메서드가 가장 적게 응답했고, 정확도는 19.3%를 기록함.
본 연구는 비용 효율적인 대규모 언어 모델(LLMs)이 작성된 명세서에 따라 엔터프라이즈 코드를 생성하는 데 신뢰할 수 있는지 경험적으로 평가합니다. 세 가지 모델(Gemini Flash 3, GPT-5.4 mini, Claude Haiku 4.5)에게 지정된 서명 및 데이터 전송 객체(data-transfer-object) 명세서에 부합하는 Java Spring Boot 서비스 메서드를 작성하도록 992개의 알고리즘 문제 해결을 요청했습니다. 이는 네 가지 모델 및 에이전트 코딩 도구 조합과 두 가지 프롬프트 변형을 거쳐 총 여덟 가지 구성을 만들었으며, 반복(iteration)은 금지되었고 하드코딩된 답변은 명시적으로 금지되었습니다. 모델들이 누락된 입력에 어떻게 반응하는지 알아보기 위해 8개의 문제 설명이 보류되었습니다. 결과로 나온 7,593개 메서드는 답변 생성과 관련하여 각각 무엇을 하는지를 설명하는 8가지 클래스 결과 분류법(outcome taxonomy)으로 분류되었고, 이후 배포되어 실행되면서 해당 분류와 연결된 7,936개의 측정 요청이 나왔습니다. 구조적 준수도는 최고치에 근접했지만, 메서드의 38.4%는 반환하는 값을 실제로 계산하지 않았으며, 반환된 답변 중 정확했던 것은 12.9%에 불과했습니다. 결과 클래스에 따라 조건화했을 때 응답의 신뢰성과 정확성은 역의 관계를 보였는데, 실제로 계산한 메서드가 가장 적게 응답했고 정확도는 19.3%였습니다. 한계점으로는 구성당 단일 생성 실행(single generation runs per configuration), 부분적인 하네스 커버리지(partial harness coverage), 단일 패스 타이밍(single-pass timing), 구문론적 분류(syntactic classification), 그리고 가능한 코퍼스 오염(probable corpus contamination)이 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기