복잡도 인식 평가를 통한 LLM 코드 이해력 분석
요약
본 논문은 순환 복잡도, 중첩 깊이 등 여러 지표를 활용하여 LLM의 코드 이해력을 평가하는 '복잡도 인식 프레임워크'를 제시합니다. DeepSeek-Coder-V2와 Llama 두 모델을 테스트한 결과, 전체 정확도가 높더라도 코드 구조적 복잡도가 높아지면 성능이 급격히 저하됨을 확인했습니다.
핵심 포인트
- 코드 이해력 평가는 단순 전체 정확도보다 복잡도 인식이 중요합니다.
- DeepSeek-Coder-V2와 Llama 모두 복잡도가 증가할수록 예측 및 이해력이 감소하는 패턴을 보였습니다.
- 구조적 복잡도는 LLM의 코드 이해 정확성과 음의 상관관계를 가집니다.
대규모 언어 모델(LLMs)은 행동 예측, 함수 설명, 디버깅 및 코드 검토 등 기존 소스 코드를 이해하는 것을 요구하는 소프트웨어 엔지니어링 작업에 점점 더 많이 사용되고 있습니다. 하지만 전체 벤치마크 정확도는 소스 코드가 구조적으로 더 복잡해짐에 따라 모델의 신뢰성이 어떻게 변하는지를 가릴 수 있습니다. 본 논문은 순환 복잡도(cyclomatic complexity), 중첩 깊이(nesting depth), 분기 계수(branching factor), 그리고 Halstead 부피를 사용하여 LLM 코드 이해력을 평가하기 위한 복잡도 인식 프레임워크를 제시합니다. 우리는 DeepSeek-Coder-V2와 Llama 두 모델을 상호 보완적인 두 가지 작업을 통해 평가했습니다: 300개의 Python 함수에 대한 자동 입력-출력 예측과 균형 잡힌 60개 함수의 수동 평가된 의미론적 이해입니다. 이 함수들은 저(Low)-중(Medium)-고(High) 복잡도 대역으로 그룹화되었습니다. DeepSeek-Coder-V2는 전체 자동 정확도에서 78.33%를 달성하여 Llama의 70.33%와 비교되었습니다. 그러나 정확도는 Low에서 High로 갈수록 크게 감소하여, DeepSeek-Coder-V2는 93.52%에서 52.78%로, Llama는 87.04%에서 47.22%로 떨어졌습니다. 부정확한 예측은 네 가지 복잡도 지표 모두에서 더 높은 값과 일관되게 연관되어 있었으며, 상관관계 및 로지스틱 회귀 분석은 구조적 복잡도와 정확성 사이에 광범위하게 비교 가능한 음의 연관성이 있음을 확인시켜 주었습니다. 수동 의미론적 이해 역시 동일한 저하 패턴을 보여, DeepSeek-Coder-V2는 100.00%에서 75.00%로, Llama는 90.00%에서 60.00%로 정확도가 감소했습니다. 이러한 발견들은 복잡도 인식 평가가 단순히 전체 정확도만 사용하는 것보다 LLM 코드 이해력의 신뢰성에 대해 더 진단적인 평가를 제공함을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기