LLM이 코딩 없이 버그를 수정할 수 있을까? 코드 없는(No-Code) 버그 수정의 자동 검증을 향하여
요약
본 연구는 LLM이 실제 브라우저 환경에서 '코드 없는(no-code)' 버그 수정을 생성하는 능력을 자동화된 실행 기반 파이프라인으로 평가했습니다. 322개의 코드 없는 수정에 대한 테스트 결과, 가장 강력한 구성인 Claude Opus 4.6은 최대 74.1%의 해결률을 보였습니다. 하지만 전반적으로 LLM이 생성한 수정 중 절반 미만이 버그를 해결했으므로, 배포 전 검증 과정이 필수적임을 강조합니다.
핵심 포인트
- LLM 기반 자동화 파이프라인으로 No-Code 수정 능력을 평가함.
- Claude Opus 4.6 등 최신 LLM 구성에서 최대 74.1%의 해결률을 기록함.
- 실행기(Executor) 변경에 따라 해결률 변동 폭이 커서 신뢰성 확보가 중요함.
- LLM 생성 수정은 여전히 검증 과정이 필수적이며, 인간 합의와 비교하여 높은 일치도를 보임.
코드 없는(no-code) 수정은 사용자에게 설정을 변경하거나, 문제가 이미 해결된 버전으로 업데이트하거나, 워크플로우를 조정하도록 안내함으로써 유효하지 않은 버그 보고서를 해결합니다. 제안된 코드 없는 수정이 보고된 버그를 실제로 해결하는지 수동으로 검증하는 것은 상당한 개발자 시간을 필요로 합니다. 본 연구는 대규모 언어 모델(LLMs)이 실제 브라우저 환경에서 코드 없는 수정(no-code fixes)을 생성하는 능력을 평가하기 위한 자동화되고 실행 기반의 파이프라인을 제안합니다. 우리는 이전 연구의 벤치마크와 함께 공개된 12가지 구성으로 생성된 322개의 코드 없는 수정에 대해, 결함 설정(Faulty Configuration), 잘못된 버전(Wrong Version), 또는 외부 시스템 및 종속성(External System & Dependency)으로 분류된 버그 보고서를 다루면서 평가했습니다. 실행 에이전트(executor agent)는 자연어 지침을 따라 각 수정을 적용하고, 이슈별 검사기(issue-specific checker)가 보고된 버그가 지속되는지 여부를 판단합니다. 우리는 두 개의 컴퓨터 사용 에이전트(Computer-Use Agents), OpenCUA-72B와 Claude Sonnet 5, 그리고 하나의 멀티모달 에이전트 LLM인 Meta의 Muse Glimmer를 사용하여 이 파이프라인을 반복했습니다. 후보 이슈 중 단지 17.6%만이 설정될 수 있었고 두 가지 건전성 게이트(sanity gates)를 모두 통과할 수 있었습니다. 322개의 수정에 걸쳐, 실행기에 따라 버그가 해결된 비율은 14.6%에서 49.7%였습니다. 가장 강력한 구성인 Vanilla 파이프라인의 Claude Opus 4.6은 Claude Sonnet 5 하에서 최대 74.1%까지 자신의 수정을 해결했습니다. 단지 실행기만 변경해도 한 구성의 해결률은 평균적으로 38.8% 변동했으며, 세 가지 실행기는 단지 46.9%의 수정에 대해서만 동일한 판결을 내렸습니다. 인간의 실행과 비교했을 때, 에이전트들은 샘플링된 수정의 66.1%에서 88.1%까지 인간의 합의와 일치했습니다. 심지어 최고의 실행기를 사용하더라도, LLM이 생성한 코드 없는 수정 중 절반 미만이 보고된 버그를 해결하므로, 이러한 수정은 사용자에게 도달하기 전에 검증이 필요합니다. 실행 기반 검증이 이를 제공할 수 있지만, 측정된 능력은 실행기에 매우 강하게 의존하므로, 평가에서는 이를 보고하고 통제해야 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기