임베디드 소프트웨어 개발을 위한 LLM 에이전트의 폐쇄 루프 평가
요약
본 논문은 임베디드 펌웨어 개발을 위한 LLM 코딩 에이전트의 폐쇄 루프 평가를 위한 새로운 벤치마크를 제시합니다. 이 벤치마크는 일반적인 텍스트 설명과 제약된 작업 공간, 그리고 빌드 및 런타임 검증 환경을 통합하여 실제 장치 동작까지 반복적으로 요구합니다. GPT-5.4가 가장 높은 성능을 보였으나, Qwen3.5-27B와 같은 강력한 로컬 모델의 잠재력도 확인되었습니다.
핵심 포인트
- 폐쇄 루프 평가를 통해 임베디드 에이전트의 실제 능력을 측정합니다.
- 벤치마크는 텍스트 설명, 제약된 작업 공간, 런타임 검증을 포함합니다.
- GPT-5.4가 최고 성능을 보였으나, Qwen3.5-27B 등 로컬 모델도 강력한 대안입니다.
- 에이전트의 반복적 자체 검증 능력이 핵심 평가 요소입니다.
대규모 언어 모델(LLMs)은 파일 편집, 빌드 및 테스트 실행, 실행 결과 검사, 그리고 소프트웨어를 반복적으로 수정하는 코딩 에이전트로 점점 더 많이 배포되고 있습니다. 임베디드 펌웨어는 감지(sensing), 타이밍, 안전 제약 조건 하에서의 폐쇄 루프 동작에 정확성이 달려 있기 때문에 까다로운 대상입니다. 이는 단순히 정적인 소스 코드 품질에만 의존하는 것이 아닙니다. 하지만 임베디드 에이전트 평가는 여전히 제한적이며 종종 일회성 합성(one-shot synthesis)이나 오프라인 정확성에 초점을 맞춥니다. 우리는 임베디드 코딩 에이전트의 폐쇄 루프 평가를 위한 벤치마크를 제시합니다. 각 태스크는 일반 텍스트 엔지니어링 설명, 제약된 작업 공간, 그리고 가시적인 빌드 및 런타임 표면을 제공합니다. 에이전트는 요구 사항을 구현 및 자체 검증 단계로 변환한 다음, 필요한 장치 동작이 달성될 때까지 반복해야 합니다. 이 스위트에는 다섯 가지 임베디드 제어 태스크와 네 가지 피드백 시나리오가 포함되어 있습니다: 일회성 생성(one-shot generation), 현실적인 자체 검증(realistic self-verification), CI 스타일의 빨강/초록 피드백(red/green feedback), 그리고 오라클 스타일의 상세 피드백(oracle-style detailed feedback). 구현은 재현성을 위해 시뮬레이션된 ESP32 펌웨어를 대상으로 합니다. 우리는 다섯 가지 태스크와 네 가지 시나리오에 걸쳐 총 세 번 반복하여 420회 실행으로, 일곱 가지 GPT 계열 및 Qwen 계열 구성을 평가했습니다. gpt-5.4가 평가된 구성 중 가장 높은 통과율을 보였지만, 이 벤치마크를 포화시키지는 못했습니다. qwen3.5-27B는 관찰된 가장 강력한 로컬 모델이며, 더 작은 로컬 모델들은 통과율 및 검색 효율성에서 급격히 저하되는 경향을 보였습니다. 이러한 결과는 유능한 로컬 임베디드 코딩 에이전트가 등장하고 있음을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기