에이전트 하네스로서의 코드 (Code as Agent Harness)
요약
최근 LLM의 발전으로 코드는 단순한 결과물을 넘어 에이전트의 추론, 행동, 환경 모델링을 위한 핵심 운영 기질(operational substrate)로 진화하고 있습니다. 본 글은 코드를 에이전트 인프라의 기초로 보는 '에이전트 하네스로서의 코드' 관점을 제시하며, 인터페이스, 메커니즘, 다중 에이전트 확장이라는 세 가지 계층을 통해 에이전트 시스템의 통합된 로드맵을 제안합니다.
핵심 포인트
- 코드는 에이전트의 추론, 행동, 환경 모델링을 연결하는 하네스 인터페이스 역할을 수행함
- 장기 실행을 위해 계획, 메모리, 도구 사용 및 피드백 기반 제어 메커니즘이 필수적임
- 단일 에이전트에서 다중 에이전트 설정으로 확장 시 공유된 코드 산출물이 조정과 검증을 지원함
- 하네스 엔지니어링의 주요 과제로 불완전한 피드백 하의 검증, 인간의 감독, 멀티모달 확장 등이 존재함
최근의 대규모 언어 모델 (LLMs)은 경쟁 프로그래밍부터 저장소 수준의 소프트웨어 엔지니어링에 이르기까지, 코드를 이해하고 생성하는 데 강력한 능력을 보여주었습니다. 새롭게 등장하는 에이전트 시스템 (agentic systems)에서 코드는 더 이상 단순한 목표 출력물에 그치지 않습니다. 코드는 에이전트의 추론 (reasoning), 행동 (acting), 환경 모델링 (environment modeling), 그리고 실행 기반 검증 (execution-based verification)을 위한 운영 기질 (operational substrate)로서 점점 더 중요한 역할을 수행하고 있습니다. 우리는 이러한 변화를 에이전트 하네스 (agent harnesses)의 관점에서 정의하며, 코드를 에이전트 인프라의 기초로 중심에 두는 통합된 시각인 '에이전트 하네스로서의 코드 (code as agent harness)'를 소개합니다. 이 관점을 체계적으로 연구하기 위해, 우리는 세 가지 연결된 계층을 중심으로 조사를 구성했습니다. 첫째, 코드가 에이전트를 추론, 행동, 환경 모델링과 연결하는 하네스 인터페이스 (harness interface)를 연구합니다. 둘째, 장기 실행 (long-horizon execution)을 위한 계획 (planning), 메모리 (memory), 도구 사용 (tool use)과 더불어, 하네스를 신뢰할 수 있고 적응 가능하게 만드는 피드백 기반 제어 (feedback-driven control) 및 최적화 (optimization)와 같은 하네스 메커니즘 (harness mechanisms)을 검토합니다. 셋째, 공유된 코드 산출물 (code artifacts)이 다중 에이전트의 조정 (coordination), 검토 (review), 검증 (verification)을 지원하는 단일 에이전트 시스템에서 다중 에이전트 설정 (multi-agent settings)으로의 하네스 확장 (scaling)에 대해 논의합니다. 이러한 계층 전반에 걸쳐, 우리는 코딩 어시스턴트 (coding assistants), GUI/OS 자동화, 체화된 에이전트 (embodied agents), 과학적 발견 (scientific discovery), 개인화 및 추천 (personalization and recommendation), DevOps, 그리고 기업 워크플로 (enterprise workflows)를 아우르는 에이전트 하네스로서의 코드에 대한 대표적인 방법론과 실제 응용 사례를 요약합니다. 나아가 우리는 최종 작업 성공 여부를 넘어선 평가, 불완전한 피드백 하에서의 검증, 회귀 없는 하네스 개선 (regression-free harness improvement), 다중 에이전트 간의 일관된 공유 상태 (consistent shared state), 안전이 중요한 행동에 대한 인간의 감독 (human oversight), 그리고 멀티모달 환경 (multimodal environments)으로의 확장 등 하네스 엔지니어링 (harness engineering)의 미결 과제들을 개괄합니다. 코드를 에이전트 AI의 하네스로 중심에 둠으로써, 본 조사는 실행 가능하고, 검증 가능하며, 상태를 유지하는 (stateful) AI 에이전트 시스템을 향한 통합된 로드맵을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기