긴 컨텍스트 환경에서 에이전트 기술이 실패하는 방식: 코드 감사(Code Auditing)에 대한 화이트박스 연구
요약
긴 컨텍스트 환경에서 AI 에이전트의 코드 감사(Code Auditing) 성능 저하 원인을 분석한 화이트박스 연구입니다. 컨텍스트 길이에 따른 성공률 변화와 요구 사항 상실, 편집 드리프트 등 구체적인 실패 유형을 분류했습니다.
핵심 포인트
- 긴 컨텍스트 환경에서 에이전트의 작업 성공률이 급격히 하락함
- 실패 원인으로 요구 사항 상실, 편집 드리프트, 점검 실패 등을 식별
- 단순 자가 점검보다 상세한 외부 체크리스트가 성능 유지에 효과적임
- 컨텍스트 길이에 따른 보편적 임계값보다는 작업 복잡성이 중요함
에이전트 기술(Agent Skills)은 범용 에이전트가 사용할 수 있도록 절차적 지침과 점검 사항을 패키징하지만, 기술을 로드한다고 해서 긴 도구 사용 궤적(tool-using trajectory) 동안 모든 요구 사항이 활성 상태로 유지된다는 보장은 없습니다. 우리는 실제 운영 환경에서 유래한 화이트박스(white-box) 코드 감사(code-audit) 워크플로에서 이 문제를 연구합니다. 작업과 24개의 아티팩트 점검 사항을 고정시킨 상태에서, 주변 컨텍스트(context)를 변화시키며 실패가 처음으로 가시화되는 지점을 분류했습니다: 요구 사항 상실(lost requirements), 편집 드리프트(editing drift), 점검 실패(failed checking), 또는 비-에이전트 평가자/런타임 실패(non-agent evaluator/runtime failures). gpt-5.4-mini를 탑재한 Codex는 10,991자 규모의 깨끗한 컨텍스트(clean context)에서는 10회 중 8회 실행에 성공했으나, 299,140자 규모의 관련 컨텍스트(relevant context)와 동일한 길이의 무관한 컨텍스트(irrelevant context) 모두에서는 10회 중 3회만 성공했습니다. 이 50%포인트의 차이는 크지만, 양측 피셔 검정(two-sided Fisher tests, p = 0.0698) 하에서는 추세 수준(trend-level)에 머물러 있습니다. 그럼에도 불구하고 두 긴 컨텍스트 조건 모두에서 요구 사항 커버리지(Requirement coverage)는 92% 이상을 유지했으며, 이는 몇 가지 누락만으로도 그렇지 않으면 완전했을 아티팩트(artifact)를 무효화할 수 있음을 보여줍니다. 두 번째 작업은 모든 깨끗한 컨텍스트와 긴 컨텍스트 실행을 통과했으므로, 이 증거는 보편적인 컨텍스트 길이 임계값(context-length threshold)을 지지하지 않습니다. 상세한 외부 체크리스트(external checklist)는 10회 중 10회 실행을 통과한 반면, 일반적인 자가 점검(generic self-check)은 10회 중 5회만 통과했습니다 (p = 0.0325). 코딩 에이전트 스캐폴드(Coding-agent scaffolds)는 더 작은 작업 세트(working set)를 선택함으로써 도움이 될 수 있지만, 실패를 완전히 제거하지는 못합니다. 우리는 컨텍스트 부패(context rot)나 새로운 일반 모니터링 방법을 도입하는 것이 아니라, 화이트박스 코드 감사에 대한 제한된 실패 분류와 실증적 사례 연구를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기