Harness Evolution이 한계에 도달하는 지점: 가중치 훈련을 언제 시작해야 하는가
요약
본 논문은 장기 지평 LLM 에이전트 개선을 위해 하네스(harness) 진화와 가중치 훈련의 최적 시점을 제시합니다. 실패 구성 분석을 통해 프로세스 실패는 하네스로, 콘텐츠 실패는 모델 가중치로 분리하여 처리하는 '진단 후 개입' 전략을 제안했습니다. 이를 통해 Qwen3.5 계열 모델에서 성능 향상을 입증했습니다.
핵심 포인트
- 실패 구성을 분석하여 프로세스(하네스)와 콘텐츠(가중치) 실패를 분리해야 합니다.
- 자가 진화하는 하네스는 에이전트의 실행 흐름을 개선하고, 가중치 훈련은 지식 기반의 오류를 수정합니다.
- 진단 후 개입 규칙을 적용하여 하네스와 모델 중 어느 부분에 이득을 줄지 결정할 수 있습니다.
장기 지평(long-horizon) LLM 에이전트를 개선한다는 것은 고정된 모델 주변의 하네스(harness)를 진화시키거나, 그 가중치를 훈련시키는 것을 의미합니다. 우리는 먼저 자가 진화하는 하네스를 통해 시스템을 더 강력하게 만든 다음, 크로스 시드(cross seed) 및 진화된 하네스와 기본(base) 모델 및 훈련된 가중치들을 결합하여 훈련된 모델이 어떤 이득을 유지하고 어떤 것이 여전히 런타임에 필요한지 학습시킵니다. 우리는 적절한 지렛대(lever)를 에이전트의 실패 구성(failure composition)에서 읽어낼 수 있음을 보여줍니다: 실패한 궤적들을 가장 먼저 발생한 신호로 라벨링하는 것은 프로세스 실패(차단된 호출, 루프, 소진된 단계 예산)와 콘텐츠 실패(부실한 계획이 전달되는 경우)를 분리합니다. 하네스 진화는 전자를 수리하고, 그 안에 주입된 행동은 가중치에 훈련될 수 있으며, 콘텐츠 실패는 가중치 훈련의 영역입니다. DeepPlanning에서 자가 진화하는 하네스 루프는 Qwen3.5-4B의 보류 점수(held-out score)를 0.16에서 0.30으로, Qwen3.5-9B의 경우 0.32에서 0.44로 끌어올립니다. 4B 모델의 경우, 보류 전달률은 55%에서 90%로 증가하는 반면 콘텐츠 실패는 가중치에 맡겨집니다. 진화된 하네스 궤적들로 훈련된 LoRA 어댑터는 이득을 내재화합니다: 원래의 하네스 상태에서는 두 크기 모두 보류 작업에서 +0.13을 추가하지만, 4B 모델의 경우 하네스와 쌓여서 보류 점수를 두 배 이상 높이고, 9B 모델의 경우 어댑터만으로 전체 진화 곡선과 일치하며 콘텐츠 실패를 궤적의 4분의 1에서 20분의 1로 줄입니다. 답변을 무작위로 섞은 궤적으로 훈련된 위약(placebo) 어댑터는 기본 모델보다 낮은 성능을 보였습니다. 이 루프는 WebArena-Lite로 전이되어 (+0.09, 117개의 미확인 작업에서) 여기서 얻은 이득은 모델이 보고 어댑터가 추가하지 못하는 부분에 있습니다. 그 결과는 '진단 후 개입(diagnose-then-intervene)' 규칙을 두 번 적용한 것입니다: 실패 구성을 읽어 하네스와 가중치 중 무엇을 선택할지 결정하고, 수용된 수정 사항이 무엇을 변경했는지 읽어 어떤 이득을 훈련시킬지 결정합니다. 점수는 신선한 기준점(fresh anchors)에 대한 4회 추론 평균이며, 표시된 경우가 아니라면 같은 날에 걸쳐 6개 패밀리의 8개 모델과 2개의 벤치마크에서 측정되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기