LongHorizon-Harness
요약
장기적 목표를 가진 에이전트가 경로를 이탈하지 않도록 계획, 실행, 검증 단계를 분리한 새로운 에이전트 런타임입니다. 모델 변경 없이도 WeaveBench에서 Qwen 3.7-Plus의 성능을 51.8%에서 80.7%로 크게 향상시켰습니다.
핵심 포인트
- 계획, 실행, 검증 단계를 분리하여 에이전트의 안정성 확보
- 모델 수정 없이 런타임 구조 변경만으로 성능 극대화
- Qwen 3.7-Plus 모델의 WeaveBench 성능을 80.7%까지 향상
LongHorizon-Harness
장기적 목표를 가진 에이전트 (long-horizon agents)가 경로를 이탈하지 않도록 계획 (planning), 실행 (execution), 검증 (verification)을 분리하는 새로운 에이전트 런타임 (agent runtime)입니다. 이 방식은 모델을 변경하지 않고도 WeaveBench에서 Qwen 3.7-Plus의 성능을 51.8%에서 80.7%로 끌어올립니다. https://t.co/9B81tisoFu
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기