
중국 인민대학교 NLPIR 연구실에서 관리하는 논문 목록, 리뷰 논문 《Towards Long-Horizon Agents: A Survey》
요약
중국 인민대학교 NLPIR 연구실에서 공개한 장기적 에이전트(Long-Horizon Agents)에 관한 리뷰 논문 서베이입니다. 에이전트의 능력 분류 체계와 시간적 범위에 따른 태스크 계층을 정의하며 수백 편의 관련 연구를 수록하고 있습니다.
핵심 포인트
- 장기적 에이전트 능력을 harness 계층과 모델 최적화 계층으로 분류
- 시간적 범위에 따라 H1, H2, H3 세 가지 태스크 계층 정의
- CoT, ReAct부터 최신 에이전트 RL까지 광범위한 논문 및 코드 제공
중국 인민대학교 NLPIR 연구실에서 관리하는 논문 목록으로, 리뷰 논문 《Towards Long-Horizon Agents: A Survey》에 대응합니다.
장기적 에이전트 (Long-Horizon Agents) 능력을 두 가지 라인으로 분류합니다: 첫 번째는 harness 계층 (루프, 메모리, 도구, 오케스트레이션, 후크, 검증)이며, 두 번째는 모델 최적화 (아키텍처, 사전 학습 (Pre-training), 미세 조정 (Fine-tuning), RL, 증류 (Distillation), 자기 진화 (Self-evolution))입니다.
태스크는 시간적 범위에 따라 세 가지 계층으로 나뉩니다: H1 동일 윈도우 내, H2 윈도우/세션 간, H3 개방형 태스크 흐름.
CoT/ReAct부터 최신 에이전트 RL까지 수백 편의 논문을 수록하였으며, 링크와 코드가 첨부되어 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @qingq77 (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기