
AI 에이전트(AI Agents)를 마침내 설명해 주는 14편의 ARXIV 논문
요약
AI 에이전트의 개념, 스택, 추론, 메모리, 벤치마크 등을 다루는 14편의 주요 arXiv 논문을 소개합니다. 에이전트 시스템의 구조부터 멀티 에이전트, 신뢰성, 코드 리뷰 등 다양한 연구 분야를 포괄합니다.
핵심 포인트
- 현대적 에이전트 스택을 매핑한 서베이 논문 포함
- 에이전트의 추론, 메모리, 기술 계층에 대한 연구
- 멀티 에이전트 시스템 및 컴퓨터 사용 에이전트의 신뢰성 분석
- 에이전트의 행동 해석 및 컨텍스트 관리 방법론 제시
14편의 ARXIV 논문이 마침내 AI 에이전트(AI Agents)를 설명합니다.
-
AI 에이전트 시스템 (AI Agent Systems) — 현대적인 에이전트 스택(agent stack) 전체를 한곳에 매핑한 서베이(survey) 논문.
-
에이전트적 추론 (Agentic Reasoning) — LLM을 상호작용을 통해 계획하고, 행동하며, 학습하는 에이전트로 재정의함.
-
SimpleMem — 컨텍스트 윈도우(context window)를 폭발시키지 않으면서 효율성을 유지하는 평생 메모리(lifelong memory).
-
Terminal-Bench — 최첨단 에이전트(frontier agents)들이 여전히 65% 미만의 성능을 보이는 어려운 CLI 벤치마크.
-
멀티 에이전트 AI 시스템 연구 (Multi-Agent AI Systems Study) — 실제 MAS 코드베이스에서 실제로 무엇이 고장 나는지에 대한 첫 번째 대규모 조사.
-
에이전트-애즈-어-저지 (Agent-as-a-Judge) — 다른 에이전트를 심사하기 위해 계획하고, 도구를 사용하며, 협업하는 에이전트들.
-
에이전트 기술 (Agent Skills) — 원시 도구 호출(raw tool calling)을 대체하는 새로운 컴포저블(composable) 기술 계층.
-
컴퓨터 사용 에이전트 신뢰성 (Computer Use Agents Reliability) — 데스크톱 에이전트가 한 번 성공하더라도 왜 여전히 불안정한지에 대하여.
-
에이전트 행동 해석 방법 (How to Interpret Agent Behavior) — 에이전트가 실제로 무엇을 하고 있는지 읽기 위한 분류 체계(taxonomy).
-
에이전트적 트레이딩 (Agentic Trading) — 실제 금융 시장에서의 폐쇄 루프(closed-loop) LLM 에이전트와 그 병목 현상.
-
자기 압축 에이전트 (Self-Compacting Agents) — 에이전트가 스스로 증가하는 트레이스(traces)를 언제 어떻게 정리할지 결정함.
-
에이전트의 마지막 시험 (Agents’ Last Exam) — 검증 가능한 경제적 결과가 따르는 장기적(long-horizon) 실세계 작업.
-
에이전트적 코드 리뷰 (Agentic Code Review) — AI 에이전트 리뷰어가 실제 GitHub PR의 속도와 품질을 어떻게 변화시키는지.
-
Self-GC — 단순히 토큰을 쏟아내는 것이 아니라, 가비지 컬렉션(garbage collection)처럼 자신의 컨텍스트를 스스로 관리하는 에이전트.
#1번부터 시작하세요. 1번을 먼저 읽고 나면 그 이후의 내용들이 훨씬 더 잘 이해될 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @socialwithaayan (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기