Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

LLM 에이전트의 핵심 역량인 도구 사용(Tool Use) 능력을 평가하기 위한 네 가지 새로운 벤치마크 환경을 소개합니다. 계획 수립, 함수 호출, 사전 학습된 편향 극복 능력을 테스트하며 다양한 모델의 성능 차이를 분석합니다.
본 연구는 ReAct 프레임워크를 기반으로 단일 에이전트의 지시 사항(instructions)과 도구(tools)의 양이 증가함에 따라 성능이 어떻게 변화하는지 벤치마킹합니다. 실험 결과, 컨텍스트와 도구가 늘어날수록, 그리고 요구되는 궤적이 길어질수록 에이전트의 성능은 저하되는 경향을 보였습니다.