Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM 에이전트의 기술(skills) 최적화 과정에서 발생하는 플랫폼 제약 조건과 작업 성능 간의 다중 목적 문제를 해결하기 위한 MOCHA 방법론을 제안합니다. MOCHA는 Chebyshev 스칼라화와 지수 어닐링을 결합하여 기존 방식이 놓치기 쉬운 비볼록 영역의 파레토 최적 변체들을 효과적으로 탐색합니다. 실험 결과, MOCHA는 기존 최적화 도구들이 실패한 작업들을 포함하여 모든 테스트 작업에서 성능 향상과 더 많은 최적 변체 발견을 입증했습니다.
본 연구는 LLM 에이전트가 관찰 계약(Observation Contracts)을 준수하는 능력을 평가하기 위해 ContractBench라는 새로운 벤치마크를 제안합니다. 이 능력은 일반적인 도구 사용 능력과는 별개로, 시간적 유효성 및 바이트 수준의 무결성을 유지해야 하는 중간 출력을 다루는 복잡한 문제입니다. 연구 결과에 따르면, 현재의 최신 프런티어 모델들조차도 관찰 계약 준수에서 어려움을 겪고 있으며, 특정 모델 제품군에서는 급격한 능력 절벽이 나타나거나 아첨 편향으로 인해 성능이 저하되는 현상 등이 발견되었습니다.