Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
GazeVLM은 인간의 능동 시각(active vision) 원리를 모방하여, 기존 VLM의 수동적이고 정적인 정보 처리 방식을 개선한 멀티모달 아키텍처입니다. 이 모델은 어텐션 자원 배포에 대한 메타인지적 제어를 추론 루프 자체에 내재화하며, 시선 토큰(<LOOK>)을 자율적으로 생성하도록 함으로써 공간적이고 목표 지향적인 추론 능력을 강화합니다. 그 결과, 기존 최신 VLM 대비 높은 해상도의 멀티모달 추론 성능 향상을 입증했습니다.
본 기술 기사는 비디오 게임의 복잡한 콘텐츠인 컷신(cutscenes)을 자동화된 방식으로 생성하기 위한 'Cutscene Agent'라는 LLM 에이전트 프레임워크를 제안합니다. 이 프레임워크는 LLM과 게임 엔진 간의 양방향 통합을 가능하게 하는 Model Context Protocol (MCP) 기반 도구 키트를 제공하며, 애니메이션, 촬영 감독 등 전문 서브에이전트들이 지휘자 에이전트에 의해 조율되는 다에이전트 시스템을 구축합니다. 또한, 기존 벤치마크의 한계를 극복하고 장기적이고 상호 의존적인 도구 호출 능력을 평가하는 'CutsceneBench'를 제시하여 연구의 완성도를 높였습니다.