ActiveVision Gap: 최첨단 MLLM이 동적 지각(Dynamic Perception)에서 실패하는 이유
요약
ActiveVision 벤치마크는 현재 MLLM이 정적 이미지 처리를 넘어 반복적인 시각적 관찰과 피드백 루프를 수행하는 데 한계가 있음을 입증합니다. 연구는 모델이 가설을 세우고 검증하는 능동적 지각 능력이 결여되어 있음을 지적합니다.
핵심 포인트
- ActiveVision 벤치마크는 MLLM의 능동적 지각 능력을 평가함
- 현재 MLLM은 단발성 처리(Single-shot)에 의존하며 피드백 루프가 부족함
- 공간 추론 및 객체 추적 등 반복적 관찰이 필요한 작업에서 성능 저하 발생
- 최첨단 모델들도 인간 수준의 능동적 관찰 능력에는 미치지 못함
무엇이 변했는가
수년 동안 컴퓨터 비전(Computer Vision) 분야는 시각적 입력을 정적이고 단일한 스냅샷으로 취급하는 모델들이 지배해 왔습니다. 분류(Classification) 작업이든 복잡한 시각적 질의응답(VQA) 프롬프트이든, 표준적인 접근 방식은 이미지를 비전 인코더(Vision Encoder)에 입력하고 모델이 단 한 번의 통과(Single pass)로 필요한 모든 정보를 추출하기를 기대하는 것입니다. 하지만 인간의 시각은 이런 방식으로 작동하지 않습니다. 인간의 지각은 중간 가설에 의해 시선이 지속적으로 재지정되는 폐쇄 루프(Closed-loop) 시스템입니다. 우리는 보고, 가설을 세우고, 이를 확인하거나 반박하기 위해 다시 보고, 작업이 완료될 때까지 이를 반복합니다.
ActiveVision 벤치마크의 도입은 멀티모달 거대 언어 모델(MLLMs)을 평가하는 방식에 있어 중대한 변화를 의미합니다. 연구진은 세 가지 카테고리에 걸친 17개의 특정 작업을 통해 모델을 테스트함으로써, 현재의 최첨단 모델들이 인상적인 추론 및 코딩 능력을 갖추었음에도 불구하고 이러한 능동적이고 반복적인 관찰(Iterative observation)은 근본적으로 불가능하다는 것을 입증했습니다. 이 벤치마크는 모델이 단발성 처리(Single-shot processing)를 넘어설 것을 강제하며, 기존의 정적인 벤치마크에 의해 대부분 숨겨져 왔던 현재 AI 아키텍처의 심각한 한계를 드러냅니다.
기술적 세부 사항
ActiveVision 벤치마크는 현대 MLLM에서 지각-추론 루프(Perception-reasoning loop)가 결여되어 있음을 드러내도록 설계되었습니다. 단일 이미지를 제공하고 설명이나 특정 라벨을 요구하는 표준 벤치마크와 달리, ActiveVision은 모델이 반복적인 시각적 지각에 참여할 것을 요구합니다. 17개의 작업은 모델이 단순히 이미지의 고수준 요약(High-level summary)에만 의존할 수 없도록 분류되었습니다. 대신, 이 작업들은 세부 사항 관찰, 가설 형성, 그리고 그 가설을 검증하기 위한 장면의 재관찰이라는 일련의 행동 시퀀스를 필요로 합니다.
이는 표준적인 '시각-언어 (vision-language)' 패러다임에서 벗어난 것입니다. 현재의 아키텍처 (architectures)에서 시각 인코더 (visual encoder)는 일반적으로 이미지를 한 번 처리하며, 그 결과로 생성된 임베딩 (embeddings)이 언어 모델 (language model)로 전달됩니다. 그러면 언어 모델이 응답을 생성합니다. 모델이 새로운 의도나 다른 초점 영역을 가지고 이미지를 다시 '돌아볼 (look back)' 수 있는 메커니즘이 없습니다. ActiveVision 논문은 이러한 피드백 루프 (feedback loop)의 부재가 공간 추론 (spatial reasoning), 객체 추적 (object tracking), 또는 복잡한 장면 탐색 (complex scene navigation)을 요구하는 작업에서 현재 모델들이 보여주는 처참한 성능의 주요 원인이라고 주장합니다. 연구진은 모델에게 복잡한 시각적 작업을 위한 일반적인 해결책인 자체 시각 코드 (vision code)를 작성하고 실행할 수 있는 능력을 부여하더라도 여전히 실패한다는 점을 강조합니다. 이는 코드 자체가 현실적이고 노이즈가 있는 이미지에서 종종 신뢰할 수 없으며, 모델이 자체 코드에 의해 생성된 오류를 감지하고 수정하는 데 필요한 '능동적 (active)' 지각 능력이 부족하기 때문입니다.
벤치마크 분석 (Benchmark Analysis)
ActiveVision 벤치마크가 제공하는 성능 지표는 극명합니다. 평가는 인간 참가자와 비교하여 최상위권의 프런티어 모델 (frontier models), 구체적으로 GPT-5.5 및 Claude Fable 5를 포함했습니다. 결과에 따르면, 현재 사용 가능한 가장 진보된 모델들조차 능동적 관찰 (active observation)에 있어서는 인간 수준의 성능에 전혀 미치지 못하는 것으로 나타났습니다.
GPT-5.5는 가장 높은 추론 노력 (reasoning-effort) 단계에서 평가되었을 때, 항목의 10.6%만을 해결하는 데 그쳤습니다. 더욱 우려스러운 점은 17개의 작업 중 11개에서 0점을 기록했다는 것입니다. Claude Fable 5는 코딩 및 추론 리더보드 (leaderboards)에서 정상을 차지하는 명성에도 불구하고, 단 3.5%의 작업만을 해결하며 훨씬 더 저조한 성적을 거두었습니다. 반면, 인간 참가자들은 평균 96.1%의 성공률을 달성했습니다. 이러한 거대한 성능 격차는 단순히 더 많은 파라미터 (parameters)나 더 많은 학습 데이터 (training data)를 추가하는 현재의 MLLM 스케일링 (scaling) 궤적만으로는 정적 이미지 처리와 능동적이고 인간과 유사한 시각 지능 사이의 간극을 메우기에 충분하지 않음을 시사합니다.
개발자 시사점 (Developer Implications)
개발자와 AI 엔지니어들에게 ActiveVision의 연구 결과가 시사하는 바는 매우 중요합니다. 첫째, 현재의 시각-언어 아키텍처 (Vision-Language Architectures)가 정체기에 도달했음을 시사합니다. 만약 귀하의 애플리케이션이 로봇 내비게이션 (Robotic Navigation), 자동 품질 관리 (Automated Quality Control), 또는 정교한 장면 분석 (Sophisticated Scene Analysis)과 같이 복잡한 시각적 추론 (Visual Reasoning)에 의존한다면, '올인원 (all-in-one)' 시각 인코더 (Vision Encoder) 방식에만 의존할 수는 없습니다. 이 벤치마크는 이러한 모델들이 반복적이고 가설 기반의 관찰 (Hypothesis-driven Observation)을 필요로 하는 미세한 차이들에 대해 본질적으로 '눈이 멀어 있음'을 보여줍니다.
둘째, 모델이 생성한 시각 코드 (Vision Code)의 실패는 중대한 경고 신호입니다. 많은 개발자들이 LLM이 OpenCV나 PIL 같은 라이브러리를 사용하여 이미지를 처리하는 Python 코드를 작성하는 에이전트 워크플로우 (Agentic Workflows)로 이동해 왔습니다. ActiveVision 보고서는 이것이 만병통치약이 아님을 보여줍니다. 모델이 자신이 작성한 코드의 실패를 '볼' 수 없다면, 스스로 디버깅할 수 없습니다. 이는 통제된 합성 환경 (Synthetic Environments)에서는 작동할 수 있지만, 실제 세계의 시각적 복잡성 앞에서는 무너지는 취약한 시스템을 만듭니다.
앞으로 개발자들은 피드백 루프 (Feedback Loops)를 명시적으로 통합하는 아키텍처를 찾아야 합니다. 이는 반복적인 시각적 탐색 (Iterative Visual Exploration)에 보상을 주는 목적 함수 (Objectives)로 모델을 학습시키거나, 모델이 가상 카메라 또는 초점 창 (Focus Window)을 제어할 수 있도록 하는 시스템을 개발하는 것을 포함할 수 있습니다. 우리는 시각을 정적인 입력 (Static Input)으로 취급하는 것에서 벗어나, 동적이고 제어 가능한 프로세스 (Dynamic, Controllable Process)로 취급하는 방향으로 나아가야 합니다.
요점 (Bottom Line)
ActiveVision 벤치마크는 AI 커뮤니티에 경종을 울리는 역할을 합니다. 이는 현재의 MLLM(Multi-modal Large Language Models)이 인간 인지(Human Cognition)의 근간이 되는 견고하고 능동적인 시각적 관찰(Active Visual Observation) 기술이 부족하다는 것을 증명합니다. 이러한 모델들은 텍스트와 정적이고 고차원적인 이미지 특징(Static, High-level Image Features)을 바탕으로 추론하는 데는 탁월하지만, 지각-추론 루프(Perception-reasoning Loop)를 완성하지 못한다는 근본적인 한계를 가지고 있습니다. 진정한 범용 시각 지능(General-purpose Visual Intelligence)을 달성하기 위해, 업계는 정적인 아키텍처(Static Architectures)를 확장하는 것에서 벗어나 능동적이고 반복적인 시각적 참여(Active, Iterative Visual Engagement)가 가능한 시스템을 구축하는 방향으로 초점을 전환해야 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기