지능의 눈: 왜 컴퓨터 비전이 AI 시대를 정의할 것인가
요약
기존의 AI 발전 측정 기준을 텍스트 기반에서 벗어나 '인식(perception)' 능력으로 재정립해야 한다고 주장합니다. 물리적 세계를 이해하는 비전 능력이 추론보다 중요하며, 자율 주행이나 로보틱스 같은 고부가가치 분야는 시각 데이터가 핵심 병목 지점입니다.
핵심 포인트
- AI 발전의 초점을 텍스트에서 '인식(perception)' 능력으로 전환해야 한다.
- 물리적 세계 작업은 추론보다 인식 능력이 더 큰 병목 현상을 겪는다.
- 진정한 경쟁력은 온디바이스에서 작동하는 강력한 비전 모델 구동에 있다.
- 비전-언어-액션 웨이브가 미래 AI의 핵심 방향이다.
지난 3년간 우리는 토큰, 컨텍스트 창(context window), 벤치마크 점수와 같은 텍스트를 통해 AI 발전을 측정해 왔습니다. 이러한 틀은 지능을 언어 문제로 취급하고 다른 모든 것을 다운스트림 애플리케이션으로 간주합니다. 저는 이것이 거꾸로 된 생각이라고 생각합니다. AI가 화면에 머무를지 아니면 세상으로 나아갈지를 결정하는 능력은 인식(perception)입니다. 즉, 기계가 물리적 세계를 바라보고 자신이 보는 것에 대해 정확하게 아는 것입니다. 인식은 추론(reasoning)보다 앞섭니다. 대부분의 고부가가치 물리적 세계 작업(자율 주행, 로보틱스, 의료 영상, 검사, 농업 등)은 추론 병목 현상보다는 인식 병목 현상을 겪고 있으며, 전 세계에서 활용되지 않은 가장 큰 데이터셋은 시각적이고 레이블이 지정되지 않았습니다. 따라서 '우리는 훈련 데이터가 부족하다'는 말은 오직 텍스트에만 해당됩니다. 진정한 경쟁은 온디바이스(on-device)에서 작동하는 강력한 비전 모델을 구동하는 것이며, 이것이 바로 비전-언어-액션 웨이브(vision-language-action wave)(OpenVLA, π0/π0.5, Isaac GR00T, Gemini Robotics)가 진정으로 다루는 내용입니다. 솔직히 말하자면, 규모와 트랜스포머(transformers) 자체가 비전보다 더 중요할 수 있으며, 많은 체화된 AI(embodied-AI) 결과는 자체 보고된 것입니다. 하지만 목적지는 명확해 보이며, 언어는 AI에게 말할 것을 주었고, 비전은 그것이 할 것을 줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기