TwelveLabs와 비디오 메모리 계층: AI 이해력의 혁신
요약
TwelveLabs는 비디오의 시공간적 맥락을 온전히 이해하기 위해 '메모리 계층(memory layer)' 개념을 도입했습니다. 기존 AI가 비디오를 단순 프레임이나 텍스트로 축소하는 한계를 극복하고자, 의미론적 조각과 시공간 컨텍스트 저장소를 활용한 새로운 아키텍처를 제안합니다.
핵심 포인트
- 기존 비디오 AI의 한계인 시공간적 맥락 결여 및 메모리 부족 문제 지적
- 비디오를 '의미론적 조각'으로 처리하여 시공간적 관계 보존
- Morango 인코더와 Pegasus 추론 계층을 통한 혁신적 스택 구축
- 단순 검색을 넘어 의미와 엔티티를 기억하는 진정한 메모리 구현
인공지능 (AI)은 비약적인 발전을 이루었지만, 비디오를 이해하는 문제에 있어서는 여전히 상당한 과제에 직면해 있습니다. TwelveLabs의 James Le는 최근 AI Engineering World's Fair에서 비디오 지능을 위한 '메모리 계층 (memory layer)'이라는 매혹적인 개념을 발표했습니다. 그의 주장은 강력합니다. 현재의 AI 시스템은 필수적인 메모리 구성 요소가 부족하고, 종종 언어 모델 (Language Models)에서 추출된 원칙을 부적절하게 적용하기 때문에 비디오의 진정한 이해에 실패한다는 것입니다. 이 혁신은 단순한 점진적 발전이 아닙니다. 비디오 분석의 모든 잠재력을 끌어올리기 위해 매우 중요합니다.
현재 비디오 AI의 한계
Le는 대부분의 비디오 AI 시스템이 가진 근본적인 결함인 체계적인 메모리 부족을 지적하며 발표를 시작했습니다. 그는 비디오가 단순한 프레임의 집합 그 이상임을 설명했습니다. 비디오는 시각적 정보, 대화, 소리, 움직임, 광학 문자 인식 (OCR), 카메라 전환 등이 가득 찬 역동적인 '시공간적 볼륨 (spatiotemporal volume)'입니다. 이 볼륨 내의 연속성과 상호 관계는 진정한 이해를 위해 매우 중요합니다. 그러나 현재의 AI 접근 방식은 종종 비디오를 일련의 정지 이미지나 단순한 전사 (transcription)로 축소하여, 이러한 중요한 맥락적 데이터를 버리곤 합니다.
Le는 기존의 비디오 AI 스택에서 세 가지 주요 문제를 식별했습니다:
- 비디오를 '프레임의 주머니 (bag of frames)' 또는 전사로 취급: 이 접근 방식은 중요한 시공간적 맥락을 간과하여 파편화된 이해를 초래합니다.
- 비디오를 텍스트 시퀀스로 강제 변환: 이 방법은 비디오에 내재된 시공간적 관계와 이벤트 정의를 무시합니다.
- 메모리 부족: 지속적인 메모리가 없으면 AI 시스템은 비디오의 서로 다른 부분에 걸쳐 정보를 유지하고 기억할 수 없으며, 이는 복잡한 분석을 어렵게 만듭니다.
또한, 비디오의 내재적 특성인 시간적 의존성 (temporal dependencies), 멀티모달리티 (multimodality), 밀도 (density), 모호성 (ambiguity) 및 비용 (cost)으로 인해 효과적인 메모리 시스템을 개발하는 것이 특히 도전적이라는 점을 강조했습니다.
TwelveLabs의 'Jockey' 플랫폼: 비디오 메모리 솔루션
이러한 한계에 대응하여, TwelveLabs는 '메모리 계층 (memory layer)'에 초점을 맞춘 혁신적인 접근 방식을 개발했습니다. 이 혁신적인 스택은 의미 있는 시간적 단위를 나타내는 '의미론적 조각 (semantic chunks)'으로 비디오를 처리하는 것부터 시작됩니다. 이 조각들은 이후 'Morango'라고 불리는 시공간 인코더 (spatiotemporal encoder)를 사용하여 벡터 임베딩 (vector embeddings)으로 인코딩됩니다.
솔루션의 핵심에는 순간 (moments), 엔티티 (entities), 메타데이터 (metadata)와 같이 재사용 가능한 구조를 보존하도록 설계된 '시공간 컨텍스트 저장소 (spatiotemporal context store)'가 있습니다. 이 저장소는 시스템의 메모리 역할을 합니다. 이를 보완하는 것은 'Pegasus'로, 비디오 컨텍스트에 민감한 언어 모델 (language model)로서 추론 계층 (reasoning layer) 역할을 수행하며, AI가 저장된 정보를 해석하고 그에 따라 행동할 수 있도록 합니다.
그는 단순한 검색 (search)과 진정한 메모리 (memory) 사이의 명확한 차이점을 설명했습니다. 검색은 관련 있는 순간을 찾아낼 수 있지만, 메모리는 의미를 보존하고 엔티티의 타임라인 및 코퍼스 간 증거 (inter-corpus evidence)에 대한 이해를 요구하는 복잡한 질문에 시스템이 답할 수 있도록 하는 것입니다. 정보를 보유하고 기억하는 이러한 능력은 비디오 콘텐츠에 대한 더 깊고 미묘한 이해를 가능하게 합니다.
컨텍스트 그래프 및 핵심 원칙
이러한 더 깊은 이해를 용이하게 하기 위해, Le는 비디오 컬렉션을 '컨텍스트 그래프 (context graph)'로 표현할 것을 제안했습니다. 이 지속 가능하고 조회 가능한 표현 방식은 코퍼스 (corpus) 수준에서 순간(moments), 엔티티 (entities), 등장 (appearances), 관계 (relationships) 및 컨텍스트 (context)를 연결합니다. 이러한 그래프를 통해 애플리케이션은 다양한 관점과 서로 다른 시점을 통해 비디오 콘텐츠를 탐색할 수 있으며, 전례 없는 분석적 유연성을 제공합니다.
그는 견고한 비디오 메모리 계층 (video memory layer) 구축을 위한 다섯 가지 핵심 원칙을 개설했습니다:
- 메모리 액세스 (Memory Access): 저장된 정보를 효율적으로 검색하고 활용하는 능력.
- 태스크 플래닝 (Task Planning): 시스템이 가용 메모리를 기반으로 행동을 구상하고 계획할 수 있도록 하는 것.
- 검색 (Retrieval): 메모리 저장소에서 특정 정보 조각을 정확하게 가져오는 것.
- 도구 활용 (Tool Use): 필요에 따라 외부 도구 또는 기능을 통합하는 것.
- 운영 엔벨로프 및 출력 계약 (Operational Envelopes and Output Contracts): 시스템의 운영 한계와 기대되는 결과를 정의하는 것.
그는 AI 모델이 답변을 제공하기는 하지만, 메모리와 증거를 활용하여 태스크를 계획하고, 관련 순간을 검색하며, 결과를 합성하는 것은 이 시스템 내에서 작동하는 '비디오 워커 (video workers)'라고 설명했습니다. 이러한 워커 패러다임은 메모리 액세스, 태스크 플래닝, 검색, 도구 활용, 운영 엔벨로프, 출력 계약 및 평가를 포함한 구체적인 역량을 요구합니다.
Jockey를 통한 새로운 애플리케이션의 잠재력 해제
TwelveLabs의 제품인 'Jockey'는 이러한 비디오 메모리 계층 (video memory layer)의 구현체입니다. Jockey는 지식 저장소 (knowledge stores), 구성 가능한 인제스트 프로세스 (ingestion processes), 그리고 강력한 API를 제공함으로써 이러한 고급 역량을 생성하도록 설계되었습니다. Jockey는 애플리케이션이나 편집 플랫폼이 아니라, 이러한 애플리케이션을 구동하는 근본적인 '인지 인프라 (cognition infrastructure)'임을 강조했습니다.
Jockey는 세 가지 핵심 사용 사례를 통해 입증된 바와 같이 광범위한 잠재적 애플리케이션을 실현합니다:
- 미디어 및 엔터테인먼트 (Media and Entertainment): 콘텐츠 검색, 요약 및 개인화된 추천 기능 향상.
- 공공 안전 및 상업 보안 (Public Safety and Commercial Security): 더 빠른 사건 분석, 위협 탐지 및 증거 회수 가능.
- 광고 및 크리에이터 경제 (Advertising and Creator Economy): 콘텐츠 재사용, 트렌드 분석 및 자동화된 요약 생성 촉진.
이러한 사례들은 Jockey가 어떻게 다양한 산업에서 워크플로를 크게 개선하고 새로운 가능성을 창출할 수 있는지를 보여줍니다. 이 플랫폼은 현재 비공개 베타 (private beta) 단계에 있으며, TwelveLabs는 콘텐츠 조립 또는 조직 워크플로를 다루는 개발자들이 그 역량을 탐색해 볼 것을 권장하고 있습니다. 비디오 메모리 계층이라는 개념에 의해 추진되는 이러한 비디오 AI (video AI)의 진보는, AI가 인간의 이해 방식과 훨씬 더 유사하고 정교한 방식으로 비디오 콘텐츠와 상호작용하고 이해할 수 있는 미래를 약속합니다.
이러한 발전은 AI의 더 넓은 지형에서도 특히 유의미하며, NSFW AI와 같은 분야의 발전 또한 비록 다른 영역일지라도 AI가 처리하고 이해할 수 있는 한계를 넓히고 있습니다.
tags: video ai, artificial intelligence, machine learning, computer vision
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기