CodeBind: 통합 구성 코드북을 통한 멀티모달 정렬을 위한 분리된 표현 학습
요약
CodeBind는 멀티모달 표현 정렬 시 발생하는 데이터 부족과 모달리티 간 불일치 문제를 해결하기 위해 제안된 새로운 프레임워크입니다. 공유 구성 요소와 모달리티 특화 구성 요소로 분리된 코드북 설계를 통해, 완전한 쌍을 이룬 데이터 없이도 다양한 모달리티를 효과적으로 정렬합니다. 9가지 다양한 모달리티에 대해 검증되었으며, 멀티모달 분류 및 검색 작업에서 최첨단 성능을 보여줍니다.
핵심 포인트
- 모달리티 공유-특화 코드북 설계를 통해 표현 편향(Representation bias) 완화
- 완전한 쌍을 이룬 데이터(Fully paired data) 없이도 점진적 정렬 가능
- 구성적 벡터 양자화(Compositional vector quantization) 기법 활용
- 텍스트, 이미지, 비디오, 촉각 등 9가지 모달리티에 대한 범용성 입증
- 멀티모달 분류 및 검색 작업에서 SOTA 성능 달성
멀티모달 표현 정렬 (Multimodal representation alignment)은 거대 언어 모델 (Large Language Models, LLM)과 로보틱스 (Robotics) 분야에서 매우 중요합니다. 전통적인 방법들은 종종 교차 모달 정보의 불일치와 데이터 부족 문제로 인해 어려움을 겪으며, 이는 모달리티 고유의 특징을 간과하는 차선의 정렬 공간 (Alignment spaces)으로 이어집니다. 우리는 모달리티 공유-특화 코드북 (Modality-shared-specific codebook) 설계를 통해 멀티모달 표현 공간을 최적화하는 프레임워크인 CodeBind를 제안합니다. CodeBind는 타겟 모달리티와 브릿징 모달리티 (Bridging modalities)를 점진적으로 정렬함으로써, 완전한 쌍을 이룬 데이터 (Fully paired data)의 필요성을 우회합니다. 전통적인 하드 정렬 (Hard alignment)과 달리, CodeBind는 특징을 의미론적 일관성을 위한 공유 구성 요소 (Shared components)와 모달리티 고유의 세부 사항을 위한 특화 구성 요소 (Specific components)로 분해합니다. 이 설계는 구성적 벡터 양자화 (Compositional vector quantization) 기법을 활용하며, 여기서 공유 코드북 (Shared codebook)은 모달리티 간의 간극을 메우고, 모달리티 특화 코드북 (Modality-specific codebooks)은 지배적인 모달리티가 다른 모달리티를 압도하는 것을 방지하여 표현 편향 (Representation bias)을 완화합니다. 9가지 모달리티 (텍스트, 이미지, 비디오, 오디오, 깊이 (Depth), 열화상 (Thermal), 촉각 (Tactile), 3D 포인트 클라우드 (3D point cloud), EEG)에 대해 검증된 CodeBind는 멀티모달 분류 (Multimodal classification) 및 검색 (Retrieval) 작업에서 최첨단 (State-of-the-art) 성능을 달성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기