
MLVC: 실제 배포를 위한 멀티 플랫폼 학습 기반 비디오 코덱 (Learned Video Codec)
요약
전통적인 비디오 코덱을 대체하기 위해 하드웨어 간 비트 단위 일치 문제를 해결한 MLVC를 소개합니다. 하이퍼프라이어를 통해 엔트로피 모델 파라미터를 명시적으로 전송함으로써, 서로 다른 NPU 환경에서도 안정적인 디코딩을 보장합니다.
핵심 포인트
- 기존 신경망 코덱의 하드웨어 호환성 및 비트 단위 불일치 문제 해결
- 하이퍼프라이어를 활용해 엔트로피 모델 스케일 파라미터를 명시적 전송
- 소비자용 NPU에서 360p/540p 비디오 기준 약 100 FPS 성능 달성
- 다양한 플랫폼 간의 교차 호환성을 확보한 실용적인 학습 기반 코덱
AI가 어디에나 존재함에도 불구하고, 우리가 실제로 사용하는 코덱은 h.264, h.265, av1과 같은 전통적인 수동 설계 (hand-engineered) 시스템이라는 점이 저는 항상 조금 이상하다고 생각했습니다. Alexnet은 수동 설계 시스템을 신경망 (neural networks)으로 대체하는 물결을 시작했지만, 14년이 지난 지금도 실제 세상에서는 전통적인 코덱들이 여전히 지배적입니다. 무엇이 문제일까요? 연산량 (Compute) 및 전력 효율성 (power efficiency)이 그 이유 중 하나입니다. 신경망 코덱 (Neural codecs)은 상당히 크고 전력을 많이 소모하는 경향이 있는 반면, h.264/h.265/av1은 거의 모든 곳에서 하드웨어 가속 (hardware acceleration)을 지원하므로 실행 비용이 저렴합니다. 물론 NPU가 신경망 코덱에 적합해 보이기는 합니다. 하지만 또 다른 큰 문제는 교차 플랫폼 호환성 (cross-platform compatibility)입니다. 예를 들어, Apple NPU에서 비디오를 인코딩하고 Intel NPU에서 디코딩한다고 가정해 봅시다. 미세한 수치적 차이로 인해 인코더와 디코더가 엔트로피 모델 (entropy model)에 대해 서로 일치하지 않을 수 있습니다. 그러면 엔트로피 디코딩 (Entropy decoding)이 깨지게 되고 전체 스트림이 실패할 수 있습니다. 단순히 모델을 양자화 (quantizing)하고 정수 연산 (integer math)으로 전환하는 것만으로는 이 문제를 안정적으로 해결할 수 없습니다. 이론적으로는 완전히 명시된 고정 소수점 연산 (fixed-point math)이 동일한 결과를 보장할 수 있습니다. 하지만 실제로 오늘날의 하드웨어와 툴체인 (toolchains)은 충분히 표준화되어 있지 않습니다. 예를 들어, Apple M3 Neural Engine의 경우, 관련 INT8 연산이 실제 INT8 경로를 통해 실행되는 대신 FP16을 사용하여 시뮬레이션됩니다. 실제 INT8을 지원하는 하드웨어에서도 반올림 모드 (rounding modes), 누적 데이터 유형 (accumulation data types), 스케일 곱셈 (scale multiplication)과 같은 세부 사항을 완전히 제어할 수 없으므로, 비트 단위로 일치하는 결과 (bit-exact results)를 여전히 보장할 수 없습니다. MLVC는 하이퍼프라이어 (hyperprior)를 통해 엔트로피 모델 스케일 파라미터 (entropy-model scale parameters)를 명시적으로 전송함으로써 이 문제를 해결하며, 따라서 신경망 자체가 NPU 간에 비트 단위로 정확하게 실행될 필요가 없습니다. 인코딩과 디코딩 모두 소비자용 NPU에서 360p/540p 비디오에 대해 약 100 FPS로 작동합니다. 이러한 조합은 우리가 실제로 배포할 수 있는 학습 기반 비디오 코덱 (learned video codecs)에 더 가까워지게 합니다. 논문 공개: 저는 저자 중 한 명이며, 질문에 기꺼이 답변하겠습니다. /u/tanelai가 r/MachineLearning에 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기