프로그램 합성으로서의 무손실 텐서 압축 (Lossless Tensor Compression as Program Synthesis)
요약
Brevis는 무손실 텐서 압축을 프로그램 합성 문제로 공식화하여 모델 체크포인트의 저장 공간을 효율적으로 줄이는 연구입니다. 타입 지정 DSL과 A* 탐색을 통해 텐서 구조를 포착하는 최적의 프로그램을 합성하며, 기존 범용 및 텐서 특화 압축기보다 뛰어난 압축률을 보여줍니다.
핵심 포인트
- 무손실 텐서 압축을 프로그램 합성(Program Synthesis)으로 접근
- 타입 지정 DSL을 설계하여 반복되는 텐서 구조를 효과적으로 포착
- 범용 압축기(zstd, gzip) 대비 최대 30.87% 높은 압축 효율 달성
- 3.60 GB/s의 압축 속도와 6.61 GB/s의 압축 해제 속도 구현
모델 체크포인트(Model checkpoints)는 수와 크기 모두 증가하고 있으며, 이는 아카이빙(archival), 전송 및 배포 비용을 점점 더 높게 만듭니다. 범용 압축기(General-purpose compressors)는 저장 요구 사항을 줄일 수 있지만 텐서 구조(tensor structure)를 무시하는 반면, 기존의 텐서 특화 압축기(tensor-specific compressors)는 고정되고 특정 형식에 종속된 파이프라인(pipelines)에 의존합니다. 우리는 무손실 텐서 압축(lossless tensor compression)을 프로그램 합성(program synthesis)으로 공식화하는 Brevis를 제시합니다. 우리는 가역 연산자(reversible operators) 세트를 통해 반복되는 영역(repeated regions) 및 부동 소수점 필드(floating-point fields)와 같은 반복되는 텐서 구조를 포착하는 타입 지정 도메인 특화 언어(typed domain-specific language, DSL)를 설계합니다. 텐서가 주어지면, Brevis는 이를 비트 단위로 정확하게(bit-exactly) 재구성하는 독립적인 DSL 프로그램을 합성합니다. 텐서의 소규모 대표 샘플로부터 학습된 체크포인트 특화 생성 사전 확률(checkpoint-specific production prior)은 제한된 A* 탐색(bounded A* search)을 안내하여 컴팩트한 프로그램을 합성하며, 이는 나중에 비트 단위로 정확한 압축 해제(bit-exact decompression)를 위해 직접 실행될 수 있습니다. 언어, 오디오 및 이미지 생성 모델을 아우르는 10개의 공개 체크포인트에 대해, Brevis는 2.13 TB의 체크포인트 데이터를 1.41 TB로 줄여 33.93%의 저장 공간 절감 효과를 보였습니다. 이는 zstd 및 gzip을 포함한 4개의 범용 압축기보다 최대 30.87% 더 작은 아카이브를 생성하며, 텐서 특화 압축기인 ZipNN 및 DFloat11보다 더 작은 아카이브를 생성합니다. 실제 동시성 구성(concurrency configuration) 하에서, Brevis는 모든 소스 바이트를 보존하면서 3.60 GB/s의 압축 속도와 6.61 GB/s의 압축 해제 속도를 달성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기