5% 토큰만으로 14% 정확도 향상 달성: 자체 증류(Self-Distillation)를 통한 방법
요약
LT-OPD는 시각적 토큰을 5%만 유지하면서도 정확도를 크게 향상시켜, 기존의 성능 저하라는 통념을 깨뜨렸습니다. 이 방법은 온-정책 자체 증류를 통해 메모리 트래픽과 컴퓨팅 오버헤드를 줄이면서도 고품질 멀티모달 추론 능력을 유지합니다. 결과적으로 더 빠르고 효율적인 모델 운영이 가능해집니다.
핵심 포인트
- 시각적 토큰 5%만으로 정확도를 크게 향상시켜 성능 저하 통념을 뒤집음.
- 온-정책 자체 증류를 통해 학습 기반/강화학습 베이스라인 능가.
- KV-캐시 사용량을 85.2% 절감하여 메모리 압박 감소.
- 추론 지연 시간 증가 없이 FLOPs를 85.4% 감소시켜 효율성 극대화.
LT‑OPD는 시각적 토큰을 5%만 유지하면서도 정확도를 68.6%에서 82.3%로 끌어올렸습니다. 이 결과는 공격적인 토큰 가지치기(token pruning)가 필연적으로 성능 저하를 초래한다는 기존의 통념을 뒤집으며, 메모리 트래픽과 컴퓨팅 오버헤드를 줄이는 방식으로 이를 달성했습니다.
이전의 시각적 토큰 감소 접근 방식들은 토큰 예산이 공격적으로 줄어들었을 때 눈에 띄는 정확도 저하를 겪는 경우가 많았으며, 이는 LT‑OPD와 같은 보다 효과적인 전략의 필요성을 야기했습니다. 따라서 커뮤니티에서는 극단적인 예산 설정은 고품질 멀티모달 추론(multimodal reasoning)에는 비현실적이라고 가정해 왔습니다.
Qwen3.5-4B 기반 9가지 벤치마크 전반에 걸쳐, LT‑OPD는 시각적 토큰 유지율 5% 미만에서 평균 성능을 68.6%에서 82.3%로 향상시켜, 동일한 예산 조건에서 학습이 필요 없는(training-free), 학습 기반(training-based), 그리고 강화학습(reinforcement-learning) 베이스라인들을 능가했습니다. 학생 모델은 시각적 증거의 아주 작은 일부만을 사용하여 응답을 생성하는 반면, 고정된 전체 토큰 복사본(full-token copy)이 해당 궤적(trajectories)을 따라 분포적 감독(distributional supervision)을 제공합니다. 이러한 온-정책 자체 증류(on-policy self-distillation)는 토큰 압축으로 인해 손실된 능력의 대부분을 회복시킵니다.
동일한 프레임워크는 전체 토큰 모델 대비 KV‑캐시 사용량을 85.2% 절감합니다. 캐시 크기가 토큰 수에 선형적으로 증가하기 때문에, 토큰을 줄이는 것은 메모리 압박을 극적으로 감소시킵니다. 따라서 실무자들은 하드웨어 변경 없이 더 긴 컨텍스트 창(context windows)이나 더 큰 배치 크기(batch sizes)를 사용할 수 있습니다.
추론 지연 시간(inference latency)을 추가하지 않으면서 프리필 FLOPs가 85.4% 감소합니다. 토큰 수가 적다는 것은 초기 행렬 곱셈 체인(initial matrix multiplication chain)이 짧아진다는 것을 의미하지만, 학생 모델이 이미 누락된 시각적 단서들을 보상하는 방법을 학습했기 때문에 생성 단계는 동일한 속도로 실행됩니다. 그 결과, 답변의 품질을 희생하지 않으면서 더 빠르고 저렴한 순방향(forward) 패스를 얻게 됩니다.
이러한 성과는 훈련 과정에서 토큰 할당량을 점진적으로 줄이는 예산 수준의 커리큘럼에 달려 있습니다. “시각적 증거가 심각하게 제한될 때 온-정책 학습을 안정화하기 위해, 우리는 훈련 중 토큰 예산을 점진적으로 감소시키는 예산 수준의 커리큘럼을 추가로 도입했습니다.” [1] 이는 비자명한 스케줄링 구성 요소를 추가하며 고정된 전체 토큰 교사(teacher)를 필요로 하므로, 이 접근 방식이 다른 모달리티나 더 높은 토큰 예산으로 얼마나 잘 확장될 수 있을지는 여전히 열려 있습니다.
만약 극단적인 가지치기(pruning)가 추론 속도를 가속화하고 정확도를 향상시킬 수 있다면, 벤치마크 스위트에는 일급 설정(first-class setting)으로서 5% 토큰 트랙이 포함되어야 합니다. 모델 개발자들은 LT-OPD를 기본 시각 프런트엔드로 채택하여, 과거에 지연 시간과 정확도의 상충 관계였던 것을 명백한 이점으로 바꿀 수 있습니다.
참고 문헌
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기