Ternary LLM을 위한 부호 있는 자리수(Signed-Digit) K/V 캐시 기반 통합 룩업 테이블 추론
요약
Ternary LLM의 효율적인 어텐션 연산을 위해 부호 있는 자리수(Signed-Digit) 기반의 통합 룩업 테이블 추론 방식을 제안합니다. K/V 캐시를 스케일링된 다중 평면 방식으로 저장하여 캐시 저장소와 연산 사이의 밀집된 실체화 과정을 생략하고 하드웨어 효율성을 높입니다.
핵심 포인트
- Ternary LLM의 가중치와 어텐션 간 정밀도 불일치 문제 해결
- K/V 캐시를 스케일링된 다중 평면 부호 있는 자리수로 저장
- 캐시 실체화 과정을 피하여 연산 효율성 및 하드웨어 성능 최적화
- 제약 조건 가이드 검색을 통한 최적의 품질-효율성 트레이드오프 달성
Ternary LLM(삼진 LLM)은 가중치 중심의 프로젝션(projection)을 컴팩트하고 효율적으로 만들지만, 어텐션(attention)은 여전히 불일치 상태로 남아 있습니다. 어텐션의 K/V 캐시는 온라인으로 생성되며, 일반적으로 별도의 더 높은 정밀도를 가진 엔진에 의해 처리됩니다. 이 캐시만을 압축하는 것으로는 이러한 불일치를 해결할 수 없습니다. 삼진 프로젝션과 동일한 룩업 테이블(lookup-table) 메커니즘으로 어텐션을 실행하려면, 하나의 리덕션(reduction) 과정에서 누적된 값들이 호환 가능한 표현 방식과 스케일(scale)을 유지해야 합니다. 이러한 요구 사항은 인과적 디코딩(causal decoding) 중 키(key)와 값(value)에 대해서도 달라지는데, 새로 생성된 값들이 아직 완료되지 않은 캐시 블록에 속할 수 있기 때문입니다. 본 연구는 Ternary LLM을 위한 통합 룩업 테이블 추론 방식을 개발합니다. 이 방식은 런타임 K/V 상태를 어텐션의 리덕션 구조를 중심으로 구성된 스케일링된 다중 평면 부호 있는 자리수(scaled multi-plane signed digits)로 저장합니다. 결과적으로 생성된 자리수 평면(digit planes)은 활성화 유도 테이블(activation-derived tables)에 의해 직접 소비되어, 캐시 저장소와 어텐션 연산 사이에서 밀집된 K/V 실체화(materialization) 과정을 피할 수 있습니다. 이 설계는 온라인 K/V 형성, 불완전한 값 블록의 제한된 처리, 그리고 선형 프로젝션(Linear projections)과 어텐션을 위한 공유 다중 스트림 데이터패스(multi-stream datapath)를 결합합니다. 제약 조건 가이드 검색(constraint-guided search)을 통해 목표 품질-효율성 트레이드오프(trade-off)에 적합한 표현 방식과 실행 정책을 선택합니다. 네이티브 및 사후 학습(post-training) 삼진 모델에 대한 실험을 통해 캐시 용량, 모델 품질 및 하드웨어 효율성 측면에서 이 접근 방식의 유효성을 검증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기