아날로그 Compute-In-Memory 시스템에서 노이즈에 강한 LLM 추론을 위한 선택적 KV 캐시 보호 기술
요약
아날로그 Compute-In-Memory(CIM) 시스템에서 LLM 추론 시 발생하는 하드웨어 노이즈 문제를 해결하기 위한 연구입니다. 중요 토큰은 디지털로 처리하고 대량의 KV 캐시는 아날로그로 처리하는 계층적 보호 전략을 제안합니다.
핵심 포인트
- 아날로그 CIM의 동적 어텐션 연산 시 발생하는 하드웨어 노이즈 분석
- 싱크 토큰과 최근 토큰은 디지털로, 나머지 KV 캐시는 아날로그로 처리하는 계층적 전략
- 노이즈 환경에서 퍼플렉시티(Perplexity)를 베이스라인 수준으로 대폭 개선
- 동적 KV 프로그래밍 행 활용도를 23.1%에서 91.2%로 향상
아날로그 Compute-In-Memory (CIM) 어레이는 에너지 효율적인 LLM 추론, 특히 선형 레이어(linear layers)의 가중치 고정(weight-stationary) 연산을 위한 유망한 기반으로 부상했습니다. 그러나 아날로그 CIM을 어텐션 메커니즘(attention mechanisms)으로 확장하는 데에는 근본적인 과제가 따릅니다. KV 캐시 연산은 반복적인 인시투(in-situ) 가중치 업데이트를 요구하며, 이로 인해 발생하는 가중치 고정 패러다임과의 불일치는 동적 연산을 심각한 하드웨어 노이즈에 노출시키는데, 이는 여전히 거의 탐구되지 않은 중요한 문제입니다. 본 논문에서는 아날로그 CIM 어레이에서의 동적 어텐션 연산에 대한 최초의 체계적인 연구를 제시하며, 초기 토큰과 최근 토큰이 하드웨어 노이즈에 불균형적으로 취약하다는 점을 밝혀냅니다. 이러한 토큰 수준의 통찰에 착안하여, 우리는 싱크 토큰(sink tokens)과 슬라이딩 방식의 최근 토큰 윈도우(sliding recent-token window)는 고정밀 디지털 경로에 유지하는 한편, 대량의 KV 캐시는 아날로그 CIM에서 처리하는 계층적 토큰 보호 전략을 제안합니다. 공동 설계된 스케줄러는 디지털 오버헤드를 제한하기 위해 아날로그 프로그래밍(analog programming), 소유권 전환(ownership transition), 그리고 대량 MVM(bulk-MVM) 타일 형성을 결합합니다. 9개의 LLM에 대한 평가 결과, 우리의 접근 방식은 아날로그 노이즈 하에서의 평균 퍼플렉시티(perplexity)를 33.91에서 클린 베이스라인(clean baseline)인 11.06에 근접한 11.95로 낮추는 동시에, 동적 KV 프로그래밍 행(dynamic-KV programming-row) 활용도를 23.1%에서 91.2%로 향상시켰습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기