
하이브리드 CPU-GPU 환경의 소비자 기기용 LLM 추론을 위한 자동 텐서 스케줄링 (Paper)
요약
본 논문은 소비자 기기 환경에서 LLM 추론 시 발생하는 메모리 제약을 해결하기 위해 ATSInfer라는 하이브리드 CPU-GPU 시스템을 제안합니다. 기존의 레이어/전문가 단위 스케줄링 방식의 한계를 극복하고, 텐서 단위 오프로딩과 비동기 CPU-GPU 조정을 통해 효율성을 높였습니다. 테스트 결과, Prefill 및 Decode 처리량에서 큰 폭의 성능 향상을 입증했습니다.
핵심 포인트
- 소비자 기기 LLM 추론을 위한 하이브리드 CPU-GPU 시스템 ATSInfer 제안
- 텐서 단위 오프로딩과 비동기 조정을 통해 효율성 극대화
- Prefill 최대 1.94배, Decode 최대 3.29배 처리량 향상 달성
- 개인 소비자 기기에서의 로컬 LLM 배포 사용자 경험 개선 기대
노트북이나 데스크톱 같은 소비자 기기에서 대규모 언어 모델(LLM)을 실행하는 것은 어렵습니다. 왜냐하면 모델 가중치가 종종 GPU 메모리 용량을 초과하기 때문에, 효과적인 모델 용량을 확장하기 위해 CPU 메모리를 이용한 오프로딩 추론이 필요하기 때문입니다. 하지만 기존의 오프로딩 시스템들은 일반적으로 거친 레이어 수준 또는 전문가(expert) 수준의 스케줄링에 의존하며, 이는 동일 레이어 내 텐서 간의 상당한 이질성을 간과하고 이러한 기기에서 변화하는 하드웨어 부하 조건에 제대로 적응하지 못합니다. 본 논문은 소비자 기기를 위한 하이브리드 CPU-GPU 추론 시스템인 ATSInfer를 제시합니다. ATSInfer는 텐서 단위로 오프로딩을 수행합니다. ATSInfer는 정적 텐서 배치와 부하 인식 동적 전송을 결합하고, 이기종 백엔드(heterogeneous backends)에 걸쳐 하드웨어 저장소, 데이터 이동 및 계산을 효율적으로 스케줄링하기 위해 비동기 CPU-GPU 조정을 도입합니다. 저희는 ATSInfer를 구현하고 밀집(dense) 모델과 MoE 모델 모두를 사용하여 대표적인 소비자 플랫폼에서 평가했습니다. 기존 시스템들과 비교했을 때, ATSInfer는 프리필(prefill) 처리량은 최대 1.94배, 디코드(decode) 처리량은 최대 3.29배 향상시키는 동시에 GPU 활용도를 높이고 PCIe 대역폭을 더욱 효과적으로 사용합니다. 이러한 결과들은 ATSInfer가 개인 소비자 기기에서 로컬 LLM 배포의 사용자 경험을 실질적으로 개선할 수 있음을 보여줍니다. arXiv : https://arxiv.org/abs/2607.10183 전체 논문 : https://arxiv.org/pdf/2607.10183 제가 오랫동안 검색했지만, 이(GitHub) 저장소를 찾을 수 없었습니다 (아마도 아직 공개되지 않았을 것입니다). 온라인에서 사용 가능해지는 대로 GitHub 저장소 링크를 포함하겠습니다. submitted by /u/pmttyji [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기