LiteRT-LM, Intel Arc iGPU에서 llama.cpp보다 최대 3.5배 빠름 (Gemma-4 E2B 벤치마크)
요약
Intel Arc iGPU 환경에서 Google의 LiteRT-LM과 llama.cpp의 성능을 비교한 벤치마크 결과입니다. LiteRT-LM은 Gemma-4 E2B 모델 사용 시 llama.cpp보다 프롬프트 처리 속도에서 최대 3.5배 빠른 성능을 보여주었습니다.
핵심 포인트
- LiteRT-LM은 Intel Arc iGPU에서 llama.cpp 대비 압도적인 TTFT 성능 기록
- 32k 컨텍스트 기준 프롬프트 대기 시간을 약 2.1분 단축
- WebGPU 백엔드를 활용한 LiteRT-LM의 효율적인 프롬프트 프리필 성능 확인
- 디코딩 속도 측면에서는 llama.cpp + MTP 조합이 더 우세함
하드웨어: Intel Core Ultra 7 155U (Meteor Lake), Intel Arc iGPU (4 Xe-cores, UMA 공유 메모리), 16 GB LPDDR5x, Windows 11. 모델: Gemma-4 E2B (llama.cpp: Q4_K_M GGUF; LiteRT-LM: auto-int4 .litertlm). 매트릭스 코어(matrix cores)가 없는 Intel Arc iGPU에서 Google의 LiteRT-LM (WebGPU / ML-Drift 백엔드)과 llama.cpp (Vulkan 백엔드) 간의 직접적인 비교를 수행했습니다. 프롬프트 처리(prefill / 첫 번째 토큰 생성 시간(time-to-first-token))에 대한 LiteRT-LM의 결과는 놀라웠으며, 긴 컨텍스트(context)에서 프롬프트 대기 시간을 2분 이상 단축했습니다.
- 프롬프트 프리필 (Prompt Prefill, 첫 번째 토큰 생성 시간(TTFT)) — LiteRT-LM 압도 (최대 3.5배 빠름)
| 프롬프트 토큰(Prompt Tokens) | llama.cpp Vulkan (best ub512) | LiteRT-LM WebGPU | 속도 향상(Speedup) | TTFT 단축 (llama.cpp → LiteRT) |
|---|---|---|---|---|
| 4,096 | 267 tok/s | 853 tok/s | 3.2× | 15.3 s → 4.8 s |
| 8,192 | 241 tok/s | 771 tok/s | 3.2× | 34.0 s → 10.6 s |
| 22,000 | 185 tok/s | 500 tok/s | 2.7× | 119.0 s → 44.0 s |
| 32,000 | 152 tok/s | 404 tok/s | 2.7× | 210.0 s → 80.0 s (2.1분 절약!) |
32k 컨텍스트에서 llama.cpp가 3.5분이 걸리는 동안 LiteRT-LM은 80초 만에 첫 번째 토큰에 도달합니다.
- 디코딩 속도 (Decode Speed)
| 프레임워크 / 모드 | 디코딩 속도 |
|---|---|
| LiteRT-LM (Speculative OFF) | 23.2 tok/s |
| LiteRT-LM (Speculative ON) | 20.4 tok/s |
| llama.cpp + MTP | ~30.0 tok/s |
(참고: 최근 릴리스에서 수정된 추측적 디코딩(spec decoding) 버그가 있었습니다. 어쨌든 LiteRT에서는 추측적 디코딩이 도움이 되지 않는 것으로 보입니다.)
정확한 재현 가능 명령어 (Exact Reproducible Commands)
# llama.cpp (Vulkan)
lama-bench -m gemma-4-E2B-it-Q4_K_M.gguf -ngl 999 -p 4096 -n 0 -b 4096 -ub 512 -fa off -r 5
# LiteRT-LM (WebGPU)
litert-lm benchmark gemma-4-E2B-it.litertlm --backend=gpu -p 4096 -d 0 --cache disk
litert-lm benchmark gemma-4-E2B-it.litertlm --backend=gpu -p 8192 -d 0 --cache disk
/u/hi-brawlstars에 의해 제출됨
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기