Strata가 llama.cpp를 압도한 것에 대한 의견
요약
작성자는 오랫동안 llama.cpp에 MoE 캐싱 기능을 요청했으나 개선이 미미했던 경험을 공유합니다. 이에 비해 Strata라는 도구가 2주 만에 Llama 모델의 prefill 및 decode 성능을 5~10배, 3~4배 향상시키며 압도적인 성능을 보여주었습니다.
핵심 포인트
- Strata가 llama.cpp 대비 월등한 성능 개선을 보임.
- 특히 prefill과 decode 단계에서 큰 폭의 속도 향상을 달성함.
- 기존 커뮤니티의 느린 진행에 비해 Strata는 빠른 혁신을 보여줌.
- Qwen-3.8-flash-next 모델에서도 높은 처리량(2000/70 t/s+)을 입증함.
저는 약 1년 동안 llama.cpp에 MoE 캐싱(MoE caching) 기능을 요청해 왔는데, 그들이 여기서는 1% 개선을 보이고 저기서는 2% 개선을 보여주며 시간만 보내는 것을 지켜보고 있었습니다.
그런데 Strata (https://github.com/Niko1221/Strata)가 약 2주 만에 5-10배의 prefill 및 3-4배의 decode 성능으로 llama를 압도했습니다.
이 기능에 대한 수많은 llama PR(Pull Request)과 개념을 증명하는 arXiv 논문들이 수십 개나 있었습니다.
아무 소식이 없었습니다. 정말 아무것도 없었어요.
음, 다만 '요약하자면: 제가 읽기 너무 게을러서 이 스레드를 닫겠습니다'라는 글만 있었네요, ㅋㅋ.
llama.cpp 유지보자들이 평범함에 얼마나 전념하고 있는지 정말 인상적입니다.
그러니 공지합니다: Strata를 사용하세요. 이는 8-16GB 카드와 64GB RAM에서 실행되는 Qwen-3.8-flash-next 모델로, 거의 Luna 수준의 모델이며... 그리고 27b(2000/70 t/s+)에 필적하거나 그보다 빠릅니다.
좋네요.
제출자: /u/Training_Visual6159
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기