Inco AI의 오픈소스 로컬 추론 엔진 Splash, Qwen3.8-27B를 M5 Max MacBook Pro에서 최대 144
요약
Inco AI가 오픈소스 로컬 추론 엔진 Splash를 공개하며 성능을 입증했습니다. 이 엔진은 Qwen3.8-27B 모델을 M5 Max MacBook Pro에서 최대 144 Token/s까지 구동하는 등 높은 효율성을 보여줍니다. 특히, DFlash 최적화 방식을 전체 로컬 환경으로 확장하여 에이전트 시나리오의 동시 작업 처리량(throughput)에서 뛰어난 성능을 기록했습니다.
핵심 포인트
- Splash는 Qwen3.8-27B를 M5 Max에서 최대 144 Token/s로 구동합니다.
- DFlash 최적화 방식을 로컬 추론 엔진 전체에 적용하여 효율성을 높였습니다.
- 단일 작업 대비 동시 작업 처리량(throughput)에서 경쟁사 대비 압도적인 성능을 보입니다.
- 오픈소스이며 M3 이상 Mac과 macOS 26.4 이상 환경에서 사용 가능합니다.
Inco AI의 오픈소스 로컬 추론 엔진인 Splash는 Qwen3.8-27B 모델을 M5 Max MacBook Pro에서 최대 144 Token/s까지 구동하는 성능을 보여주었습니다. LM Studio가 이를 즉시 연동하여, 0.4.25 버전부터 바로 사용할 수 있게 되었습니다.
Inco가 이전에 개발한 DFlash는 이미 SGLang, vLLM, TensorRT-LLM, 그리고 llama.cpp에 적용되었습니다. Meta, NVIDIA, Xiaomi, Poolside 등도 자체 모델에 DFlash 가속을 적용하여 소형 모델들을 구동하고 있습니다. DFlash는 소형 모델이 여러 토큰을 병렬로 예측하게 한 후, 이를 대형 모델에게 일괄적으로 검증하도록 하여, 토큰 단위 생성 시 발생하는 계산량을 줄이는 방식입니다.
Splash는 이러한 최적화 방식을 전체 로컬 추론 엔진으로 확장했습니다. 현재 Qwen3.8-27B와 Qwen3.6-35B-A3B 두 모델만 지원하며, 각 모델마다 GPU 커널(kernel), 메모리 스킴(memory scheme), 그리고 DFlash 2 소형 모델을 개별적으로 구성했습니다. 지원하는 모델의 폭은 넓지 않지만, 그만큼 더 공격적인 성능 최적화를 달성했습니다.
동일한 48GB M5 Pro 기기에서 Splash로 Qwen3.8-27B의 단일(single) 짧은 컨텍스트 디코딩을 수행했을 때 74 Token/s에 도달했는데, 이는 경쟁사인 oMLX의 성능보다 약 2배 높은 수치입니다. 4개 동시 작업(concurrent)으로 늘렸을 때는 총 처리량(total throughput)이 170 Token/s를 기록하여, oMLX가 기록한 43 Token/s 대비 무려 3.9배의 격차를 벌렸습니다.
이는 Splash가 에이전트(Agent) 시나리오에 더 적합하다는 것을 의미합니다. 에이전트가 여러 하위 작업을 동시에 실행할 때, 개별 대화 속도보다 동시 작업 처리량이 훨씬 중요하기 때문입니다.
Splash 자체는 오픈소스로 공개되었으며 LM Studio에 종속되지 않습니다. 현재 사용을 위해서는 M3 또는 그 이후 버전의 Mac과 macOS 26.4 이상, 그리고 최소 36GB의 통합 메모리가 필요합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X GPU/AI 하드웨어의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기