LFM2.5-VL-DSpark를 활용한 비전-언어 모델 가속화
요약
LFM2.5-VL-3B용 DSpark 초안 모델을 공개하며 비전-언어 모델(VLM)의 추론 속도 향상 방안을 제시했습니다. 이 초안 모델은 메모리 사용량 증가를 최소화하면서 최대 3.13배(온디바이스) 및 2.66배(H100)의 디코드 속도 향상을 제공합니다. llama.cpp, MLX-VLM 등 다양한 환경에서 즉시 사용할 수 있도록 지원됩니다.
핵심 포인트
- DSpark 초안 모델로 VLM 추론 속도를 크게 개선했습니다.
- 메모리 사용량 증가가 적고(8.9% 증가), 성능 저하 없이 가속화 가능합니다.
- 온디바이스 및 GPU 환경 모두에서 높은 수준의 속도 향상을 입증했습니다.
- llama.cpp, MLX-VLM 등 주요 프레임워크에 즉시 통합 지원됩니다.
DSpark
당사의 비전-언어 모델(VLM) LFM2.5-VL-3B용 초안 모델입니다. 최근 출시된 LFM2.5-DSpark 초안 모델과 마찬가지로, 이 모델은 메모리 사용량 증가를 최소화하는 대신 출력 품질을 변경하지 않으면서 더 큰 속도 향상을 제공하는 추측 디코딩(speculative decoding) 경로를 추가합니다.
더 빠른 추론: 장치에서 최대 3.13배, H100에서 2.66배의 디코드 속도 향상과 엔드투엔드(end-to-end) 성능 향상은 각각 최대 2.62배 및 2.27배에 달합니다.
적은 메모리 비용: 이 초안 모델은 3B 타겟 대비 8.9%인 280M개의 파라미터를 추가합니다.
즉시 사용 가능 지원: llama.cpp, MLX-VLM, SGLang용 LFM 호환 DSpark 통합을 제공합니다.
비전 초안 모델은 텍스트 LFM2.5-DSpark 초안 모델과 동일한 아키텍처를 사용합니다: 이는 지정된 계층의 고정된 탭(tapped) 레이어에서 타겟 모델의 은닉 상태(hidden states)를 포착하고, 이를 조건으로 사용하여 k개의 후보 토큰 블록을 작성합니다. 이미지 패치와 텍스트 토큰은 이 레이어들 이전에 공유 표현(shared representation)으로 투영되며, 따라서 초안 모델은 입력 양식에 관계없이 동일한 차원의 은닉 상태 벡터로 작동합니다. 그러므로 추론 알고리즘은 텍스트 모델과 변경되지 않습니다.

저희는 비전-언어 SFT 데이터의 혼합물, 특히 모델이 서비스할 것으로 예상되는 워크로드에 가중치를 두어 DSpark 방식을 따랐습니다. 3, 4, 5개 계층 전반에 걸친 제거 연구(ablation)를 기반으로, 초안 모델은 4개의 계층과 블록 크기 9인 단순화된 어텐션 전용 초안 모델입니다. 최종 혼합물로 10 에포크를 실행하고 매번 수락률을 측정했는데, 이는 추가 학습 토큰이 제공되면서 개선되었으나 점차 감소하는 수익률에 도달했습니다. 추론 시에는 하드웨어에 따라 블록 크기 8 또는 9를 권장합니다.
결과로 나온 초안 모델은 약 280M개의 파라미터를 가지며, 배포된 모델의 파라미터 수를 단지 8.9% 증가시킵니다.
| Component | LFM2.5-VL-3B |
|---|---|
| Decoder stack (4 layers) | 193.0M |
| ... | Total |
| 279.5M |
DSpark 초안 모델은 llama.cpp, MLX-VLM, SGLang에 대한 즉시 사용 가능 지원과 함께 LFM2.5-VL-3B로 제공됩니다.
우리는 온디바이스(on-device) 추론과 GPU 추론 모두에서 측정했습니다. 두 구성 모두 DSpark 블록 크기 8을 사용하며, MMSpec 벤치마크를 따라 일반 VQA, 텍스트 VQA, 이미지 캡셔닝, 차트 VQA, 복합 추론, 다중 턴 대화 등 여섯 가지 다양한 비전 기반 작업에서 평가되었습니다.
온디바이스 추론. M5 Max의 MLX를 사용했을 때, 태스크별로 디코딩 속도가 2.30배에서 3.13배 빨라졌습니다. 종단 간(end-to-end) 지연 시간은 1.56배에서 2.62배 개선되었습니다. M3 Ultra의 llama.cpp를 사용했을 때, 디코딩 속도는 1.57배에서 2.14배 개선되었고, 종단 간 지연 시간은 1.30배에서 1.77배 개선되었습니다.
GPU 추론. H100에서는 동일한 drafter가 20.4배에서 2.66배 더 빠른 디코딩을 제공했으며, 종단 간 개선 폭은 1.64배에서 2.27배였습니다.
LLM의 경우, 프리필(prefill) 단계는 주로 컴퓨팅에 의해 제한되며, 그 비용은 프롬프트 길이와 (준)제곱으로 증가합니다. VLM은 이미지 자체가 비전 인코더를 거치고, 이후 언어 백본(language backbone)이 텍스트 프롬프트와 함께 수백 개의 시각적 토큰을 처리하기 때문에 이 과정을 추가합니다. 에지 디바이스는 데이터센터 GPU보다 컴퓨팅 능력이 훨씬 낮으므로, time-to-first-token 및 Apple silicon과 H100에서의 디코딩 측정에서 볼 수 있듯이 프리필이 종단 간 지연 시간의 더 많은 부분을 차지합니다. (M5의 코어별 GPU 신경 가속기는 이 격차를 좁힙니다).
Speculative decoding은 디코딩만 가속화할 뿐, 비전 인코딩이나 프리필을 가속하지는 않습니다. 이러한 단계들이 이미 전체 시간의 많은 부분을 차지하고 있다면, 아무리 큰 디코딩 속도 향상이라 하더라도 종단 간 측면에서는 미미한 이득만을 가져옵니다. 이것이 바로 Amdahl's law로, 전반적인 속도 향상은 가속화되지 않은 작업 부하 부분에 의해 제한됩니다.
DSpark draft 모델을 SGLang으로 실행하려면 LFM2 타겟용 DSpark 지원이 포함된 SGLang 빌드(PR #40651)가 필요합니다. 다음 명령어로 drafter를 첨부하여 타겟을 시작하세요:
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-VL-3B \
--speculative-algorithm DSPARK \
...
그런 다음 http://localhost:30000/v1의 OpenAI 호환 엔드포인트로 쿼리합니다.
. 블록 크기는 drafter의 config.json에서 읽어옵니다.
; 기준선(baseline)은 세 개의 --speculative-* 플래그가 없는 동일한 명령어입니다.
이들을 llama.cpp로 실행하려면 해당 llama.cpp 빌드(PR#29339)가 필요합니다.
llama-server -m models/LFM2.5-VL-3B-F16.gguf \
--mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
-md LFM2.5-2.6B-DSpark-F16.gguf \
...
MLX-VLM으로 실행하려면 해당 빌드(PR#2280)가 필요합니다.
mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark
블록 크기는 사이드카 메타데이터에서 읽어옵니다(n-max는 이에 맞춰 제한됩니다). Speculative decoding은 정확합니다: 타겟이 제안된 모든 토큰을 검증하므로, 탐욕적 출력(greedy output)은 타겟 자체와 동일하며, 응답별 timings 리포트는 draft_n / draft_n_accepted를 제공합니다.
저희의 비전 DSpark 초안 모델은 Hugging Face에서 Safetensors 및 GGUF 형식으로 이용 가능합니다.
LFM2.5와 함께 저희는 어디서든 실행되는 AI라는 비전을 실현하고 있습니다. 이 모델들은 다음과 같은 특징을 가집니다:
오픈 웨이트(Open-weight) — 제한 없이 다운로드, 미세 조정 및 배포할 수 있습니다.즉시 빠른 속도(Fast from day one) — llama.cpp, MLX, SGLang에 대한 첫날 지원을 제공합니다.완벽한 제품군(A complete family) — 사용자 정의를 위한 기본 모델부터 특화된 오디오 및 비전 변형 모델까지, 하나의 아키텍처가 다양한 사용 사례를 포괄합니다.
저희는 여러분이 무엇을 만들지 기대하고 있습니다.
인용 시에는 다음 참고 자료 또는 BibTeX를 사용해 주십시오: Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.
@article{liquidAI2026vldspark,
author = {Liquid AI},
title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
...}
AI 자동 생성 콘텐츠
본 콘텐츠는 Hugging Face Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기