RTX 4090에서 로컬로 의사 결정 모델을 실행하여 속도를 비교한 결과
요약
본 기사는 RTX 4090 환경에서 여러 오픈 의사 결정 모델(Laya, d1, Clef-Flash, Lev)을 로컬로 구동하며 성능과 정확도를 비교 분석한 결과를 담고 있습니다. 네 가지 모델에 대해 지네 관련 위키피디아 기사를 단어별로 읽으며 특정 이름을 포착하는 작업을 수행했습니다. 분석 결과, Laya가 전반적으로 가장 빠른 속도를 보였으며, 높은 정확도와 쉬운 파인튜닝 가능성까지 갖춰 최고의 조합으로 추천되었습니다.
핵심 포인트
- Laya 모델이 다른 모델 대비 가장 빠르고 효율적입니다.
- 모델별로 성능(속도)과 정확도가 상이하게 나타났습니다.
- llama.cpp 환경에서 Laya와 d1의 성능이 우수했습니다.
- 최종적으로 GPU, llama.cpp, Laya 조합을 최적 구성으로 제시합니다.
최근 지난 2주 동안 갑자기 여러 개의 오픈 의사 결정 모델(laya, liquid의 d1, cloudflare의 clef-flash, interfaze의 lev)이 등장하는 것을 보고, 동일한 GPU에서 이들이 실제로 얼마나 차이가 나는지 알아보고 싶었습니다 (물론 모델 크기가 큰 요인이지만, 유일한 요인은 아닙니다). 네 가지 모델 모두 지네에 관한 9개의 위키피디아 기사(9,534단어)를 단어별로 읽고, 지네의 이름을 언급하는 모든 단어를 표시하는 동일한 작업을 수행했습니다. 매 단어마다 /v1/systemone 호출이 발생했으며, 다음 단어가 도착하면 즉시 응답을 요청했습니다: {"state": "Word: \"Scolopendra\".", "questions": {"centipede": {"type": "noul", "instructions": "Does this word name a kind of centipede?"}}} 모델 가중치 엔진이 단어별로 사용되었습니다 (p50). 단어 수 대비 정확도, 지네 이름 포착 건수, 오답률을 비교했습니다.
| 모델 | 크기 | 파일 형식 | 프레임워크 | b11495 | 시간(ms) | 단어 수 | 정확도 (%) | 포착 건수 | 오답률 |
|---|---|---|---|---|---|---|---|---|---|
| Laya | laya-bf16.gguf | llama.cpp | b11495 | 3.9 ms | 7,980 | 97.4% | 70% | 98 | |
| d1 | d1-3B-AD-Q4_K_M.gguf | llama.cpp | b11495 | 6.0 ms | 5,306 | 96.5% | 51% | 51 | |
| Clef-Flash | clef-flash-Q8_0.gguf | llama.cpp | b11495 | 24.4 ms | 1,292 | 97.2% | 36% | 2 | |
| Lev | interfaze-ai/lev, bf16 | lev serve (PyTorch) | 51.0 ms | 626 | 98.9% | 83% | 4 |
laya와 d1이 속도 면에서 다른 모델들을 앞섰지만, 정확도에서는 그렇게 큰 차이가 나지 않았습니다 (네, 95%라고 말하지만,
하지만 결국 Laya가 전반적으로 가장 빠른 모델이며, 어떤 사용 사례에도 쉽게 파인튜닝할 수 있다는 점을 고려하면 이 조합이 제가 선택할 만한 최고의 구성이라고 생각합니다: GPU: 임대 RTX 4090 (드라이버 580.119.02, 32 vCPU) 엔진: llama.cpp b11495 (커밋 37ac63456, CUDA 12.8 릴리스 빌드), -ngl 99, 나머지 설정은 기본값 Laya, Clef-Flash: ggml-org GGUFs d1: 자체 AD-Q4_K_M 양자화(atomic.chat)를 사용하며, /v1/systemone에서 네이티브로 실행됩니다 (lfm2-d1 지원이 #30110에 포함된 이후). Lev: interfaze의 Qwen3.5-4B LoRA를 자체 lev serve에서 기본 설정(--compile never finished warming up)으로 사용합니다. 지연 시간(latency): 같은 박스에서 로컬호스트를 통해 Python 클라이언트가 제출한 종단 간(end to end) 측정값입니다 /u/Fun-Meaning-6474 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기