Basalt: 5090 + 5060 Ti 환경에서 구조화(structured) 665 tok/s, 산문(prose) 354 tok/s 달성
요약
Basalt는 Qwen3.8 Flash-Next와 Blackwell 아키텍처를 지원하도록 최적화된 전문 엔진입니다. 이 엔진은 듀얼 GPU 환경에서 구조화 출력 665 tok/s, 산문 354 tok/s의 높은 처리량을 달성했습니다. 또한 단일 5090 구동 및 최대 8명 동시 사용자 처리가 가능하며, OpenAI와 Anthropic과 호환됩니다.
핵심 포인트
- 구조화 출력에서 665 tok/s, 산문에서 354 tok/s의 높은 처리량 달성.
- 단일 GPU(5090)만으로도 충분한 성능을 보여주며, 최대 8명 동시 처리가 가능함.
- OpenAI 및 Anthropic과 호환되며, NInfer와 유사한 .basalt 파일 형식 사용.
- 커스텀 비전 인코더는 기존 방식보다 빠르며, 오픈 소스로 공개됨.
안녕하세요! 지난 한 주 동안 저는 Strata 포크를 작업해 왔는데, 이 버전은 기존 Strata가 동일한 가중치로 달성하는 처리량보다 최대 2.6배 높은 처리량을 달성하도록 대폭 최적화되었습니다. 이는 Qwen3.8 Flash-Next와 Blackwell 아키텍처만을 지원하는 전문 엔진으로 설계되었으며, 저의 현재 하드웨어(5090 + 5060 Ti - 9950X 32GB DDR5 RAM)와 같은 듀얼 GPU 구성을 포함합니다.
Basalt의 주요 기능은 다음과 같습니다:
- 속도: 구조화된 출력 665 tok/s, 산문(prose) 354 tok/s, 64k에서 7,317 prefill을 달성하며, IQ3_XXS, 400W를 사용합니다. 속도가 가장 큰 특징입니다.
- 단일 5090 구동 가능 (두 번째 카드 없이): IQ3_XXS 기준으로 구조화된 출력 585 tok/s, 산문(prose) 316 tok/s를 달성하며, 5060 Ti 사용 시보다 약 12% 느립니다. prefill은 변동이 없습니다.
- 최대 8명 사용자까지 실제 동시 처리 가능: 공유 KV 또는 슬롯별로 설정할 수 있으며 MTP가 활성화됩니다.
- 8개 스트림에서 총 623 tok/s 달성 (비교할 Strata의 수치는 가지고 있지 않습니다).
- 높은 처리량을 위해 낮은 양자화(lower quants)에 맞게 MTP를 미세 조정했습니다.
- 처음부터 설계된 커스텀 비전 인코더로, GPU에서 llama.cpp보다 최대 3배 빠르고 CPU에서는 4배 빠릅니다.
- 현재 처리량(동시성 통계 포함), 전문가 분포, 하드웨어 통계를 보여주는 간단한 서버 UI를 제공합니다. 채팅 기능은 없으며, BYOH (bring your own harness) 방식입니다.
- OpenAI 및 Anthropic과 호환됩니다.
- Linux 지원 (Windows 또는 Mac은 지원하지 않습니다).
Basalt는 가중치를 재양자화(re-quantized)하는 것이 아니라 .basalt 파일로 다시 패킹(re-packed)하여 NInfer와 유사한 형식을 사용하며, 모든 메타데이터, 비전 및 MTP를 포함하므로 양자화별로 단일 파일을 유지하면 됩니다. 초기 지원에는 Q2의 ISTA-DASLab GSQ-RCO, IQ3_XXS 및 IQ3_S, 그리고 Unsloth의 UD-Q4_K_XL 및 Q8이 포함되어 있어 VRAM/RAM 예산과 양자화 선호도에 따라 가중치를 선택할 수 있습니다.
간단한 질의응답:
-
오픈 소스인가요? - 네, 완전히 오픈 소스이며 MIT 라이선스를 따릅니다: https://github.com/jesdga95/basalt 를 포크하여 개선하고 친구 및 적과 공유하세요.
-
가중치는 어디서 얻나요? - 여기에서: https://huggingface.co/jesdga/Qwen3.8-Flash-Next-Basalt 원하는 대로 선택하세요. 빠르고 단순할지, 스마트하고 느릴지는 당신에게 달렸습니다. IQ3_S는 좋은 중간 지점입니다 (제 환경에서 약 89%의 top 1 일치율, 산문(prose) 300 tok/s).
-
Strata에 직접 기여하지 않은 이유가 무엇인가요? - 이것은 Strata에 쉽게 병합할 수 있는 단일 기능이 아닙니다. 기본적으로 대부분의 디코드(decode) 및 일부 프리필(prefill) 커널을 재작성하고 AMD, Intel, 구형 Nvidia 세대를 포함한 비-Blackwell 카드 지원을 제거합니다. 하지만 저는 이미 Strata와 llama.cpp에 패치를 기여했으며, 중요한 발견 사항은 모두 업스트림으로 푸시할 것입니다. + 제 AMD 98123X를 지원해 주실 건가요? - 물론이죠, 저에게 보내주세요. 현재로서는 제가 개인적으로 테스트할 수 있는 것만 지원할 수 있으며, 당분간 그렇게 할 계획입니다. + 왜 400 tok/s는 안 되나요? - 아직 노력 중입니다! + 이건 느낌으로 코딩한 쓰레기예요 - 네, 하지만 빠른 쓰레기죠. 아무도 더 이상 커다(cuda) 커널을 손으로 작성하지 않습니다. /u/jesdga95 님이 제출함 [링크] [댓글들]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기