Qwen 3.8 Flash Next(125B)를 소비자용 하드웨어(RTX 4090)에서 초당 100토큰으로 실행하기
요약
Strata는 Qwen3.8-Flash-Next 같은 대규모 언어 모델을 일반 PC 환경에서 구동할 수 있는 무료 오픈소스 도구입니다. GPU, RAM, CPU, SSD 등 시스템 자원을 분산하여 사용하며, 작은 보조 모델의 예측과 큰 모델의 검증 과정을 결합해 답변 생성 속도를 1.6~1.8배 향상시킵니다.
핵심 포인트
- 대규모 LLM을 PC에서 구동하는 오픈소스 도구 Strata 소개
- GPU/RAM/CPU/SSD 등 시스템 자원 분산 구조를 활용하여 성능 최적화
- 보조 모델 예측과 큰 모델 검증 결합으로 답변 속도 향상 (1.6~1.8배)
- VRAM 12GB 이상, RAM 32GB 이상을 기본 요구 사양으로 제시
Strata 는 1,250억 매개변수 모델 Qwen3.8-Flash-Next를 일반 PC에서 실행하는 무료 오픈소스 도구로, 대화, 코드 작성, 이미지 읽기와 코딩 에이전트 연동을 지원하며 데이터는 PC 밖으로 나가지 않음
GPU, RAM, CPU, SSD에 작업을 분산 해 모델을 구동함. 자주 쓰는 전문가를 GPU에 두고 나머지는 CPU가 병렬 처리하며, 작은 보조 모델의 예측을 큰 모델이 검증해 같은 답을 1.61.8배 빠르게 생성함1.8배 빠르게 얻을 수 있음
README 실측에서 RTX 5070 12GB 는 Q2_0 기준 답변 생성 94토큰/초, 32K 프롬프트 처리 2,650토큰/초를 기록했고, RX 9070 XT 16GB는 각각 60토큰/초와 1,160토큰/초를 기록함
기본 요구 사양은 VRAM 12GB 이상, RAM 32GB 이상 이며, RAM 용량에 따라 모델 선택이 달라짐. 작은 양자화 모델은 더 빠르고, 큰 모델은 조금 더 높은 성능을 내지만 메모리 부족 시 SSD를 읽느라 느려짐
OpenAI 호환 API, Anthropic API, OpenAI Responses API 로 앱과 코딩 도구에 연결할 수 있음. 기본값은 한 번에 요청 하나를 처리하며, 12GB GPU에서 동시 처리를 켜면 개별 답변 속도가 떨어짐
PC 전체에 분산하는 모델 실행 구조
Strata 는 일반 PC에서 Qwen3.8-Flash-Next 를 실행하며, 대화, 코드 작성, 이미지 읽기와 앱/코딩 에이전트 연동을 지원함
모델의 24,576개 전문가(expert) 중 단어 하나를 처리하는 데 필요한 전문가는 10개뿐임
GPU에는 가장 자주 사용하는 수천 개 전문가를 유지함
RAM에는 모든 전문가를 보관하고, CPU가 GPU에 없는 전문가의 작업을 동시에 처리함
SSD에는 대형 조회 테이블을 저장함
보조 모델의 예측과 큰 모델의 검증 을 결합함
작은 모델이 다음 몇 단어를 예측하면 큰 모델이 한 번에 확인하고 올바른 예측을 채택함
같은 답을 1.6
긴 텍스트는 한 번에 최대 8,192토큰 씩 처리하며, 처리 속도는 초당 1,000토큰 이상임
구조와 수치는 작동 원리 , 기술 상세 , 논문 에서 확인할 수 있음
실측 성능과 측정 범위
답변 생성 속도 는 짧은 대화에서 답이 출력되는 속도이며, 프롬프트 처리 속도 는 32K토큰 문서, 코드 또는 대화 기록을 읽는 속도임
RTX 5070 12GB, Ryzen 5 7600, RAM 64GB 구성의 실측 결과는 다음과 같음
Q2_0: 답변 94토큰/초 , 프롬프트 2,650토큰/초
IQ2_XS: 답변 79토큰/초, 프롬프트 2,090토큰/초
IQ3_XXS: 답변 62토큰/초, 프롬프트 1,750토큰/초
IQ3_S: 답변 53토큰/초, 프롬프트 1,620토큰/초
Coder: 답변 55토큰/초, 프롬프트 2,180토큰/초
Q2_0는 엔진 0.1.36, 나머지는 0.1.26으로 측정했으며, 답변은 4K토큰, 프롬프트는 32K토큰 기준임
RX 9070 XT 16GB, Ryzen 9 3900X, RAM 47GB 구성에서는 다음 속도를 기록함
Q2_0: 답변 60토큰/초 , 프롬프트 1,160토큰/초
IQ2_XS: 답변 52토큰/초, 프롬프트 1,110토큰/초
Coder: 답변 44토큰/초, 프롬프트 1,420토큰/초
VRAM이 더 많은 카드는 더 빠르며, RTX 3090 24GB 의 답변 생성 속도는 약 100140토큰/초로 예상함3개에 모델을 나눌 수 있음
전체 측정값과 긴 대화/다른 GPU 결과는 성능 측정표 , 모델별 속도 , 커뮤니티 벤치마크 에서 확인할 수 있음
데모에서는 RTX 5070, IQ3_S, 128K 컨텍스트 구성으로 단일 프롬프트에서 브라우저 실행용 복셀 탑 정원을 생성함
하드웨어 요구 사항과 초기 실행 제약
기본 요구 사항은 지원되는 NVIDIA/AMD GPU의 VRAM 12GB 이상 , RAM 32GB 이상, 여유 디스크 약 80GB, Windows 10/11 또는 Linux와 최신 그래픽 드라이버임
NVIDIA GeForce RTX 20/30/40/50 시리즈와 README에 명시된 AMD Radeon 제품군을 지원함
SSD를 사용하면 첫 시작이 훨씬 빨라짐
다중 GPU 를 통해 카드 2
구형 GPU, Intel Arc, AVX2 없는 CPU 지원은 커뮤니티가 각자의 장비에서 작성하고 시험한 실험적 기능임
초기 실행 시 3555GB를 RAM에 로드 하고 일부 메모리를 GPU용으로 잠그므로, PC가 13분 동안 느려지거나 응답하지 않을 수 있음
첫 실행에서 가장 오래 걸리며, 이때 창을 닫지 않고 기다려야 함
10분 이상 멈춰 있으면 재부팅 후 다른 프로그램을 닫거나 더 작은 모델로 재시도하도록 안내함
디스크 활동이 계속되면서 매우 느리거나 the engine stopped unexpectedly
오류가 나면 여유 RAM 부족 을 확인하고 다른 프로그램을 닫거나 Q2_0/IQ2_XS 같은 작은 모델을 선택해야 함
전체 요구 사항은 설치 문서 , 문제 해결은 문제 해결 문서 에서 확인할 수 있음
RAM 용량에 따른 모델 선택
동일 모델을 여러 압축 크기로 제공하며, 작은 모델은 더 빠르고 큰 모델은 조금 더 높은 성능 을 냄
RAM 32GB : Coder를 권장하며, VRAM 24GB 카드가 있으면 Q2_0와 IQ2_XS도 실행 가능함
RAM 48GB : IQ2_XS 또는 가장 빠른 Q2_0를 권장하며, 더 큰 모델은 들어가지 않음
RAM 64GB : 기본 크기들이 모두 들어가며 IQ2_XS를 권장함. IQ3_XXS/IQ3_S도 선택할 수 있고, IQ3_S는 가장 성능이 높지만 가장 느림
RAM 96GB 이상 : IQ3_S 또는 Unsloth UD-IQ4_XS를 선택할 수 있으며, 다른 프로그램을 켜 둔 채 큰 모델을 사용할 여유가 있음
Coder 는 전문가 절반을 제거한 코딩용 버전으로 RAM 32GB에 들어감
제작자 측 측정에서 전체 모델의 SWE-bench Verified 점수 91% 에 도달함
코드 외 영역, 특히 중국어와 기타 CJK 텍스트에서는 약하므로 해당 용도에는 모든 전문가를 유지하는 Q2_0, IQ2_XS, IQ3_S를 권장함
Swift 1.5 는 답변 전 사고 시간을 크게 줄인 미세조정 모델로, 비슷한 품질의 답을 더 빨리 얻을 수 있음
Unsloth UD-IQ4_XS 는 약 4비트 버전으로, 품질은 IQ3_S와 UD-Q4_K_XL 사이임
다운로드 용량은 94GB 이며, RAM이 약 80GB보다 적으면 답변 중 일부 데이터를 SSD에서 읽어 속도가 떨어짐
NVMe SSD가 도움이 됨
Unsloth UD-Q4_K_XL 은 전체 모델에 가장 가까운 실험적 버전임
답변 중 대부분의 데이터를 SSD에서 읽으므로 RAM 64GB PC에서는 7~8.5토큰/초 에 그침
OrcaRouter's Uncensored IQ3_XXS 는 설치 프로그램 메뉴에 없으며 수동 설정해야 함
설치 자동화와 앱 연동
설치 프로그램은 GPU, RAM, 디스크에 맞는 엔진과 모델 을 설정하고 컨텍스트 크기와 이미지 지원 여부를 선택하게 함
기본 설치 과정에서 모델 약 70GB를 내려받으며, 다운로드가 중단되면 이어받을 수 있음
Claude Code, Cursor, Codex, GitHub Copilot 같은 코딩 도우미가 AI 설치 안내 에 따라 설치와 앱 연결을 진행할 수 있음
MCP 서버 를 통해 AI 도구가 설치, 시작, 중지를 수행할 수도 있음
브라우저 앱은 http://127.0.0.1:8080
에서 제공됨
Chat
은 대화, Monitor
는 모델과 GPU/CPU/RAM 실시간 상태, About
은 설정과 주소를 보여줌
OpenAI 호환 API 의 기본 주소는 http://127.0.0.1:8080/v1
이며, 어떤 API 키와 모델 이름도 사용할 수 있음
Anthropic API를 사용하는 앱은 /v1/messages
로 연결할 수 있음
Codex CLI 등 OpenAI Responses API 사용 앱은 /v1/responses
를 사용할 수 있음
사고 수준 은 채팅 메뉴나 앱의 reasoning effort
에서 off
, low
, medium
, high
로 선택함
off
가 가장 빠르고, 어려운 질문에는 high
가 가장 적합함
이미지 기능을 설정하면 채팅의 Picture
또는 연동 앱의 첨부 기능으로 이미지를 전달할 수 있음
AMD GPU 환경의 이미지 읽기 는 Linux에서 CPU를 통해 처리하며, Windows에서는 아직 지원하지 않음
휴대전화나 다른 PC에서 접근하도록 네트워크에 공개할 때는 반드시 API 키를 설정 해야 함
기본적으로 요청 하나씩 처리 하고 나머지는 대기함
동시 처리 를 켤 수 있지만, 12GB GPU에서는 각 답변이 느려짐
긴 대화의 첫 메시지는 전체를 읽어야 하므로 약 30,000토큰당 1분이 걸리며, 후속 메시지는 수초 안에 시작함
오픈소스 라이선스
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기