
TurboFieldfare를 Qwen 3.6 35B로 포팅하여 1.4 GB의 RAM에서 실행했습니다
요약
TurboFieldfare 엔진을 Qwen 3.6 35B 모델에 포팅하여 1.4 GB의 RAM 환경에서 실행하는 데 성공했습니다. SSD 스트리밍 방식을 통해 메모리 사용량을 최소화하며, 모델의 구조적 특성에 따른 성능 변화를 분석했습니다.
핵심 포인트
- Qwen 3.6 35B 모델을 1.4 GB RAM 환경에서 구동 가능
- SSD 스트리밍 방식을 통해 MoE 전문가를 로드하지 않고 실행
- Qwen의 선형 어텐션 구조로 인해 KV 캐시 요구량 감소
- SSD 읽기 작업으로 인해 Gemma 대비 토큰 생성 속도는 다소 낮음
TurboFieldfare를 가지고 놀고 있었습니다. 이는 MoE (Mixture of Experts) 전문가들을 로드하는 대신 SSD에서 스트리밍하여 Gemma 4 26B를 약 2 GB 내에서 실행하는 Mac 엔진입니다. 이 엔진은 해당 모델 하나만 지원했기에, Qwen 3.6 35B-A3B에 대한 지원을 추가했습니다. 비교하자면, Qwen은 더 적은 메모리를 필요로 합니다. Gemma의 약 2.1 GB 대비 약 1.4 GB 수준입니다. Qwen의 전문가(experts)들은 크기가 절반이며, 40개의 레이어 중 30개가 선형 어텐션 (linear attention)을 사용합니다. 따라서 유지해야 할 KV 캐시 (KV cache)가 급격히 줄어듭니다. 제 M5에서의 속도는 프롬프트 길이에 따라 19–23 tok/s입니다. 동일한 기기에서 Gemma는 31–35 tok/s를 기록합니다. Qwen이 더 느린 이유는 18 GB의 전문가들이 OS 페이지 캐시 (OS page cache)에 들어가지 않아, 더 많은 읽기 작업이 실제로 SSD에 직접 부딪히기 때문입니다. 또한 머신의 워킹 셋 (working set)을 8 GB로 고정해 보았으나 차이가 없었습니다: 22.9 tok/s를 기록했으며, 어차피 디스크에서 스트리밍하고 있기 때문에 예상대로 바이트 단위로 동일한 (byte-identical) 출력이 나왔습니다. 업스트림에 PR (Pull Request)이 열려 있습니다: drumih/turbo-fieldfare#29 직접 빌드하고 싶다면 다음 브랜치를 사용하세요: NeelM0906/turbo-fieldfare@qwen36-support 참고 사항: 텍스트 전용이며, 4K 컨텍스트 (context)에서 테스트되었습니다. 약 20 GB의 디스크 공간이 필요하며, 저의 8 GB 테스트는 실제 8 GB Mac이 아니라 시뮬레이션된 메모리 압박 (memory pressure) 상황이었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기