이제 당신의 감자 위에서도 보성이를 키울 수 있습니다
요약
GPU 자원 부족 문제를 해결하기 위해 27B급 추론 능력을 유지하면서 모델 크기를 대폭 줄인 트라이너리 변환기 가중치 기반의 언어 모델이 소개되었습니다. 이 모델은 llama.cpp (CUDA, Metal)에서 작동하며, 일반 노트북이나 단일 GPU에서도 높은 성능을 보여줍니다.
핵심 포인트
- 모델 크기가 FP16 대비 약 9.3배 축소되어 접근성이 높아짐.
- 27B급 추론 능력을 유지하면서도 낮은 비트 표현 방식의 한계를 극복함.
- Apple M5 Max 노트북에서 초당 47 토큰이라는 높은 속도를 달성함.
- 온디바이스 환경에서 262K 토큰 컨텍스트 처리가 가능해짐.
GPU가 부족하다는 핑계로 LLM을 시작하지 못하는 분들은 이제 그만! llama.cpp (CUDA, Metal, CPU)에서 작동하며, FP16(이상적) 대비 약 9.3배 작아진 트라이너리 변환기 가중치 기반의 완전한 27B급 추론 능력을 제공합니다 | FP16 지능의 98.2% 유지 | Apple M5 Max 노트북에서 약 47 토큰/초 달성
하이라이트: ~5.9 GB 크기의 언어 모델 (FP16 대비 ~54 GB에서 축소) — 일반 노트북이나 단일 GPU에서도 완전한 27B급 추론 가능
FP16 지능의 98.2% 유지:
- 14개 사고 모드 벤치마크 평균 84.78 달성 — 이는 기존 IQ2_XXS 빌드(72.59)보다 훨씬 높은 수치이며, 크기는 약 82%에 불과하고, 크기가 세 배인 UD-Q4_K_XL과 비교해도 0.4 포인트 차이 내입니다.
- 서브-4비트 영역 깊숙한 곳에서도 사고(thinking), 추론(reasoning), 에이전트적 행동(agentic behavior)을 유지하며, 이 영역에서는 기존의 저비트 표현 방식들이 무너집니다: 수학은 전체 정밀도와 0.5 포인트 차이(96.57), 코딩 수준은 기준선과 유사(89.42), 에이전트적 도구 호출은 74.92를 달성합니다.
- 임베딩, 어텐션 투영(attention projections), MLP 투영(MLP projections), LM 헤드 전반에 걸친 엔드투엔드 트라이너리 언어 가중치로, 실제로는 가중치당 1.72비트입니다 — 저비트 라벨 뒤에 고정밀도 탈출구는 없습니다; 비전 타워는 별도의 Q8_0 mmproj 패키지로 제공됩니다.
- 온디바이스에서 262K 토큰 컨텍스트를 처리하며, 이는 Qwen3.8-27B 하이브리드 어텐션 백본(~75% 선형 어텐션) 덕분에 실용적으로 유지되었습니다.
두 가지 GGUF 패킹이 llama.cpp (CUDA, Metal)을 위해 맞춤형 트라이너리 하이브리드 어텐션 커널과 함께 제공됩니다 — PTQ1_0은 트릿(trits)을 밀집하게 저장합니다(가중치당 1.75비트, 5.95 GB), PQ2_0은 각 트릿을 2비트 슬롯에 저장합니다(가중치당 2.13비트, 7.21 GB); 패킹된 가중치는 확장되지 않고 직접 사용됩니다.
/u/jacek2023 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기