와... Unsloth 팀은 매번 정말 빠르네요
요약
Unsloth 팀이 DeepSeek V4 Flash의 양자화 버전을 신속하게 출시했습니다. 4-bit 및 3-bit 양자화를 통해 로컬 환경에서도 효율적인 실행이 가능하며, 개발자들이 API와 로컬 추론 환경 중 원하는 방식을 선택할 수 있는 폭을 넓혔습니다.
핵심 포인트
- DeepSeek V4 Flash의 4-bit 및 3-bit 양자화 버전 출시
- 메모리 요구 사양을 110GB~168GB 수준으로 최적화
- Unsloth 및 llama.cpp를 통한 로컬 실행 지원
- 공식 API와 로컬 배포 솔루션 간의 상호 보완적 생태계 형성
와... Unsloth 팀은 매번 정말 빠르네요.
DeepSeek V4 Flash를 이제 로컬(Local)에서도 돌릴 수 있습니다.
Unsloth가 DeepSeek V4 Flash 0731의 양자화 (Quantization) 버전을 바로 출시했습니다: 손실 없는 4-bit는 메모리(RAM)가 168GB만 필요하고, 3-bit는 110GB까지 더 압축되었습니다.
그들은 이 버전이 이미 V4 Pro를 넘어섰다고 명시했으며, Unsloth와 llama.cpp로 직접 실행할 수 있고, 더 작은 크기의 양자화 버전도 곧 뒤따를 것이라고 밝혔습니다.
DeepSeek 측에서 V4-Flash 공식 API를 막 공개 베타로 출시하여 에이전트 (Agent) 능력이 대폭 향상된 시점에, Unsloth는 거의 동시에 로컬 배포 솔루션을 보완했습니다.
한쪽에서는 공식적으로 클라우드 API를 밀고 있고, 다른 한쪽에서는 커뮤니티가 모델을 개인 및 하이엔드 로컬 장치에 집어넣고 있습니다.
새로 출시된 강력한 모델을 고품질의 로컬 양자화 버전으로 빠르게 사용할 수 있게 되면, 개발자와 헤비 유저의 선택 폭은 눈에 띄게 넓어집니다. API를 사용할 수도 있고, 스스로 추론 (Inference) 환경을 제어할 수도 있기 때문입니다.
일반 사용자를 위한 소형 사이즈는 조금 더 기다려야 합니다. 주소는 댓글창을 확인하세요 👇
AI 자동 생성 콘텐츠
본 콘텐츠는 X @berryxia (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기