transformers에서 GGUF를 네이티브하게 지원합니다!
요약
Hugging Face의 transformers 라이브러리가 GGUF 포맷을 네이티브하게 지원하도록 업데이트되었습니다. 이를 통해 사용자는 일반적인 Transformers API를 사용하여 양자화된 모델(GGUF)을 쉽게 로드하고 사용할 수 있습니다. 이 기능은 디버깅, 평가 및 사용자 정의 생성 과정을 간소화하며, 특히 Apple Silicon 환경에서 효율성을 높입니다.
핵심 포인트
- transformers가 GGUF 포맷을 네이티브 지원하여 사용 편의성이 향상됨.
- 일반적인 Transformers API를 통해 양자화 모델 로드가 가능해짐.
- Apple Silicon 환경에서 ggml 커널 재사용으로 최적화된 실행이 가능함.
- 최대 성능은 여전히 llama.cpp가 유리할 수 있으나, 활용도가 높아짐.
안녕하세요 여러분! Hugging Face의 Aritra입니다. transformers에 대한 최신 변경 사항을 알려드리고자 합니다. 이제 저희는 GGUFs (llama cpp quants)를 네이티브로 지원합니다. 다음과 같이 사용할 수 있습니다: from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "unsloth/Qwen3.5-4B-GGUF" filename = "Qwen3.5-4B-Q4_K_M.gguf" model = AutoModelForCausalLM.from_pretrained( model_id, gguf_file=filename, ) 로드한 후에는 일반적인 Transformers API를 사용하시면 됩니다. 왜 이렇게 하려고 했을까요? 양자화 모델은 더 작아져서 (노트북에 들어갈 수 있고) PyTorch 툴링을 활용할 수 있어 (디버깅에 유용합니다) 디버깅, 평가, 사용자 정의 생성이 훨씬 쉬워지기 때문입니다. 지원되는 Apple Silicon 환경에서는 ggml 커널을 재사용하여 모델이 패킹된 양자화 가중치에서 직접 실행될 수 있도록 합니다. M2 Max에서 테스트한 Qwen 체크포인트의 경우, Transformers는 다음과 같은 성능에 도달했습니다: Qwen3.5-4B Q4_K_M: 70.4 tok/s vs llama.cpp 사용 시 71.8 tok/s / Qwen3.8-27B UD-Q4_K_M: 15.9 tok/s vs 13.4 tok/s / Qwen3.5-35B-A3B UD-IQ4_XS: 60.2 tok/s vs 61.3 tok/s 이것이 llama.cpp를 대체하려는 것은 아닙니다. 만약 최대 로컬 추론 성능만을 중요하게 생각한다면, 여전히 llama.cpp가 더 나은 선택일 수 있습니다. 핵심은 이제 동일한 GGUF 모델을 더 유연한 환경에서 사용할 수 있게 되었다는 점입니다. 더 읽어보기: https://huggingface.co/blog/transformers-llama-cpp-quants /u/Disastrous-Work-1632가 r/LocalLLaMA에 제출했습니다. [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기