## 변경 사항 - x/create: 요청된 패밀리에서 lm_head를 8-bit로 양자화 (quantize) [@jessegross](ht
요약
Ollama의 최신 업데이트 사항을 담은 변경 로그입니다. lm_head 8-bit 양자화, Qwen 3.5 전문가 양자화 수정, MLX 지원 추가 등 모델 최적화 및 에이전트 기능 개선이 포함되었습니다.
핵심 포인트
- lm_head 및 초안 모델 출력 헤드의 8-bit 양자화 적용
- Qwen 3.5 전문가 양자화 처리 및 패킹 로직 수정
- MLX 지원 확대 및 모델 메모리 상주 기능 추가
- 에이전트 시스템 프롬프트 명령 및 권한 스킬 로딩 기능 개선
변경 사항
- x/create: 요청된 패밀리에서 lm_head를 8-bit로 양자화 (quantize) @jessegross에 의해 #17357
- test: 불안정한 (flaky) 업데이터 및 전송 유닛 테스트 (unit tests) 강화 @dhiltgen에 의해 #17378
- server: 스케줄러 로드된 맵(map)에서의 ps 데이터 레이스 (data race) 수정 @dhiltgen에 의해 #17376
- qwen3_5: 전문가 양자화 (expert quantization) 처리 수정 및 하나의 런치(launch)에서 패킹된 gate_up 수집 @jessegross에 의해 #17336
- agent: 권한 스킬 (permission skill) 로딩 @ParthSareen에 의해 #17304
- cmd/tui: 에이전트 시스템 프롬프트 (agent system prompt) 명령 @ParthSareen에 의해 #17296
- mlx: 로드된 모델 메모리를 상주 (resident) 상태로 유지 @dhiltgen에 의해 #17367
- x/create: 초안 모델 (draft model)의 출력 헤드를 요청된 타입으로 양자화 (quantize) @jessegross에 의해 #17383
- model: Laguna MLX 지원 추가 @dhiltgen에 의해 #17237
전체 변경 로그 (Full Changelog): v0.32.3...v0.32.4-rc0
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: GitHub ollama/ollama releases의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기