Ollama의 최신 RC, Apple GPU에서의 Qwen3.5 성능 개선 및 스트리밍 호환성 문제 해결
요약
Ollama v0.32.6-rc0는 Apple GPU 환경에서 Qwen3.5의 추측적 디코딩(Speculative Decoding)을 지원하여 성능을 개선했습니다. 또한 OpenAI 호환 엔드포인트의 스트리밍 동작이 변경되었으므로 운영 환경 도입 전 호환성 테스트가 필요합니다.
핵심 포인트
- Apple GPU에서 Qwen3.5 실행 시 MTP 헤드를 활용한 성능 개선
- 추측적 디코딩을 통한 디코딩 과정의 직렬 대기 시간 단축
- OpenAI 호환 엔드포인트의 스트리밍 동작 변경에 따른 주의 필요
- 실험적 이미지 생성 기능이 이번 RC 버전에서 일시적으로 제거됨
Ollama v0.32.6-rc0는 Apple GPU에서 Qwen3.5를 실행하는 사용자들에게 유용한 경로를 추가했습니다. 이제 MLX 엔진이 추측적 디코딩 (Speculative Decoding)을 위해 모델의 MTP 헤드를 자동으로 사용합니다.
실질적인 아이디어는 간단합니다. MTP 헤드가 다음에 올 토큰들을 예측하면, 메인 모델이 해당 예측들을 배치 (Batch) 단위로 검증합니다. 승인된 예측들은 디코딩 (Decode) 과정 중의 직렬 대기 시간을 줄일 수 있습니다.
Ollama는 이것이 Qwen3.5를 더 빠르게 만든다고 밝히고 있습니다. 다만 릴리스 노트에 벤치마크, 테스트 장비 또는 속도 향상 퍼센트를 게시하지 않았으므로, "2배 더 빠름"과 같은 주장은 이번 릴리스에 의해 뒷받침되지 않습니다.
호환성 변경 사항도 그만큼 중요할 수 있습니다
동일한 릴리스는 OpenAI 호환 /v1/chat/completions 엔드포인트의 스트리밍 (Streaming) 동작을 조정합니다.
만약 사용 중인 클라이언트가 청크 (Chunks), 사용량 데이터 (Usage data), 또는 finish_reason을 파싱한다면, 이 RC 버전을 운영 워크플로우에 도입하기 전에 호환성 테스트를 다시 실행하십시오. 로컬 추론 (Local inference)은 토큰 생성 속도가 빠를 때뿐만 아니라, 통신 동작 (Wire behavior)이 예측 가능할 때 도입하기가 더 쉬워집니다.
업그레이드 전 테스트해야 하는 두 가지 이유
첫째, 이것은 안정화 버전 (Stable release)이 아닌 릴리스 후보 (Release candidate)입니다.
둘째, 실험적인 이미지 생성 기능이 일시적으로 제거되었습니다. Ollama는 해당 기능이 워크플로우의 일부라면 0.32.5 버전을 유지할 것을 권장합니다.
합리적인 구분은 다음과 같습니다:
- Apple GPU와 Qwen3.5를 사용하며 RC의 리스크를 격리할 수 있다면 지금 테스트하십시오.
- 이미지 생성이나 운영 안정성에 의존한다면 기다리십시오.
- 프리필 (Prefill)과 디코딩 (Decode)을 별도로 벤치마킹하십시오. MTP는 실제 워크로드에서 체감되는 지연 시간 (Latency) 부분을 변경하지 않고도 디코딩을 개선할 수 있습니다.
Official Ollama v0.32.6-rc0 release
AI 보조 초안 작성. 릴리스 사실 및 호환성 경계는 발행 전 검토되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기