- 모델: Laguna MLX 지원 추가 MLX 모델에 Laguna XS 2, XS 2.1 및 S 2.1 지원을 추가하고 경로를 생성합니다
요약
Laguna 모델 시리즈(XS 2, XS 2.1, S 2.1)에 대한 MLX 지원이 추가되었습니다. 양자화 정책 적용, MoE 레이어 최적화, 혼합 정밀도 디스패치 등을 통해 MLX 환경에서의 모델 실행 성능을 개선했습니다.
핵심 포인트
- Laguna XS 2, XS 2.1 및 S 2.1 모델의 MLX 지원 추가
- MoE 레이어 및 양자화 정책 최적화를 통한 효율적 추론 구현
- 혼합 정밀도 전문가 디스패치 및 프리필 최적화 적용
- 커스텀 커널 없이 MLX 연산만으로 포워드 패스 최적화
- 모델: Laguna MLX 지원 추가
MLX 모델에 Laguna XS 2, XS 2.1 및 S 2.1 지원을 추가하고 경로를 생성합니다.
소스 설정(source config)을 읽어 밀집(dense) 및 라우팅된 MoE(Mixture of Experts) 레이어 전체에 하나의 양자화 정책(quantization policy)을 적용합니다. 결합된 출력 헤드(tied output head)와 라우터는 소스 정밀도(source precision)를 유지하고, 지원되는 어텐션(attention) 및 전문가 투영(expert projections)을 양자화하며, 민감한 전문가 다운 투영(expert down projections)을 선택적으로 승격(promote)시키고, 혼합 양자화 블롭(mixed quantization blobs)에 대해 텐서별 메타데이터를 출력합니다.
밀집 전문가 로딩(dense expert loading), BF16 소스 레이아웃 처리, 전문가 글로벌 스케일 형상(shapes) 및 데이터 타입(dtypes), 라우팅 점수 스케일링(routing-score scaling), 그리고 혼합 정밀도 전문가 디스패치(mixed-precision expert dispatch)를 수정합니다. 게이트/업(Gate/up) 및 다운(down) 투영은 양자화된 실행 또는 밀집 실행을 독립적으로 선택하므로, 승격된 BF16 다운 투영이 밀집 폴백(dense fallback)을 통해 양자화된 게이트/업 가중치를 강제하지 않도록 합니다.
호환 가능한 게이트/업 퓨전(gate/up fusion), 더 큰 프리필(prefill)을 위한 정렬된 표준 GatherMM 및 GatherQMM 연산, 요소별(elementwise) MoE 작업을 위한 모델 로컬 mlx.Compile 클로저(closures), 그리고 캐시 기반 512-토큰 프리필 청크(prefill chunks)를 통해 포워드 패스(forward pass)를 최적화합니다. 이를 통해 커스텀 커널(custom kernels) 없이 유지 관리되는 MLX 연산만으로 구현을 유지합니다.
Laguna 구성 변형, 양자화 정책 및 메타데이터, 밀집 및 라우팅된 전문가 로딩, 혼합 정밀도 디스패치, 컴파일 대 즉시 실행(compiled-versus-eager) 일치성, 퓨즈된 투영(fused projections), 라우팅, 그리고 프리필 청킹(prefill chunking)에 대한 집중 테스트를 추가합니다.
- 리뷰 코멘트 및 S 2.1 성능 수정
렌더러/파서(renderer/parser) 선택 및 혼합 정밀도 전문가 양자화 리뷰 피드백을 반영합니다.
크고 드문드문하게 액세스되는 전문가 버퍼의 반복적인 페이징(paging)을 방지하기 위해 Laguna 가중치를 Metal에 상주(resident)시킵니다. 이 정책의 범위를 Laguna GPU 실행으로 제한합니다.
러너(runner)의 2048-토큰 경로가 더 빨라짐에 따라 더 이상 필요하지 않은 구식 512-토큰 프리필 청킹을 제거합니다.
-
리뷰 코멘트 반영
-
create 수정
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: GitHub ollama/ollama releases의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기