GLM-5.3-UNCENSORED를 MXFP4로 양자화하여 AMD GPU용으로 제공
요약
dealignai에서 GLM-5.3-UNCENSORED 모델을 AMD GPU 환경에 최적화하여 MXFP4로 양자화 버전을 제공합니다. 이 버전은 FP8 원본 대비 약 44% 용량이 줄어들어, AMD Quark를 MI355X 서버에서 변환되었으며 사용 가능합니다.
핵심 포인트
- GLM-5.3-UNCENSORED 모델을 AMD GPU용으로 제공함.
- MXFP4 양자화를 통해 용량을 약 44% 절감함.
- AMD Quark와 MI355X 서버를 사용하여 변환됨.
AMD GPU에서 구동하려는 분들을 위해 dealignai의 GLM-5.3-UNCENSORED-FP8을 MXFP4로 양자화했습니다. 제가 찾고 있었는데 AMD GPU용 버전이 없어 여러분에게 유용할 것이라 생각하여 가중치와 변환 스크립트를 업로드합니다. Hugging Face에서 다운로드 가능하며, 용량은 423.75 GB / 394.65 GiB로, FP8 원본보다 약 44% 작습니다. AMD Quark를 MI355X 서버에서 사용하여 변환했습니다. 전문가 가중치에는 MXFP4가 사용되었으며, 어텐션(attention), 라우터(routers) 및 기타 민감한 레이어는 더 높은 정밀도로 유지됩니다. README에 /u/bakatristan 님이 제출하신 원본 수정 버전, 양자화 세부 정보, 측정 통계 및 검증 결과가 포함되어 있습니다. [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기