Gemma 4 MLX 엔진 - Hyperion
요약
Gemma 모델 제품군을 기반으로 MLX M5+ 환경에서 동작하는 Hyperion 커널을 소개합니다. Rust와 Metal 인터페이스를 사용하여 구축되었으며, 현재 12B 모델 최적화에 집중하고 있습니다.
핵심 포인트
- Gemma 모델 기반의 MLX 중심 커널 개발
- Rust 및 Metal 인터페이스를 활용한 고성능 스택 구축
- 16GB 통합 메모리 환경에서의 로컬 모델 최적화 목표
- 향후 CUDA 기반 커널 채택 및 GUI 패키징 계획
저는 여기서 커널(kernel) 작업에 대해 조금 언급한 적이 있으며, 아마 대부분의 사람들은 제가 여기서 공유했던 채팅 템플릿(chat template) 수정 사항을 통해 저를 알고 계실 것입니다. Hyperion(원래 이름이죠, 정말 그렇지 않나요?)은 Gemma 모델 제품군을 기반으로 하는 MLX M5+ 중심의 커널입니다. 현재 개발 작업의 주요 동력은 12B 모델에 집중되어 있으며, 이후 나머지 모델 제품군으로 확장할 예정입니다. 왜 또 다른 MLX 엔진인가요? 이 기기에는 16GB의 통합 메모리(unified memory)가 있기 때문입니다! 통합(integration) 관점에서 단일 모델 제품군을 어디까지 밀어붙일 수 있는지 보고 싶었습니다. 이것은 오픈 소스이며, 이 작업이 안정적인 궤도에 오르면 대부분의 작업을 CUDA 기반 커널로 채택할 계획을 가지고 있습니다. 스택은 Rust로 구축되었으며, Metal 인터페이스를 위한 C 측 FFI(Foreign Function Interface) 인터페이스를 포함합니다. 조만간 Tauri로 감싸진 간단한 GUI와 함께 패키징될 예정입니다. 호기심이 생기는 분들과 함께 작업하게 되어 기쁘며, 이는 로컬 모델의 한계를 밀어붙이는 것에 대한 호기심을 자극하기 위한 것이었습니다! Hyperion을 확인해 보시고, 피드백을 주시거나, 쓰레기라고 말하며 왜 고쳐야 하는지 알려주세요!
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기