
🚀 Rapid-MLX 0.11.0 출시! Apple Silicon에서 데모를 넘어 에이전트 워크플로우를 실행할 수 있을 만큼 신뢰할 수 있는
요약
Apple Silicon 환경에서 로컬 모델을 활용한 에이전트 워크플로우 실행을 지원하는 Rapid-MLX 0.11.0이 출시되었습니다. 프리픽스 캐시 및 응답 캐시 최적화를 통해 성능을 극대화했으며, 스키마 유효 도구 호출 기능을 통해 신뢰성 있는 에이전트 구현을 돕습니다.
핵심 포인트
- 프리픽스 캐시 재사용을 통해 TTFT를 최대 25.6배 단축
- MCP 서버 연동을 통한 자율적인 도구 체이닝 및 에이전트 기능 지원
- 디코딩 제약을 통한 스키마 유효 도구 호출(Schema-valid tool calls) 구현
- Qwen3, Gemma4 등 최신 모델 제품군 지원 및 Homebrew 설치 지원
🚀 Rapid-MLX 0.11.0이 출시되었습니다! Apple Silicon에서 로컬 모델을 단순히 데모용이 아닌, 에이전트 워크플로우 (agent workflows)를 실행할 수 있을 만큼 신뢰할 수 있게 만듭니다.
⚡️ 성능 (Performance)
• 프리픽스 캐시 재사용 (Prefix-cache reuse): 13.1s → 0.51s TTFT (6k-토큰 프리픽스 반복 시 25.6배 빨라짐). 공유 시스템 프롬프트를 사용하면 프리필 (prefill) 비용을 두 번 지불할 필요가 없습니다. 한 세션에서 38,032개의 토큰을 절약했습니다.
• 응답 캐시 (Response cache): 656ms → 2ms (284배 빨라짐, 바이트 단위로 동일, GPU 디코딩 없음).
• 처리량 (Throughput): Qwen3.5-4B-4bit에서 152 tok/s 달성. 콜드 스타트 (Cold starts)가 몇 초 내에 완료됩니다.
🤖 "rapid-mlx chat"이 실제 에이전트로 성장했습니다
어떤 MCP 서버든 지정하면 자율적으로 도구를 체이닝합니다 (예: 파일 시스템 서버 → 14개 도구 → list_directory → 답변). 실시간 도구 활동 UI가 포함되어 있습니다. 사고 예산 (Thinking budgets)은 빠른 속도를 유지하기 위해 디코딩 시점에 <think> 태그를 강제로 종료합니다.
🧠 5개의 새로운 모델 제품군 (Model Families)
• HY3 295B MoE (네이티브 MTP 투기적 디코딩 (speculative decoding)), Qwen3-Coder-Next 80B, MiniCPM5, LFM2.x, 그리고 실제로 작동하는 2-bit Ternary Bonsai.
• Kokoro TTS → Parakeet STT 왕복 검증 완료, 단어 단위로 완벽함.
• Qwen3-VL 비전, KV 캐시 내보내기/가져오기, 그리고 llguidance를 통한 구조화된 출력 (structured output).
🛠️ 설계 단계부터 검증된 스키마 유효 도구 호출 (Schema-valid tool calls)
로컬 모델에서 코딩 에이전트를 실행해 보셨다면, 파서를 망가뜨리는 "거의 JSON에 가까운" 인자 (arguments) 때문에 겪었던 고통을 아실 것입니다. 0.11.0은 디코딩 자체를 제약하여 모델이 잘못된 형식의 도구 호출을 내보낼 수 없도록 합니다.
• harmony/gpt-oss, qwen3_coder_xml, gemma4, deepseek_v3, 그리고 hermes에서 검증되었습니다.
• 자동 (Auto), 강제 (forced), 필수 (required) 모드 지원. 기본적으로 활성화되어 있으며 별도의 플래그가 필요 없습니다.
• 핵심 요소 (The Keystone): 이제 추론 모델 (reasoning models)에도 적용됩니다! 문법 오프셋 (grammar offset) 문제로 인해 <think> 태그가 강제 호출을 방해하는 일이 더 이상 발생하지 않습니다.
🛡️ 신뢰성 및 솔직한 격차 (Reliability & Honest Gaps)
모든 릴리스는 자동화된 도그푸딩 (dogfood) 테스트 세트(5개 모델 × 실제 하드웨어에서의 11개 체크)를 실행합니다. 잘못된 스키마 → 정직한 400 에러. 알 수 없는 모델 → 사용 가능한 옵션과 함께 404 에러. 조용한 폴백 (silent fallbacks)은 없습니다. 격차: Qwen3.6 네이티브 MTP는 현재 보류 중이며, 다음 단계로 동일 기기에서의 Ollama 헤드 투 헤드 비교가 예정되어 있습니다.
⬇️ 이제 homebrew-core에 포함되었습니다
brew install rapid-mlx
rapid-mlx chat qwen3.5-4b-4bit
Apache-2.0, MLX-native. 3.4k stars — 직접 사용해보고 문제를 알려주세요, 이슈(issues)에 빠르게 답변해 드립니다. ⭐️
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: MCP의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기