Mac에서 로컬 모델로 코딩 에이전트 사용의 핵심 과제는 속도이며, lithos-metal이 이 부분을 공략하고 있습니다.
요약
lithos-metal은 Mac 환경에서 대규모 언어 모델(LLM) 기반 코딩 에이전트의 속도 문제를 해결하는 엔진입니다. Apache-2.0 라이선스로 공개되었으며, Metal megakernel과 DSpark speculative decoding 기술을 활용하여 M5 Max 단일 칩에서 높은 추론 속도를 구현했습니다.
핵심 포인트
- Mac 로컬 LLM 에이전트의 핵심 과제는 속도입니다.
- lithos-metal은 Metal megakernel 및 DSpark 디코딩을 적용했습니다.
- OpenAI, Anthropic 등 주요 모델과 호환되는 API를 제공합니다.
- 최대 200+ token/sn의 높은 추론 속도를 보여줍니다.
Mac에서 로컬 모델로 코딩 에이전트를 사용하는 것의 가장 큰 어려움은 속도입니다. lithos-metal이 바로 그 지점을 겨냥하고 있습니다.
LithosAI가 Apache-2.0 라이선스로 오픈 소스화한 이 엔진은 Qwen3.8-27B 모델을 단일 M5 Max에서 사용자당 200+ token/sn의 최대 속도로 구동합니다. 여기에는 두 가지 기술이 적용되어 있습니다: 레이어 기반 Metal megakernel과 모델이 여러 토큰을 한 번에 추론하는 DSpark speculative decoding입니다.
실제 사용 방법은 다음과 같습니다: Homebrew로 설치하고, 서버를 단일 명령어로 실행하면 됩니다. 이후 "lithos-metal claude", "codex" 또는 "opencode"를 입력하여 에이전트를 이 로컬 모델에 연결할 수 있습니다. OpenAI와 Anthropic과 호환되는 API도 준비되어 있습니다.
제한 사항 또한 명확합니다... macOS 26 이상을 요구하며, 측정된 설치 환경은 48 GB 메모리와 40 GPU 코어를 가진 M5 Max입니다. M4 Pro 같은 칩에서는 자동 megakernel이 제공되지 않습니다. 저장소에 있는 자체 계정의 경우 더 보수적인 수치가 나옵니다: 128 토큰 컨텍스트에서 약 168, 32K에서 약 127 token/sn입니다. 한 번에 하나의 생성 작업만 처리합니다.
200이라는 최대치는 일일 속도가 아닙니다. 그럼에도 불구하고 Apple Silicon에서 로컬 에이전트를 구축할 계획이라면 주목할 만한 가치가 있습니다.
저장소는 첫 번째 댓글을 참고하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @aladagberk (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기