Mac에서 로컬 대규모 모델을 코딩 에이전트용으로 구동할 때의 문제점과 해결책
요약
Mac에서 로컬 대규모 모델을 코딩 에이전트용으로 구동할 때 발생하는 느린 응답 속도 문제를 해결하기 위해 Backburner라는 독특한 솔루션이 제시되었습니다. 이 시스템은 USB-C 케이블로 iPhone과 Mac을 연결하여, Mac과 iPhone의 GPU를 분담시켜 대규모 모델 추론 속도를 획기적으로 개선합니다.
핵심 포인트
- iPhone을 활용해 Mac의 LLM 구동 병목 현상을 해결함.
- Mac이 초기 레이어를 처리하고, iPhone이 나머지 레이어를 담당하는 방식임.
- 읽기 속도가 최대 44%까지 향상되었으며, 컨텍스트 길이도 128k로 확장 가능함.
Mac에서 코딩 에이전트(coding Agents)를 위해 로컬 대규모 모델(large models)을 실행하는 것은, 파일 하나를 읽을 때마다 응답하기까지 십여 초에서 이십여 초 동안 기다려야 하므로 가장 답답합니다.
Backburner는 상당히 독특한 해결책을 고안했습니다. USB-C 케이블을 사용하여 iPhone을 Mac에 연결하고, 휴대폰이 Qwen3.8-27B 모델 구동을 돕도록 하는 것입니다.
Mac은 모델의 처음 40개 레이어(layers)를 처리하고, iPhone은 자체 GPU를 사용하여 나머지 24개 레이어를 실행하며, 양쪽 모두 조립 라인처럼 동시에 작동합니다. 작성자는 16k부터 48k 컨텍스트로 테스트했으며, 읽기 속도가 29%에서 최대 44%까지 향상되었습니다.
GitHub:
http://github.com/StayLameBro/backburner
또 다른 장점은 컨텍스트 길이가 더 길어질 수 있다는 것입니다. 24GB의 Mac만으로는 64k까지만 처리할 수 있지만, iPhone 17 Pro Max를 연결한 후에는 대화의 초기 부분이 휴대폰으로 오프로드(offloaded)되어 저장 및 계산에 사용될 수 있으며, 테스트 결과는 128k에 도달했습니다.
동일한 입력에 대해 휴대폰이 관여하든 안 하든 출력 결과는 동일합니다. 케이블은 10Gb/s가 필요하며, 휴대폰 박스에 포함된 케이블은 너무 느립니다.
휴대폰이 컴퓨팅 파워로 사용될 수 있다는 것을 누가 알았을까요—이 아이디어는 매우 흥미롭습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @github_daily (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기