Strix Halo의 NPU가 유휴 상태에 있다? 내 pi 코딩 에이전트가 125B MoE를 실행하며 하네스가 중요하다는 것을 증명하다
요약
작성자는 Pi 코딩 에이전트를 활용하여 NPU를 통해 125B MoE 모델(Qwen3.8 Flash-Next)을 구동하는 과정을 공유했습니다. 이 시스템은 클라우드 호출의 약 95%를 대체하며, 특히 로컬 환경에서 높은 속도와 효율성을 입증했습니다. 검색 및 결정 과정 등 여러 기능이 개발 워크플로우에 큰 개선을 가져왔습니다.
핵심 포인트
- NPU 기반 에이전트가 125B MoE 모델 구동 가능
- 클라우드 호출의 약 95%를 로컬에서 대체하여 효율성 증대
- 로컬 환경에서의 빠른 응답 속도와 높은 정확도 입증
- 검색(Search) 및 결정(Decisions) 기능이 개발 워크플로우 개선에 기여
드디어, 나의 pi 코딩 에이전트에서 NPU가 쓸모 있게 사용되고 있습니다. Halogen이 엔드포인트를 배송했고, 저는 이것이 단순한 장난감일 것이라 예상하고 연결했지만 네 가지 도구를 유지했습니다. 요약하자면: 70W 태블릿에서 Qwen3.8 Flash-Next, 즉 125B MoE 모델을 구동합니다. 동일한 버그 수정 작업의 경우, NPU 검색으로 13.6분 걸린 반면, NPU 없이는 18.7분이 걸렸습니다. 증거는 레포지토리에 있습니다. 얻은 이득은 제가 클라우드에 요청하던 호출의 약 95%를 대체한다는 것입니다. 가장 어려운 몇 퍼센트는 여전히 최고 모델인 GLM 5.3 또는 Opus에게 맡겨야 합니다. 저는 아직도 믿을 수가 없습니다. 태블릿에서 Opus 4.8급 지능과 무제한 토큰이 가능하다니요. Flash-Next는 초당 64 토큰으로 디코딩하고 약 1,500 토큰/초로 프리필(prefill)합니다. 첫 번째 토큰은 약 0.03초 만에 도착하며, 이는 측면 비교를 통해 측정된 클라우드 호출보다 약 43배 빠르며, 심지어 서버에 부하를 주는 두 번째 에이전트가 작동할 때도 여전히 7배나 빠릅니다. 처리량(throughput)보다는 체감 속도(taste)로 평가해 보겠습니다: 시스템 로그에서 가져온 실제 시간 이동 오류(real timeshift error)를 일곱 번 실행했습니다. 모두 건강하다고 나와서 수정할 것은 없었습니다. 차이점은 그들이 증명한 것입니다. pi 환경에서: Flash-Next는 2분 55초가 걸려, journalctl 추적을 통해 레이싱 notify-send와 pacman.log 검사를 수행하고 상위 PR(upstream PR)을 찾아냈습니다. glm-5.3-flashx는 2분 41초로, 스크립트의 마지막 줄에서 스냅샷 마운트가 언마운트된 것을 발견하며 가장 정확한 답변을 내놓았습니다. PR은 없었습니다. GLM 5.3 on max는 8분 30초로, 함수 이름까지 깊이 파고드는 소스 레벨 포렌식과 1초 간격의 레이스 창(race window)을 찾아내며 가장 심층적인 답변을 내놓았습니다. PR은 없었습니다. glm-5.3-flash는 9분 09초가 걸려, 상태 파일의 라이브 재현으로 이를 증명했습니다. PR은 없었습니다. opencode 환경에서: Flash는 올바른 판결과 잘못된 메커니즘으로 1분 8초 만에 완료했고, flashx는 정확하고 입증 가능하며 1분 30초가 걸렸고, 전체 753B GLM 5.3은 PR이 누락된 채로 6분 15초가 걸려 올바른 결과를 도출했습니다. 동일한 pi 하네스, 동일한 작업에서, 125B 모델을 중간 노력으로 구동했을 때와 최대 노력으로 320B 및 753B 티어를 상대할 때를 비교했습니다. 완전한 답변에 가장 먼저 도달한 것은 2분 55초였습니다. 제가 GLM 5.3 flashx로 두 결과를 평가하자, qwen도 선택했습니다. 일곱 가지 모든 답변을 나란히 놓고 본 결과: 로컬 대 클라우드 모델 비교. 검색(Search) 기능은 에이전트가 추측하는 경로를 멈추고 첫 시도에 올바른 파일을 찾아냅니다. 현실적인 쿼리에서 ripgrep 대비 조회당 약 0.1초로, 각각 20개 중 15개/20개를 기록했습니다. dup scan 기능은 git이 절대 보여주지 않는 복사되거나 이름이 변경된 파일들을 포착합니다.
4개 리포지토리에서 8.4초 만에 45쌍을 찾았고, 코사인 값 정확히 1.000인 파일 하나는 이름을 변경했습니다. 결정(Decisions) 과정은 Yes/no 분기 처리가 큰 모델의 전체 턴을 소모하는 것을 막아줍니다. 0.8b 모델이 120ms 만에 처리했으며, 정확도는 78%였습니다. 스크리닝(Screening) 과정에서는 프롬프트 인젝션(Prompt injection)이 에이전트가 작동하기 전에 플래그 지정됩니다. 메시지 하나당 0.7초가 걸리고 오탐지는 없습니다. 재현율(Recall)은 42%로, 안전장치라기보다는 연기 감지기에 가깝습니다. 작업하는 하루는 순수 pi 대비 약 30분을 절약해 줍니다: 버그 수정 속도 향상, 압축 속도 향상, 조회 및 라우팅 속도 향상, 컨텍스트에 너무 큰 도구 데이터가 쌓이는 것을 방지합니다. 클라우드 환경과 비교하면 더 많은 시간이 걸리지만, 매 턴마다 네트워크 대기 시간이 발생하기 때문에 그 차이가 납니다. 버그 수정이 많은 날에는 이 격차가 커집니다. 솔직히 말하자면: 생각하는 것은 여전히 GPU입니다. NPU가 속도를 높인 것이 아니라, 어떤 토큰에 비용을 지출할지를 바꿨습니다. 오버랩될 때만 iGPU가 약 7%의 비용을 차지합니다. 압축(Compaction): 제 194k 세션은 사이드카 요약이 ~50초 걸린 반면, 메인 모델에서는 166초가 걸렸습니다. 캐시 적중률(Cache hit)은 97%였습니다. 공식 halogen 출시는 24개 플래그의 docker 명령어입니다. 제 것은 단 하나의 명령어로 되며, 제거하면 취소됩니다. 완전히 로컬로 작동합니다: 262k 컨텍스트를 지원하며, 코드는 절대 외부로 나가지 않습니다. NPU를 실제로 사용하는 다른 사람이 있나요? 저는 아무것도 찾지 못했습니다. repo | halogen 0.17.1 | benchmarks submitted by /u/stereohype [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기