Strix Halo NPU가 유휴 상태로 남아있습니다. 제 코딩 에이전트가 검색, 중복 제거, 의사 결정 및 스크리닝에 사용합니다
요약
Halogen 0.16 이상 버전은 유휴 XDNA2 NPU를 OpenAI 스타일 엔드포인트로 노출하여 코딩 에이전트의 성능을 향상시킵니다. 이 스택은 코드 검색, 중복 제거, 의사 결정 등 다양한 작업을 수행하며, 특히 NPU 호출 지연 시간을 30배 줄이고 디코딩 속도를 개선했습니다.
핵심 포인트
- NPU를 활용하여 코딩 에이전트의 '어디 볼지' 단계(포인팅) 가속화
- 코드 검색 및 중복 제거 등 특정 작업에서 기존 방식 대비 높은 효율성 입증
- Halogen 0.17.1 버전은 NPU 호출 지연 시간을 크게 줄이고 디코딩 속도를 개선함
- NPU는 사고 과정(Thinking)을 GPU가 담당하고, 포인팅/지시를 전담하여 시너지를 창출
요약: Halogen 0.16 이상 버전은 여러분의 유휴 XDNA2 NPU를 OpenAI 스타일 엔드포인트로 노출합니다. 저는 이 모델 네 개를 실제 코딩 에이전트에 연결했고, 이런 것을 하는 사람을 찾지 못했습니다. 모든 것을 측정한 후 성능이 낮은 부분은 잘라냈습니다. 이 스택은 압축 트리거를 통과하는 3.5시간의 실시간 테스트를 견뎌냈고, halogen 0.17.1 버전은 NPU 호출 지연 시간을 30배 줄였으며 디코딩 속도는 약 40% 빨라졌습니다.
NPU 도구는 다음을 측정했습니다:
- codebase_search: 시맨틱 파일 검색 (임베드 + 리랭크) - grep 대비 15/20 대 9/20 달성
- dedup_scan: 저장소 전반에 걸쳐 근접 중복 파일을 찾음 - 8.4초 만에 45쌍 발견
- renames: 결정적 바이너리 의사 결정 (0.8b) - 현실적인 프롬프트에서 78% 달성, ~120ms
- auto-guard injection screening: fail-open tripwire - 42% 재현율, 0% 위양성 (30개 프롬프트 카나리아)
- rag-index: 저장소에 대한 검색 인덱스 구축 - ~5,700 토큰/초
검색은 실제이지만 키워드가 없는 질문에만 해당됩니다. '새 요청 인스턴스를 보낼 때 타임아웃이 어디에 적용되나요?'라는 질문에는 시맨틱 검색이 찾아내지만, '실패하는 test_query_encoding 수정'이라는 질문에는 grep이 더 빠릅니다. 왜냐하면 테스트 이름 자체가 무엇을 검색해야 하는지 알려주기 때문입니다.
저는 이 효과가 실제임을 위약 대조군으로 증명했습니다: 셔플된 벡터 인덱스 vs 실제 인덱스, 두 그룹 모두 1~2분 만에 해결되었습니다. NPU는 grep이 이름 지어줄 수 없는 질문에서 제 역할을 합니다. NPU는 '어디를 볼지' 단계를 가속화할 뿐입니다. 나머지 95%의 작업 시간은 코드를 읽고 수정 사항을 작성하는 데 사용되는데, 이는 모두 GPU에 의존합니다.
키워드가 적은 작업을 측정했을 때: NPU 사용 시 평균 13.6분 vs NPU 미사용 시 평균 18.7분 (NPU 그룹의 가장 느린 실행조차도 도구를 거의 사용하지 않았습니다) - 사고는 GPU가 하고, 포인팅(지시)은 NPU가 합니다.
스택 비교(이 박스, 동일 모델): 스택 / 백엔드 모델 프리필(t/s) 디코드(t/s) 테이크어웨이 할로겐 0.17.1 + NPU 도구 플래시-넥스트 v2.hgn 1,311 64 MTP / 38 직렬 가장 빠르고, 가장 많은 계측 (클로즈드 소스, docker) 할로겐 0.16.2 (이전) 동일 ~1,300 42-46 MTP NPU 호출 30배 느린 llama.cpp rocm + qwen4exp MTP UD-IQ4_XS GGUF n/a 47 ROCm에서 첫 작동하는 MTP (커뮤니티) 검열 점수: 첫 평가에서 67%를 기록하여 제외했습니다. 그런 다음 이를 비활성 트립와이어로 30개 프롬프트의 카나리아 세트에서 재테스트했습니다: 42% 재현율, 0% 위양성 (pentest 스타일을 포함한 18개의 양성 프롬프트에서). 이제 이는 게이트가 아니라 fail-open 경고 라벨로 배포됩니다 - "낮은 노이즈 스크리닝이며 보안 경계는 아닙니다." 전체 벤치마크 수치, 방법론, 카나리아 스크립트 및 테스트 후 제거한 모든 항목은 리포지토리의 docs/BENCHMARKS.md에서 확인할 수 있습니다. 압축 오프로드 측정: 사이드카가 메인 모델 압축(요청이 대화 구조를 재구성하므로 프롬프트 캐시 미스 발생)에 166초가 걸리는 세션을 약 50-60초 만에 요약합니다. 규칙 유지 카나리아: 사고(thinking) 기능을 끄고 10/10을 기록했습니다. 순수 이득: 압축 이벤트당 ~80-95초 절약. 실시간 테스트 (3.5시간, 연속 세션): 모델 턴 119회, 실제 리포지토리 작업 7단계(문서 감사, 4개 제공업체 드라이런 하네스, 메일 검사기, 적대적 iNPUT 카나리아, 서브 에이전트 코드 리뷰, 렌더링된 대시보드 비전 검증). 430k 개의 신규 토큰, 14.1M개의 캐시됨 (97% 히트), 사후에 모두 검증된 커밋 5개: 드라이런은 4/4 제공업체에서 통과하고, 검사기의 테스트는 통과했으며, 비전 단계에서는 문서가 완료되었다고 주장한 기능에서 실제 버그 3개를 발견했습니다 -
첫 실행: 8/9 인밴드(in-band)로 진행되었으며, 누락된 부분은 실제 1.3초의 도구 오버헤드였고 측정 및 문서화되었으므로 NPU의 결함이 아닙니다. 현재 하네스에 포함된 내용 (10개 확장 기능): - Ling-tiny 스위트 (4): 압축(compaction), 커밋 메시지, 레포 지도를 만듭니다 (신선도 캐시). - 브랜치 요약본입니다. - 모두 사이드카(sidecar)에서 작동하며 오프라인으로 생각합니다. - npu-retrieval: codebase_search + dedup_scan + decide (자리를 얻은 3가지 도구; auto-index는 너무 큰 루트를 거부함). - progress-tracker: 충돌 복구 기능입니다. - 에이전트가 작업 중간에 중단되어도, 다음 세션에서 정확한 작업을 재개합니다. - auto-guard: 상위에 있는 실패 시 안전장치(fail-open tripwire)입니다. - harness-tune: 실시간 설정 노브를 위한 /tune입니다. - turn-timer + 서브 에이전트 플릿을 추가했습니다.
측정 후 제거된 항목: moderate-as-gate (67%), npu_write (16.6 tok/s), 3가지 옵션 분류(40%), 도구 결과 분류 및 두 개의 확장 기능은 실제 세션에서 작동 기록이 없어 제외되었습니다. 계획 모드(plan-mode)는 569회 세션 중 3번 사용되었습니다. 성능이 약하다고 측정된 도구를 배포하는 것이 아예 배포하지 않는 것보다 더 나쁠 것입니다.
0.17.1 보너스: 공동 추측 디코딩(joint speculative decoding)은 두 개의 동시 스트림을 합쳐 72.7 tok/s의 총합계를 달성했으며, 직렬 디코드(serial decode)는 59.6 tok/s를 기록했습니다 (n-gram 미리 읽기). 프리필(prefill)은 약 1,300 tok/s로 변함이 없었으며, NPU 배치 수정 덕분에 검색 지연 시간이 약 4초에서 0.1초로 단축되었습니다.
또한 컨테이너 이미지 버전을 고정했습니다. floating :latest는 당신의 영수증을 움직이는 목표물로 측정하게 만듭니다. 전체 설치, 운영 및 문제 해결 세부 정보: 리포지토리의 README를 참조하십시오. setup은 누락된 모든 것을 다운로드하고, --doctor가 이를 검증하며, --uninstall이 이를 되돌립니다.
Halogen이 배포하는 것 외에 Strix Halo NPU의 좋은 용도를 발견한 사람이 있습니까? 그리고 가드 모델을 신뢰하기 전에 자체 프롬프트 세트로 재현율(recall)을 측정했습니까?
링크: halogen 0.17.1 | my harness | the game-ladder benchmark | quants Benchmark, scorer, and toolkit은 제가 만든 오픈 소스 리포지토리입니다. AI의 도움을 받아 실행했습니다. 모든 숫자는 제 기기에서 기록된 실행 결과에서 나온 것이며, 제가 철회한 두 가지 주장은 여전히 내 게시물 기록에 남아 있습니다. 그것이 요점입니다.
제출자: /u/stereohype [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기