스토리 타임: Strix Halo 노트북에서 Qwen3.8-Flash-Next와 동일한 기능을 가진 Claude Opus 5.5 비교
요약
본 기사는 Strix Halo 노트북 환경에서 Qwen3.8-Flash-Next와 Claude Opus 5.5를 비교 분석한 내용을 담고 있습니다. 복잡한 코딩 작업을 통해 두 모델의 성능과 효율성을 측정했으며, Flash-Next가 전반적인 작업 시간 및 토큰 사용량 면에서 더 나은 결과를 보였습니다. 작성자는 로컬 환경에서의 최신 LLM 구동 가능성에 주목하며, Opus 5.5는 여전히 계획 및 검토 단계에 유용하지만 실제 코딩에는 로컬 모델이 경쟁력을 갖추고 있음을 강조합니다.
핵심 포인트
- Flash-Next가 총 작업 시간(130분 vs 18분)과 토큰 사용량 면에서 Opus 5.5보다 훨씬 효율적임.
- Opus 5.5는 계획 및 검토 단계에 여전히 유용하며, 로컬 모델은 실제 코딩 작업에 강력한 경쟁력을 가짐.
- 작성자는 Strix Halo 노트북 환경에서 최첨단 LLM을 구동할 수 있다는 점에 놀라움을 표함.
- Opus 5.5의 비용($7.53)과 Flash-Next의 전력 소비(0.15 kWh)를 비교 분석하여 효율성을 입증함.
지난 몇 주 동안 제가 작성한 코딩 작업 대부분은 Qwen3.8-Flash-Next를 사용하여 로컬로 진행했기 때문에, LlamaStash(복잡하고 큰 Rust 프로젝트)에 구축할 수 있는 매우 복잡한 기능을 부여하여 Opus 5.5와 비교해 보았습니다.
설정: ASUS ROG Flow Z13 (Strix Halo, 128GB), Pi를 하네스로 사용하여 Flash-Next는 xhigh 노력으로 진행했습니다. Opus 5.5는 Claude Code에서 medium 노력으로 실행되었습니다. 저 역시 Opus에 대해 xhigh를 원했지만, 최신 모델을 선택했을 때 Claude가 이를 medium로 변경했고 작업이 끝날 때까지 알아차리지 못했습니다. 하지만 어쨌든 medium가 더 공정한 설정일 것 같습니다.
작업: 기존의 시작 및 중지 코드를 재사용하는 llamastash 데몬 재시작 명령 추가하기. 의도적으로 프롬프트를 모호하게 유지했고, 두 모델에게 동일한 프롬프트를 제공했습니다.
단계별 비교:
| Opus 5.5 (medium) PR#88 | Flash-Next (xhigh) PR#89 |
|---|---|
| 첫 번째 반복 ~9분 | ~38분 |
| TUI 재시작 코드를 재사용하도록 유도 ~6분 | ~34분 |
| 세 번째 중복 경로를 스스로 발견 ~30분, 추가 프롬프트 후 생성 PR ~3분 | ~30분 |
| 총계 ~18분 | ~130분 |
| 토큰 (입력/출력) 7.83M / 41.5K | 20.61M / 101K |
| 테스트 추가 1 | 4 (그중 2개는 end to end) |
| 비용 $7.53 | $0 + ~0.15 kWh |
최종 결과는 흥미로웠습니다. GPT 5.6, Opus 5.5, 그리고 Flash-Next에게 두 PR을 검토하고 비교하도록 요청했습니다(새 세션). GPT와 Flash-Next는 Flash-Next의 PR(#89)을 선택했고, Opus는 자신들의 PR(#88)을 선택했습니다. 저 역시 직접 검토해보고 더 나은 테스트를 가지고 있고 엣지 케이스를 더 잘 처리하는 Flash-Next가 더 낫다고 판단했습니다. 결국 #89를 병합했으며, 리뷰에서 가져온 #88의 수정 사항들을 포팅했습니다.
명심하세요: Opus는 medium 노력으로 진행되었습니다. xhigh로 했다면 훨씬 많은 토큰을 사용했을 것이고, 시간이 조금 더 걸렸으며, 아마도 더 나은 구현을 했을 것입니다. Flash-Next는 이전 Halogen 버전(0.14.0)에서 실행되었고, Halogen이 연결을 한 번 끊었기 때문에 마지막 부분은 Gufo로 실행되었습니다. 현재 Halogen은 제 노트북에서 70W로 약 1,400 t/s의 prefill과 46 t/s의 decode를 수행하므로, 테스트를 다시 한다면 시간이 많이 줄어들 것이라고 생각합니다.
7.53달러는 Claude Code가 PR에 대한 나중 수정까지 포함한 전체 Opus 세션에서 보고한 수치입니다. 0.15 kWh는 전체 130분 동안 70W를 가정합니다. Opus는 여전히 2배에서 10배 더 빠르며, 저는 계획 및 검토 작업에 여전히 사용하고 있습니다. 하지만 실제 코딩은 이제 제 노트북에서 이루어지며, 저에게는 이처럼 최첨단 모델(frontier model)과 경쟁할 수 있는 로컬 모델을 구동할 수 있다는 것이 놀랍습니다. 제 설정, 엔진 벤치마크 및 두 번째 작업 비교가 담긴 전체 게시물: https://deepu.tech/local-ai-qwen3.8-flash-next-best-local-llm /u/deepu105 제출 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기