Strands Decider 2B - 소형 오픈소스 의사결정 모델
요약
소형 오픈소스 의사결정 모델인 Strands Decider 2B와 관련하여, NPU 활용의 중요성과 성능 최적화 방안이 논의되었습니다. 특히 Mac mini 환경에서 MLX를 이용한 직접 실행 및 최적화를 통해 지연 시간 개선 가능성이 언급되었으며, 다양한 기술적 질문과 활용 아이디어가 공유되었습니다.
핵심 포인트
- NPU 사용 시 성능 향상(2배) 및 전력 효율성 증대 효과가 기대됨.
- Mac mini 환경에서 MLX를 이용한 직접 실행 최적화가 필요하며 개선 여지가 큼.
- Strands Decider 모델은 이진 선택(noul)을 기반으로 하며, 활용 아이디어가 다양함.
- 기술적인 오류 해결 및 GGUF 변환 과정에 대한 사용자 간의 논의가 이루어지고 있음.
여러 특화 초소형 모델을 평소 사용하는 입장에서, 이런 모델과 JEV 계열을 PC의 CPU에서 상시 백그라운드로 실행하면 만족하기 어려움. NPU로 연산을 넘겨야 함. 과정에 함정이 많지만 결과는 그만한 가치가 있음.
NPU에서는 성능이 2배, 전력 소비는 4분의 1이 되며 팬 소음도 추가로 발생하지 않음.
이런 모델들의 초기 경쟁이 정리될 때까지 한 달 더 기다린 뒤, NPU/iGPU용 구성을 만들어 Hugging Face에 올릴 계획임.
다들 이진 선택을 noul 이라고 부르는 이유가 뭔가? 의미가 있는 이름인가, 아니면 Jev의 API를 그대로 따라 하는 건가?
베르누이(Bernoulli) 에서 나온 이름임.
AI 전문가들이 하는 얘기를 이해하기가 드문데, 이 글은 사람이 사람을 위해 쓴 글이라 이해하기 쉬움. 기술적으로 여러 용도에 쓸 수 있을 텐데, 활용 아이디어가 궁금함.
점심 메뉴 고르기에 쓸 수 있지 않을까?
Cloudflare의 clef는 llama.cpp에서 실행됨. Strands CLI에 종속된다면 아쉽고 도입도 느려질 것임.
Qwen용 LoRA이므로 llama.cpp에서도 실행 가능할 것으로 보는데, PEFT/LoRA → GGUF 변환을 사용자에게 맡겨둔 점이 아쉬움. 다음 명령에서 발생하는 오류를 해결한 사람이 있을까? uv run --with transformers==5.19.0 convert_lora_to_gguf.py ~/Downloads/lora --dry-run --verbose /Users/user/repos/llama.cpp/conversion/base.py의 map_tensor_name, 630행에서 ValueError: Can not map tensor 'layers.0.linear_attn.in_proj_a.weight'가 발생함.
이 중 멀티모달을 지원하는 모델이 있나? 확률이 보정된 모델에 “이 도형들이 서로 일치하나?” 같은 질문을 해보고 싶음. 물론 LLM에도 물어볼 수는 있지만 말임.
내 M3 Mac에서는 Docker 컨테이너 안에서 CPU만으로도 무난하게 동작함. strands-decider-2B-hobson-v19 모델에 입력 토큰 86개, 출력 토큰 1개인 요청을 보냈을 때 지연 시간은 1732.17ms였고, is_urgent의 noul 값은 0.8287이었음.
실행 방법은 여기에 정리해 둠. https://gist.github.com/2891eb0db9ea92c1a4e860d44f556292.
Docker 래퍼 대신 Mac mini에서 직접 실행하고 MLX에 최적화하면 개선할 여지가 큼.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기