
계속해서 Qwen으로 돌아오게 되네요... 120B 미만 모델 중 정말 더 나은 것이 없을까요?
요약
120B 미만 규모의 모델 중 Qwen 시리즈 외에 대안을 찾는 과정에서 InternScience의 Agents-A1 MoE 모델을 발견했습니다. 이 모델은 35B 규모로 소비자용 하드웨어에서 매우 빠른 속도와 우수한 품질을 보여줍니다.
핵심 포인트
- Qwen 27B 및 Coder 모델이 120B 미만에서 강력한 성능을 보임
- InternScience의 Agents-A1 35B MoE 모델이 새로운 대안으로 부상
- 35B MoE 모델은 소비자용 GPU에서 매우 빠른 추론 속도 제공
- 연구 및 장기적 작업(long horizon)에 적합한 특성을 가짐
저는 강력한 코딩 모델과 강력한 범용 모델을 찾고 있었으며, 둘 다 120B 이하의 규모여야 했습니다. 몇 주간의 조사 끝에, qwen3.6 27b(범용)와 qwen3 coder next(코딩)가 최고의 선택지였습니다. 제 말은, 분명 더 나은 무언가가 있을 것이라는 뜻입니다. 추천할 만한 것이 있을까요?
업데이트 1: 와, 정말 흥미롭네요. 방금 Agent A1 벤치마크를 확인했습니다. 이것은 InternScience에서 만든 35B-A3B Mixture-of-Experts (MoE) 모델로, 2026년 6월 26일에 출시되었습니다. 그들은 4b 변형 모델도 출시했지만 그렇게 매력적이지는 않습니다. 저는 35b 변형 모델을 테스트해 보았는데, 소비자용 하드웨어에서 엄청나게 빨랐고 품질도 좋았습니다. 다만 한 가지 주의할 점이 있습니다. 필요 이상으로 조금 더 생각하는 경향이 있지만, 연구용이나 장기적 관점 (long horizon)의 작업에는 완벽합니다. 이 모델은 34일 전에 출시되었으므로 어느 정도 안정적일 것입니다. 더 테스트해 보겠지만, 관심이 있다면 확인해 보세요:
35b MoE : https://huggingface.co/InternScience/Agents-A1
4b Dense : https://huggingface.co/InternScience/Agents-A1-4B
성능:
GPU: Rtx 5070 ti OC
CPU: I9-14900k(tuned)
RAM: Corsair vengeance 64gb 5200mt ddr5
Backend: Llama.cpp server
Repository(제 경우): SC117/Agents-A1-Uncensored-MTP-APEX-GGUF
Quantization: APEX Compact
TPS: 약 ~ 97 tps 평균
[IMG:1] submitted by /u/Possible_Grocery8079 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기