StepFun의 100만 토큰 컨텍스트 MoE 모델 Step 5 Preview, OpenRouter에 등장
요약
StepFun의 새로운 MoE 모델 Step 5 Preview가 OpenRouter에 등장했습니다. 이 모델은 로컬 환경에서 구동 가능한 최신 LLM 중 하나로 주목받고 있으며, 특히 '범용 지능'과 도구 호출 관리 능력에 초점을 맞추고 있습니다. 사용자들은 이 모델이 이전 버전 대비 성능 향상 및 속도 개선을 보여줄지 기대하고 있습니다.
핵심 포인트
- Step 5는 MoE 구조를 가진 새로운 로컬 LLM입니다.
- 범용 지능, 특히 도구 호출 관리 능력에 강점을 보였습니다.
- 사용자들은 종합 벤치마크보다 용도별 평가를 중요하게 생각합니다.
- OpenRouter 등 플랫폼을 통해 성능과 속도를 직접 비교할 수 있습니다.
Step 모델은 내 기준으로 128GB 공유 메모리에서 실행할 수 있는 로컬 모델 중 처음으로 제대로 쓸 만했음. Qwen Flash Next와 비교하면 어떨지 무척 기대됨.
수정: 600B-A27B인 줄 몰랐는데 아쉬움. 228GB에서도 실행할 수 없겠음.
Artificial Analysis에 따르면, 내가 ‘저렴하면서 충분히 똑똑한’ 기준으로 삼던 Gemini 3.8 Flash보다 똑똑하고 조금 더 저렴함. 다만 직접 모델을 비교하는 수고를 피하려고 이 평가에 기대 온 면이 있어, 실제 평가는 다를 수 있음.
이번 주에 OpenCode에서 써 볼 예정이지만, Muse Spark 1.3에서 갈아탈 만큼 마음에 들지는 모르겠음.
올해 초에는 Step 3.5 Flash와 Step 3.7 Flash가 단연 가장 좋아하는 로컬 모델이었음. Step 5는 내 DGX Spark급 장비에서 돌리기에는 너무 크지만, 써 보는 건 기대됨. 벤치마크도 유망해 보이고 GLM보다 훨씬 빠르기를 바람.
Step 3.5는 LLM이 일시적인 유행이 아니라는 걸 처음으로 실감하게 만든 모델인 것 같음.
새 모델 출시 소개 페이지는 벤치마크 결과를 맨 앞에 넣도록 의무화해야 함. 그래야 시간을 들여 살펴볼 가치가 있는지 알 수 있지 않겠음?
이게 왜 흥미로운 건지?
Stepfun 3.5는 당시 최고 수준에 가까운 모델이었음. 금방 추월당하긴 했지만, 새 모델이 나올 때 관심을 가질 만큼은 실력을 보여 줌.
게다가 개방형 모델임. Opus와 Sol만 쓰더라도 이런 모델들이 경쟁을 자극하고 최첨단 성능의 한계를 끌어올리는 데 도움이 됨.
3.5/3.7 시절에는 지식보다 도구 호출 관리, 하위 에이전트 조율 같은 ‘범용 지능’에 집중한 작고 빠른 모델이 있었음. 개인 비서를 구동하는 기반으로 아주 적합할 수 있어, 그때부터 얼마나 발전했는지 직접 확인해 보고 싶음. 어떤 접근이 맞는지는 시간이 지나야 알 수 있을 것임.
[1] https://news.ycombinator.com/item?id=47069179.
일단 지금은 무료라는 장점이 있고, 그 밖에는 잘 모르겠음.
이게 Space Bunny Alpha 모델이었는지 궁금함.
간단히 테스트해 보니 아닌 것 같음. Space Bunny Alpha가 Minimax 계열 모델이라는 단서도 있었음.
ZenMux에 최소 2주 전부터 올라와 있었으니, 정체를 숨기고 있던 것 같지는 않음.
새 모델을 써 보는 건 좋지만, 새로운 아키텍처처럼 정말 새로운 것이 나왔으면 함. LLM은 결과물이 너무 엉성함. 이보다 더 잘할 수 있을 것임.
말은 쉽지만, 먼저 트랜스포머를 실제로 뛰어넘어야 함. 지금까지 나온 대안 아키텍처는 잘해야 성능상 일장일단이 있는 대체재에 그침.
Artificial Analysis는 측정 대상에 대해 상당히 특정한 편향이나 관점을 갖고 있으므로, 그 벤치마크를 모델 품질의 최종 판정으로 받아들이지는 않겠음. 종합 지수보다 용도별 평가가 필요함. 종합 지수는 수많은 용도에 적용할 범용 역량을 만들려는 모델 회사나, 용도에 맞는 모델을 꼼꼼히 고르기 귀찮아하는 초보 사용자에게나 유용함. 잘 이해하고 의도적으로 선택하려는 숙련 사용자라면 구체적인 평가를 봐야 함. 세금 신고와 잔디 깎기를 같은 사람에게 맡기지 않는데, LLM이라고 다를 이유가 있는지? ‘AGI’에 관한 통념으로 접근할 때나 이런 종합 벤치마크를 만들게 됨.
다른 답글에서도 적었듯, Stepfun은 3.5/3.7 시절 지식보다 도구 호출 관리와 하위 에이전트 조율 같은 ‘범용 지능’에 집중한 작고 빠른 모델을 만들었음. 개인 비서의 기반으로 아주 적합할 수 있어, 이후 얼마나 발전했는지 시험해 보고 싶음. 적절한 접근법은 시간이 지나야 알 수 있을 것임.
[1] https://news.ycombinator.com/item?id=47069179.
속도는 빠름. OpenRouter 기준 평균 초당 115토큰임. 직접 테스트하지는 않았지만, 추론이 더 빠르다면 돈을 조금 더 낼 의향은 있음.
수정: 다만 평균 지연 시간 1.5초는 그리 짧지 않아, 에이전트 작업에서는 실제로 그렇게 빠르지 않을 수도 있음. 추론에 얼마나 많은 토큰을 쓰는지도 모르겠는데, 대체로 중국 모델에서는 그 부분이 단점이었음.
저 차트는 Sonet 5.5가 Qwen3.8-Flash-Next보다 낫다고 하는데, 직접 써 보니 반대였음.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기