Step 5 Preview: 파레토 경계 확장
요약
StepFun이 소프트웨어 엔지니어링과 전문 지식 업무에 초점을 맞춘 플래그십 모델 Step 5 Preview를 공개했습니다. 이 모델은 희소 MoE 구조로 6,000억 개의 파라미터를 가지며, 낮은 작업 비용으로 높은 성능을 달성하여 '파레토 경계' 확장에 기여합니다. 100만 토큰 컨텍스트와 이미지 입력을 지원하며, 복잡한 코딩 및 시각적 제작 작업에서 뛰어난 능력을 보였습니다.
핵심 포인트
- 소프트웨어 엔지니어링에 특화된 플래그십 모델 Step 5 Preview 공개
- 희소 MoE 구조(6,000억 파라미터)로 비용 대비 성능 최적화 달성
- 100만 토큰 컨텍스트와 이미지 입력을 지원하여 활용 범위 확장
- StepCodeBench에서 코딩 작업 능력을 검증하며 높은 전문성을 입증
StepFun이 에이전트 작업용 플래그십 모델 Step 5 Preview 를 공개함. 소프트웨어 엔지니어링과 전문 지식 업무, 특히 금융에 초점을 맞췄으며, 비슷한 지능 수준의 모델보다 작업 비용이 상당히 낮다고 밝힘
희소 MoE 구조로 전체 파라미터 6,000억 개 중 토큰당 270억 개를 활성화하며, 100만 토큰 컨텍스트 와 이미지 입력을 지원함
자체 소프트웨어 엔지니어링 평가 StepCodeBench에서 49.0% 를 기록함. 낮거나 중간 난도의 작업에서는 Claude Opus 5에 근접하지만, 가장 어려운 장시간 작업에서는 최상위 모델과 유의미한 격차가 남아 있음
24시간 자율 최적화 실험 에서 GPU 커널 성능을 508 TFLOPS까지 높였고, 별도 후속 학습 실험에서는 Qwen3-30B-A3B의 AIME24 정확도를 53.3%에서 60%로 개선함
제품과 API에서 바로 이용할 수 있으며, 10월 15일 모델 가중치를 공개할 예정 임
모델 구조와 비용 대비 성능
Step 5 Preview 는 소프트웨어 엔지니어링, 에이전트 작업, 전문 지식 업무, 금융을 대상으로 하는 플래그십 모델임
희소 전문가 혼합(Mixture-of-Experts) 구조로 전체 파라미터는 6,000억 개 , 토큰당 활성 파라미터는 270억 개 임
100만 토큰 컨텍스트 창과 이미지 입력을 지원함
지능과 비용 사이의 최적 절충점을 나타내는 파레토 경계 를 확장하는 데 초점을 맞춤
Artificial Analysis Intelligence Index 점수는 44 임
StepFun은 비슷한 지능 수준의 모델보다 작업 비용이 상당히 낮다고 평가함
소프트웨어 개발과 시각적 제작
내부 및 외부 전문가 평가에서 참가자의 약 70% 가 Step 5 Preview로 상당한 복잡도의 코딩 작업을 자율적으로 해결할 수 있다고 판단함
프런트엔드 개발과 시각적 제작 을 함께 수행함
웹 인터페이스와 데이터 시각화를 만들고, Blender로 3D 자산을 제작하며 반복 수정함
만든 자산을 Three.js 기반 대화형 웹 앱과 게임에 통합할 수 있음
Room Planner 사례에서는 침실 사진을 편집 가능한 3D 공간으로 변환함
배치 피드백을 받으며 가구를 이동하거나 회전할 수 있음
완성된 공간을 1인칭 시점으로 둘러볼 수 있음
개발 문서와 사용자 승인이 주어지면 프로그래밍 가능한 하드웨어 에서도 직접 작업할 수 있음
카메라, COM 포트, 스크린샷, 모의 마우스 입력을 개발과 디버깅에 활용함
StepCodeBench의 범위와 한계
StepCodeBench 는 산업 수요, 변화하는 사용자 요구, 전문가 작업 흐름의 실행 기록을 바탕으로 실제 소프트웨어 엔지니어링을 평가하도록 설계한 자체 벤치마크임
독립 저장소 553개 , 작업 유형 9개, 응용 분야 20개, 프로그래밍 언어 33개를 포함함
9개 작업 유형 을 평가함
기능 수정, 버그 수정, 리팩터링, 문서화, 성능 튜닝, 코드 생성, CI/CD 운영, 코드 변환, 환경 설정을 포함함
20개 응용 분야 를 포괄함
웹 개발, 모바일 앱, 클라우드 인프라, DevOps 및 CI/CD, 데이터베이스, 분산 시스템, 데이터 엔지니어링, 머신러닝, AI 앱, 사이버 보안을 포함함
네트워킹, 운영체제, 컴파일러 및 도구, 개발자 도구, 과학 계산, 금융 기술, 전자상거래, 멀티미디어, 게임 개발, 임베디드 및 IoT도 포함함
33개 언어 를 대상으로 함
Python, C++, Go, Java, JavaScript, TypeScript, Rust, C, C#, Bash / Shell, Kotlin을 포함함
Swift, Dart, Objective-C, HTML, Fortran, PHP, Ruby, SQL, R, Julia, MATLAB도 평가 대상임
Scala, Groovy, Clojure, Haskell, Erlang, Elixir, Lua, Perl, Solidity, Zig, Assembly까지 포괄함
avg@4 점수는 49.0% 이며, 버그 수정, 기능 수정, 리팩터링에서 특히 강함
비교 점수는 GLM-5.3 40.2%, Kimi K3 43.9%, GPT-6 Astra 61.0%, Claude Opus 5 63.9%임
주요 언어 전반에서 대체로 일관된 성능을 보이고, 낮거나 중간 난도에서는 Claude Opus 5에 근접함
가장 어려운 장시간 작업 에서는 최상위 모델과 유의미한 격차가 남아 있음
장시간 실행과 피드백 기반 개선
MLA GPU 커널 최적화 실험에서는 NVIDIA H100에서 처음부터 커널을 구현하고 개선하도록 24시간을 부여함
헤드 차원 512, 배치 크기 1, 헤드 64개, 토큰 8,192개 조건으로 실행함
변경 사항을 구현하고 처리량을 측정한 뒤, 실행에 성공해도 성능이 낮아진 후보는 버리고 기존 최고 버전에서 작업을 이어감
모델별 독립 시도 4회 중 최고 결과를 보고했으며, 각 시도에서 조기 종료 또는 최적화 지속 여부를 모델이 결정함
약 22시간 후 순전파와 역전파에서 최고 508 TFLOPS 에 도달했으며, Claude Opus 5는 493 TFLOPS를 기록함
후속 학습 데이터 개선 실험에서는 Qwen3-30B-A3B 기반 모델의 AIME24 성능을 개선하도록 24시간을 부여함
프로덕션 데이터에 접근할 수 있는 API 어노테이터를 어떻게 사용할지, 학습 데이터를 어떻게 수정할지 모델이 결정하고 후속 성능을 추적함
공식 AIME24 테스트 정확도가 53.3%에서 60% 로 상승함
Claude Opus 5와 같은 결과를 더 적은 어노테이터 토큰으로 달성함
Pokémon Red 에서는 코딩을 벗어난 장시간 목표 유지, 이전 발견 기억, 자원 관리, 실패 복구 능력을 시험함
게임 전용 최적화 없이 3,000턴 이상, 상호작용 토큰 600만 개에 걸쳐 진행을 이어감
3,082턴까지 Cut을 해금하고 체육관 배지 3개를 얻었으며 Lt. Surge를 물리침
메인 스토리의 약 3분의 1을 진행한 상태로, 전체 완료에는 사람 기준 약 26시간이 걸림
대화형 재생 화면에서 게임 진행, 주요 목표 달성, 누적 토큰 사용량을 함께 확인할 수 있음
전문 지식 업무의 산출물
전문 지식 업무 에서는 근거 수집과 대조, 분야별 분석, 요구 형식에 맞춘 최종 산출물 제작까지 수행함
기술 엔지니어링, 창작, 분석 보고서, 대외 커뮤니케이션에 맞춰 내용과 표현 형식을 조정함
대규모 기후 연구 사례에서는 1,000개 지역의 25년치 자료를 처리함
단일 에이전트 동작에서 웹 가져오기 950건을 조율하고, 변수 11개에 걸친 월별 기록 30만 건을 모음
지역별 태양 계절성을 분석해 유럽과 오세아니아 표본의 정점 월이 연중 서로 반대 시기에 나타남을 확인함
경유 할증료 검토 에서는 시트 17개로 구성된 분석 워크북을 제작함
원본 데이터, 서로 다른 시계열의 대조, 지역별 패널, 수식, 추세 모델을 포함함
기초 데이터와 분석 결과의 연결을 유지하며, 계약 및 조달 검토에 필요한 데이터 범위, 중복, 지역별 가격 움직임을 담음
별도 연구 작업에서는 대화형 보고서 를 제작함
서술형 분석, 시각화, 데이터 표, 방법론, 보충 자료를 결합함
독자가 주요 결과에서 근거로 이동하고 방법론과 세부 자료를 확인할 수 있음
금융 분석과 검증 가능성
금융 분석에서는 출처 추적성과 재현 가능성 을 중시함
변화하거나 충돌하는 정보를 다루면서 사업, 경제 환경, 미래 성과의 위험을 이해하고 회계 및 가치평가 방법을 신중하게 적용해야 함
신뢰할 수 있는 출처를 찾고 보고 기간과 정의의 차이를 조정하며, 가정과 계산이 일관된 예측을 만들어야 함
검토자는 결론을 출처까지 추적하고, 보고된 사실과 가정을 구분하며, 계산을 재현할 수 있어야 함
근거의 공백과 핵심 가정에 대한 민감도도 명확해야 함
자체 FinStepBench 는 세 가지 금융 작업 흐름을 평가함
LiveSearch : 정보 요구가 바뀌는 상황에서 시의성 있고 신뢰할 수 있는 금융 정보를 검색하고 검증하는 능력을 평가함
CorporateValuation : 금융 데이터와 타당한 가정으로 일관된 예측 및 재현 가능한 가치평가를 만드는 능력을 평가함
DeepResearch : 근거 수집과 분석부터 포괄적이고 충분한 근거를 갖춘 보고서 작성까지 전 과정을 평가함
전체 평가에서 정확성, 분석의 엄밀성, 감사 가능성을 확인함
외부 벤치마크 FrontierFinance 는 투자 활용 사례 6개를 전문가 작성 질문 220개와 평가 기준 11,543개로 평가함
세부 채점 기준을 통해 복잡한 금융 응답을 보완적으로 검증함
금융 벤치마크 결과 는 항목별로 차이가 있음
FrontierFinance는 66.4% 로 GLM-5.3 64.1%, DeepSeek V4.1 Flash 63.0%, Kimi K3 62.6%, GPT-6 Astra 55.0%보다 높고 Claude Opus 5 69.7%보다 낮음
LiveSearch는 74.5% 로 GPT-6 Astra와 같으며, DeepSeek V4.1 Flash 76.7%, Claude Opus 5 76.2%보다 낮음
CorporateValuation은 60.6% 로 Kimi K3와 같으며, GPT-6 Astra 77.3%, Claude Opus 5 69.7%와 격차가 있음
DeepResearch는 55.8% 로 GLM-5.3 53.3%, DeepSeek V4.1 Flash 50.2%, Kimi K3 48.9%, GPT-6 Astra 45.0%보다 높고 Claude Opus 5 59.1%보다 낮음
종합 벤치마크와 비교 조건
종합 평가는 추론 및 지식, 코딩, 일반 에이전트, 금융, 컴퓨터 사용, 멀티모달 및 문서를 포함함
Step 5 Preview는 High 설정 이며, 주요 비교 모델인 GLM-5.3, Kimi K3, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5는 Max 설정 임
추론 및 지식 점수는 GPQA Diamond 93.5%, HLE 46.5%, AA-LCR v1.1 88.3%, CritPt 20.9%임
GPQA Diamond에서는 Kimi K3와 같고, AA-LCR v1.1에서는 GPT-6 Astra 80.7%와 Claude Opus 5 79.3%보다 높음
HLE에서는 GPT-6 Astra 54.7%, Claude Opus 5 54.9%, Claude Fable 5.1 59.1%보다 낮음
코딩 에서는 DeepSWE v1.1 67.7%, ProgramBench 통과율 80.5%를 기록함
Terminal-Bench v2.1은 85.0%지만, Terminal-Bench v4는 33.3%로 GLM-5.3 41.9%, GPT-6 Astra 57.9%, Claude Opus 5 52.3%보다 낮음
CyberGym, SciCode, RoadmapBench, SWE-Marathon v1.1, MLS-Bench-Lite, SWE-Atlas의 질의응답 및 테스트 작성, 자체 StepCode-Bench-Daily와 StepCode-Bench-General도 평가함
일반 에이전트 및 전문 업무 에서는 GDPval-AA v2 1571점, DRACO 83.3%, BrowseComp 88.7%를 기록함
GDPval-AA v2는 GLM-5.3 1634점과 Claude Opus 5 1735점보다 낮고, Kimi K3 1548점보다 높음
DRACO는 GPT-6 Astra 76.8%보다 높고, Claude Opus 5 87.6%보다 낮음
τ³-Banking, AutomationBench-AA, AutomationBench 공개 버전, AA-Briefcase, Toolathlon-Verified, MCP-Atlas, PresentBench, OfficeQA Pro, SpeadSheet v2, JobBench, Apex-Agents도 평가함
컴퓨터 사용 및 멀티모달 에서는 Agents' Last Exam의 ALE-CLI 29.5%, MMMU-Pro 76.0%, GDP.pdf 14.8%를 기록함
ALE-CLI는 Claude Opus 5 28.6%보다 높고 GPT-6 Astra 33.3%보다 낮음
MMMU-Pro와 GDP.pdf에서는 비교표에 점수가 있는 다른 주요 멀티모달 모델보다 낮음
평가 조건에 따른 비교 제한 이 있음
GDPval-AA v2는 2026년 9월 19일 기준 Artificial Analysis 최신 결과를 사용함
DeepSWE v1.1은 SWE-agent 하네스에서 temperature=1.0
, top_p=0.95
로 평가함
StepCodeBench 계열과 FinStepBench 계열은 자체 개발 벤치마크임
HLE 도구 사용 평가에서 Step 5 Preview와 GLM-5.3은 텍스트 전용 부분집합 , 다른 모델은 전체 데이터셋을 사용했으므로 결과를 직접 비교할 수 없음
이용 가능 시점과 가중치 공개
Step 5 Preview 는 제품과 API를 통해 이용할 수 있음
10월 15일 가중치 공개 를 예정하고 있음
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기