据MarkTechPost 9月21日报道,StepFun发布面向智能体工作的旗舰模型Step 5 Preview,该模型采用约6000亿总参数、每token约270亿激活参数的稀疏混合专家架构,支持100万token上下文,并已通过托管API和StepFun平台提供。StepFun称其目标场景是软件工程、专业知识工作和金融,主要卖点是任务成本,即接近同级智能水平下显著降低单任务成本。
StepFun表示,该模型目前以托管API和平台形式提供,自托管需等待开放权重;开放权重计划于2026年10月15日发布。按BF16计算,6000亿参数在KV缓存前约需1.2TB存储,需准备多GPU服务器。官方文档列出的规格包括模型ID step-5-preview、100万token上下文,输入支持文本、图像和视频,输出为文本,推理强度分低、中、高三档,并支持流式输出、工具调用、JSON Mode、JSON Schema和提示缓存。
StepFun称,该模型在研究任务中于单次智能体行动中协调了950次网页抓取,并通过Step Plan提供Claude Code集成。据Pandaily报道,模型未加宽网络,而是堆叠92层Transformer,采用窄而深布局。研究团队认为,更深堆叠为隐式多跳推理提供更长路径,在长预填充阶段尤为重要。训练采用在策略、长时程强化学习,StepFun还提到MoE路由的逐位训练与推理对齐、MTP-3推测解码、FP8 MoE和KV缓存卸载,并报告长时程强化学习端到端加速超过3倍。
基准测试中,Step 5 Preview以High推理强度运行,竞争对手为Max强度。据RuntimeWire,StepFun报告FrontierFinance为66.4,Claude Opus 5为69.7,GPT-6 Astra为55;DRACO为83.3,Claude Opus 5为87.6,GPT-6 Astra为76.8。编码任务中,DeepSWE v1.1为67.7,StepCodeBench为49.0,ProgramBench为80.5,StepFun称GPT-6 Astra和Claude Opus 5在三项上均领先,StepCodeBench是StepFun自有基准。两项各24小时的智能体实验中,模型将H100内核调优至508 TFLOPS,Claude Opus 5为493 TFLOPS;并通过自动化后训练把Qwen3-30B-A3B在AIME24上的成绩从53.3%提升至60%。
独立评估机构Artificial Analysis给Step 5 Preview的智能指数评分为44,同类价格区间推理模型中位数为24;在StepFun API上测得输出速度为每秒99.8个token。StepFun API每100万token输入缓存未命中收费1.00美元,缓存命中0.05美元,输出含推理2.70美元。Artificial Analysis给出的同类模型中位数是输入1.88美元、输出10.00美元。但该模型在指数运行中生成1.6亿输出token,中位数为9200万,冗长推理抵消了一部分按token计价的节省。