9月20日,阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,重点面向 AI 编程、软件工程、专业知识工作、金融等场景。据雷峰网和爱范儿报道,该模型在 Artificial Analysis Intelligence Index 中进入全球开源模型前三,并计划于10月15日正式开源。

据雷峰网报道,Step 5 Preview 采用稀疏 MoE 架构,总参数量 600B、激活参数 27B,支持 100 万 Token 上下文窗口,原生支持文本与视觉输入。该报道称,其单任务成本仅为 Claude Opus 5 的 1/8,阶跃将其定位为可持续处理复杂任务的主力工作模型,目标是在能力、成本、效率与场景覆盖之间寻求平衡。爱范儿报道称,Step 5 Preview 在 AA 综合智能指数中取得 44 分,进入模型智能水平与单任务成本权衡的“帕累托前沿”。

雷峰网称,在公开和内部评估中,Step 5 Preview 在复杂软件工程任务包括长期规划任务,以及专业知识工作和金融领域基准测试中均表现出色。阶跃认为,下一阶段模型 Scaling 的关键是提升计算转化为智能的效率,从 Step 3.5 Flash、Step 3.7 Flash 到 Step 5 Preview,连续三代基座模型延续了这一探索。

据爱范儿报道,其 APPSO 通过 WorkBuddy 接入 Step 5 Preview 进行测试,覆盖编程、设计、3D 生成、深度调研和数据分析。在 Three.js 五子棋中,模型生成的小游戏包含人机对弈;在威尼斯快艇、卡帕多奇亚热气球和尼亚加拉瀑布场景中,模型需要同时处理玩法、动态水体、水雾、彩虹、镜头运动和多变量交互。网页操作系统任务中,其页面在界面完整度、功能衔接和细节还原上较此前测试的 DeepSeek V4 Pro 和 DeepSeek V4.1 Flash 更进一步;网页设计与 3D 资产测试中,模型完成太空行星、夜间跑车、狮身人面像以及照片建模等任务。

金融和深度调研方面,爱范儿称,阶跃围绕公司研究构建三项内部评测,并引入包含 220 道专家问题、11543 项评估标准的 FrontierFinance。官方结果显示,Step 5 Preview 在四项金融基准中表现均接近 Claude Opus 5。APPSO 实测中,该模型完成小折叠手机立项报告、广州佛山七日游和销售明细表分析等任务,需要遵守预算、体力、素食限制,清洗数据并追踪负利润率订单。该报道认为,这些案例显示模型能够理解复杂需求、规划执行步骤、调用工具并持续遵守约束。

爱范儿还报道,阶跃过去一个季度推出 Step Edge 端侧模型和 StepAudio 3 系列语音模型。Step Edge 通过文本与视觉基础模型结合语音、GUI 和生成能力,支持简单任务端侧完成、复杂任务云端处理,并在评测汇总中取得 29 项第一。StepAudio 3 Realtime 在 Artificial Analysis 对话动态和语音推理测试中分别取得 98.9% 和 99.7%,StepAudio 3 ASR 以 1.7% 词错误率并列非流式语音识别全球第一。

终端和汽车布局方面,据爱范儿报道,阶跃模型手机装机量已超过 4200 万台,日均服务近 2000 万人次,合作覆盖国内超过 50% 的头部手机品牌,应用包括识屏问答、智能搜索、内容生成和跨应用任务执行。汽车方面,阶跃与吉利、千里科技共同研发整车智能体超级 Eva,由极氪 8X 首发搭载;吉利银河 M9 接入阶跃端到端语音大模型,实现同类模型量产上车。今年 7 月,阶跃推出大模型原生 AI 终端品牌 STEPX,并即将带来大模型原生智能体手机 STEPX Neo。