据量子位9月21日报道,阶跃星辰前一天发布新一代旗舰基座模型 Step 5 Preview。该模型采用 MoE 架构,总参数600B,激活参数仅27B,支持1M上下文;在 Artificial Analysis 最新评测中取得44分,位列全球开源模型第二。其定价为百万输入1美元、百万输出2.7美元,单个任务成本为 Opus 5 的12.5%。
量子位称,Step 5 Preview 在 Artificial Analysis 的 Intelligence Index 与单任务成本权衡中处于“帕累托前沿”。和其他拿到44分的大模型相比,后者大多为万亿参数级别,阶跃这一模型在成本上更具竞争力。
技术层面,阶跃团队采用名为 Narrow but Deep 的网络设计,使用92层 Transformer,在控制激活规模的同时让信息经过更多层连续变换,以适应 Agent 任务中的多跳依赖。为解决长上下文带来的计算量问题,模型使用 Sparse MoE、Hybrid Sparse、Sparse GQA 等稀疏化方案,并在底层算子和数据访问上做优化,使理论稀疏尽量转化为实际吞吐。训练围绕 Agent 展开,模型的基本单位从“回答”变为“Loop”,通过 Long-horizon RL、Context Compaction 等方法,使其在几十轮工具调用后仍记得目标。
量子位作者用 API 进行了多项实测。模型操作 Blender 构建“后室”场景,自行折腾一个多小时后输出渲染 MP4,并加入 VHS 录像质感、镜头噪点、昏黄灯光和人物脚步声。第二个任务中,模型参照1999年《LEGO Racers》制作乐高赛车游戏,包含赛道、赛车、人机车手、实时排名和发动机音效,但赛道修得较窄。作者还让它完成《花屋》建模、霓虹跑酷小游戏和写作网站;其中跑酷游戏在道路两旁加入高楼,Game Over 后边框变红,补充了 Prompt 未写的细节。写作网站被认为审美可用、覆盖面较全,但有时出现模块溢出等小 Bug。作者称,多个 Demo 第一轮常有细节不到位,指出两三轮问题后模型可修到可用状态。
阶跃此前两代模型聚焦 Flash 档位。从 Step 3.5 Flash 到 Step 3.7 Flash,再到 Step 5 Preview,量子位称其路线是尽可能让 Frontier 级能力用得起。大模型竞争也在变化。Stanford 2026 AI Index 显示,截至2026年3月,Anthropic、xAI、Google和OpenAI四家公司最顶尖模型在 Arena 上的差距已压缩到25个 Elo 以内。K3 专攻前端开发,V4 Flash 打性价比,Astra 则将 Computer use 心智站住。Step 5 Preview 的选择是向上发布旗舰基座,向下优化效率和成本。
在阶跃发布新模型的同时,少数派 Matrix 作者在一篇文章中提出,AI Agent 的发展可与“中等收入陷阱”类比。文章称,AI 已成为工作流基础设施,Agent 拓展能力边界的同时,同等智能模型价格下降;随着 WorkBuddy 等办公类 Agent 普及,信息差逐渐消失,会用 AI 不再是稀缺能力。作者将“会用 AI”分为工具绑定型技巧和认知与判断型能力,认为前者依赖工具不成熟和信息差,会持续贬值,后者在 Agent 越强时越可能被放大。
该文作者提出,值得积累的是不随模型降价而贬值的资本。外部资本包括真正理解并使用产品的核心用户、粉丝数较高的社媒账号、可持续迭代的工作流;内在资本包括对世界产生真实影响的判断力和服务于人的品味。文章以 Apple 发布 iPhone Duo 后的折叠屏幕过渡效果被开发者移植到 MacBook 为例,称社区能快速做出视觉相近的产品,但“做出来”不等于“有人用”,Apple 的用户、系统、分发渠道和品牌认知难以被 AI 抹平。作者建议在询问 Agent 前先给出自己的判断,刻意寻找能否定已有判断的证据,并把“我错了”变成“我为什么会错”;品味培养则需长期接触和比较不同对象,同时实际创作。