9月22日至23日,阿里巴巴在2026云栖大会宣布千问AI平台全面升级,小米发布并开源MiMo-V2.6,Jev向申请用户发放1.2亿Token额度。三家公司的动作分别落在Agent服务平台、后训练强化学习和低成本判断模型上。

据量子位报道,9月22日,阿里巴巴集团战略副总裁、ATH事业群MaaS业务线总裁文征在2026云栖大会MaaS & Agent技术主论坛上宣布,千问AI平台以推动Agent进入生产作为建设核心,在模型服务基础上新增对Agent服务、行业AI解决方案的支持,并推出API优速模式、Agent Studio、千问AI座舱解决方案等能力。文征表示,AI仍处于早期阶段,关键在于将智能转化为结果;过去一年阿里云MaaS平台服务的客户数增长六倍。阿里预计到2032年,阿里云运营的算力规模将超过20GW。模型服务方面,平台通过FlashBoot、UniScheduler等能力调度异构算力,将模型弹性启动时间由1200秒缩短至70秒,可在1分钟内拉起1万个Pods,首Token延迟降低38%,Prompt Caching成本最高节省95%。API优速模式可将TPS提升1.5至2倍,Token Plan以一份订阅覆盖Qwen、Kimi、GLM、DeepSeek等多类模型,并原生打通Qoder、Cursor、Codex、OpenClaw等工具与Agent框架。

Agent Studio是千问AI平台此次发布的企业级全栈Agent服务平台,可根据任务自动路由选择模型,提供24小时不间断托管运行,并支持企业内部知识数据和外部软件服务接入。平台提供50多个原子API,覆盖运行环境、长期记忆、工具服务、会话请求和服务端点部署等能力;Agent API即将发布,Agent自进化引擎将包含运行观测、AI评测器、AI优化器和自动验证等能力。One Key MCP可用一个API Key连接100多项生态服务。应用侧,伶鹊2.0服务20个行业、5000余家企业客户和超过10万个坐席,万小智3.0从建站延展至获客和经营。泛海集团、网易游戏、荣耀、比亚迪等企业已在工业、游戏、终端和座舱场景与千问AI平台合作。

据雷峰网报道,小米在9月23日发布并开源MiMo-V2.6。Pro拥有1.02T总参数、42B激活参数,Flash为309B总参数、15B激活参数,两款模型支持1M token上下文,并覆盖文本、图像、视频和音频输入。小米将代码、通用Agent、视觉和网络安全任务放进同一套强化学习系统,单次RL更新使用1568个prompt,每个prompt生成16条rollout,一次更新对应25088条轨迹。为支撑长轨迹训练,MiMo-V2.6-Pro在70层Transformer中,让60层采用窗口为128 token的Sliding Window Attention,10层使用Global Attention;每个MoE层有384个routed expert,只调用8个;模型还加入5层MTP speculative decoder,官方模型卡给出的设计是一次前向预测后续7个token。

小米采用fully asynchronous GRPO,把rollout、环境执行、grader和模型更新拆开运行,并将多领域任务和不同Agent harness混入同一次RL,称为You Only RL Once。奖励机制方面,GRS会同时观察同一任务的多条rollout,构造task-specific rubric,将过程质量与测试结果结合;GAR继续比较完成任务的多条轨迹,把更多advantage分配给质量较高的方案;MOPD2则复用Teacher trajectory和SFT demonstration中的历史,将轨迹截取到中间状态,让学生从这里继续rollout。

据雷峰网报道,Jev向申请用户直接发放1.2亿Token额度。该报道称,Jev主要处理分类、路由、评分和概率判断,一条短文本输入可能只有几十个Token,1.2亿Token足够普通应用跑数百万次判断。雷峰网分析认为,Jev希望以极低的单次判断成本进入Agent执行链中的高频小决策位置,并通过Calibration概率校准让系统判断置信程度,从而决定直接执行、调用更强模型或设置回退机制。报道还将其与杰文斯悖论联系起来:当判断便宜到开发者较少考虑次数,过去用规则处理或因成本被放弃的节点可能被交给模型,进而放大总调用量。