据量子位9月17日报道,云知声正式发布U2-Flash,作为国产递归自我改进(RSI)模型的早期答卷。该模型在后训练闭环中已参与生成训练数据、分析执行轨迹以及巡检和修复训练系统。
云知声称,U2-Flash采用稀疏MoE架构,总参数约266B,单次推理只激活约10B,不到总参数的4%。其生成速度相比U2提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗降低20%至30%。能力上,U2-Flash没有按Flash常见的“旗舰平替”路线打折,反而反超上一代U2:DeepSWE v1.1从32分升至64.6分,TerminalBench 3.0从2.7分升至24.3分,SWE-Bench Pro拿下61.6分,较前代提升10.5分。
云知声MaaS平台已将U2-Flash放在首页,支持在线体验和申请API调用。该API兼容OpenAI和Anthropic两套主流协议,Claude Code、Trae、Cursor、Cline等工具已有官方接入方式,其他支持自定义模型的Harness可通过更换Base URL、API Key和模型ID接入。U2-Flash提供none、low、high和max四档思考强度。价格方面,其当前限时六折,输入为0.6元/百万Tokens,输出为1.2元/百万Tokens,缓存命中为0.12元/百万Tokens;9月15日至9月30日,用户可免费领取1亿Tokens使用额度。
量子位的实测覆盖三类任务。在虚构的ExpenseFlow报销统计项目中,U2-Flash在没有获得线索的情况下,用7分6秒找出被驳回报销混入总额、UTC时间转换导致日期回退、CSV导出串月等问题,并交付验收报告。在ProfileSync 2.0项目中,面对错误README、过期文档和历史日志的干扰,它用3分32秒锁定真正故障并完成修复,将测试从1项补到7项并全部通过。在512K上下文测试中,它读取14份、四种格式的产品发布材料,用8分36秒交付DOCX,包含1200至1500字发布稿、核心事实来源表、材料冲突清单和五个发布前待确认问题;稿件没有沿用旧Brief的10月8日,而采用最新版10月18日,也没有误用旧版81.2%成绩,而更新为78.4%并注明属于内部测试。
云知声将U2-Flash的能力提升归因于数据与后训练闭环。数据方面,云知声称其深耕行业十余年,积累了真实场景数据与高质量标注能力。闭环方面,自主任务生成会根据当前能力动态生成新任务,挑选“现在做不好但接近突破”的问题,目前已自主构建近10万道高质量SWE任务,覆盖多种主流编程语言;异步Agent RL把任务拆给多个Worker,在不同沙盒同时执行,并对关键Action做标记,将最终成败追溯到决定结果的步骤,单位时间内产出的有效训练轨迹数量提升约60%;多教师在线策略蒸馏分别训练数学、代码、Agent等专项教师模型,再由教师逐Token为学生模型打分,使达到同等能力所需训练步数减少约55%。该闭环还延伸到训练系统本身,U2-Flash可参与机器巡检、故障定位、修复和任务重启,官方数据显示训练故障平均恢复时间缩短至人工介入模式的三分之一左右。
RSI概念并非新词。1965年,统计学家I.J. Good设想过一台足够聪明的机器设计出更聪明的机器,后者继续设计下一代;1993年,Vernor Vinge将这类想象推向“技术奇点”。Anthropic认为AI只有能自主设计并开发出比自己更强的后继系统,才算完整递归自我改进;OpenAI则把模型加速AI研究、推动自身能力提升纳入“AI Self-Improvement”,但Critical级别要求模型完成全自动AI研发,或持续把一代模型的升级周期压缩到原来的五分之一。国内近期也出现一篇综述《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》,来自上海交大、清华、上海AI Lab等机构的研究者按模型接管自我改进闭环的程度划分等级。