据雷峰网报道,2026年9月,AI for AI 成为海外头部实验室与国内创业公司竞逐的方向。成立7个月的 Naive AI 发布开源模型 Naive-N0.5-Flash,以中训练和后训练为切入,让 AI 参与大模型架构探索、训练系统优化和推理优化。

海外方面,OpenAI 9月宣布 AI 具备“自动化研究实习生”能力,成立 RSI 团队,目标2028年3月前实现完全自动化的 AI 研究员。Anthropic 6月披露,内部80%以上可运行代码已由 Claude 独立编写,工程师产出效率提升8倍;9月曝光其核心研发平台有30000个 AI Agent 同时协作。Google 推出 AlphaEvolve 加速 Gemini 迭代,哈萨比斯卸任 Google DeepMind CEO,Jeff Dean 离职创办 Discovery Loop,后者估值达500亿美元。

国内,面壁用 AI 编写预训练框架,智谱让 AI 搭建国产芯片上的推理基础设施。智谱 GLM-5 在27T tokens 预训练后安排约1.55T tokens 中训练;GLM-5.3 沿用 GLM-5.2 基座,能力提升全部来自后训练,主要依靠强化学习,内部编程评测提升约50%。

Naive AI 不以零预训练为起点,而以开源基座为起点,把投入集中在中训练和后训练。该团队重构基座注意力架构:保留滑动窗口注意力,将全局注意力层全部替换为稀疏注意力,形成每5层 SWA 搭配1层 DSA 的混合结构,网络不再含有全局注意力。稀疏注意力中的 MLA 被替换为4个 KV 分组的 GQA,并配套16个 query 头的轻量索引器。架构改变后,模型需要完整训练而非微调。Naive-N0.5-Flash 全程保持1M上下文,累计训练3.25T tokens,分索引器预热50B、稀疏注意力训练3T、学习率衰减200B三阶段。

训练系统也被 AI 优化。据该报道,AI 让 DSA 层使用全序列并行、SWA 层只用相邻分片交换数据,降低长序列通信开销;在显存管理中细化到每个算子,并锁住关键位置以避免重算打乱;还主动发现、定位并修复位置编码精度不足、序列索引越界等底层问题。

在 Naive AI 的研发体系中,人类负责提出目标、设定约束与评价标准并作最终决策,AI 承担执行层工作。其基础设施每周能跑近千万个沙箱,最多同时跑10万个。评测显示,Naive-N0.5-Flash 在 PaperBench 中超越 Claude Opus 4.7、GPT-5.5,在 MLE-bench-30 中超越 Claude Sonnet 5、Gemini 3.6 Flash;SWE-bench Pro 得分73.6,超过2.4T参数的 Qwen 3.8 Max。该模型以15.5B激活参数取得上述成绩,权重和推理代码以 MIT 许可证发布,API 输入 Token 每百万0.6元,输出 Token 每百万2.6元,缓存命中读取每百万 Token 0.07元。

Naive AI 还用 AI 做了两个真实研发任务,人类只定 KPI。据该报道,AI 在6天、151轮实验中做出推理运行时 NaiveRT,极速模式输出吞吐量达2122 Token/s,是传统单流解码的30至50倍;另一个任务是在团队不懂的领域从零摸索世界模型,AI 做出的 AutoWM 挤入行业第一梯队。Naive AI 成立7个月估值升至14.2亿美元,创始人代季峰此前参与的可变形卷积被写入 PyTorch,并做过 BEVFormer、InternVL 等项目。