据量子位9月17日报道,清华大学计算机系教授、智谱创始人唐杰分享了智谱在递归自我改进(RSI)方向的一个早期案例:由GLM-5.3驱动的Infra Agent在超过10万张国产芯片组成的集群上,从零参与搭建并优化了一套生产级推理系统,不到两周将端到端吞吐提升至初始基线的3.2倍。唐杰同时表示,智谱尚未实现RSI。
唐杰称,这不是简单的“AI写代码”。从算子精度问题,到Python/C++跨层并发瓶颈,再到Kernel性能优化,Agent已经能够自行读取系统反馈、提出假设、修改代码、跑实验,并根据结果继续迭代。它定位出KV Transfer场景中Python GIL导致的并发阻塞,把Prefill+KV Transfer相比单独Prefill超过20%的性能损失压到1%以内;还在KDA Decode算子上通过重新组织计算获得1.71倍性能提升。由此,一个闭环开始出现:GLM优化运行GLM的系统,被优化后的系统又继续承载新的GLM。唐杰将其概括为“模型优化系统,系统承载模型”。
不过,唐杰明确表示,这距离AI完全自主设计并训练自己的继任者还很远。目标怎么定、边界怎么划、风险怎么判断,目前仍由人类工程师负责。智谱也强调,他们还没有实现RSI。唐杰在分享中称,GLM正越来越多地参与构建人工智能本身,模型完成了一项过去需要一支资深Infra团队数周才能完成的基础设施工作。
据该分享,2025年10月智谱启动安全能力增强研究,当时的判断是安全能力是代码能力的自然延伸,能读懂复杂代码的模型也理应能理解代码中的漏洞。不到一年,安全伙伴使用GLM在真实代码库中发现了数千个漏洞。为让这种能力被负责任地使用,智谱设计了受信访问计划。
此次Infra Agent的工作对象是GLM-5.3-Flash的上线。该模型在超过10万卡国产芯片组成的集群上,从零搭建了一套完整生产级推理服务,全部线上推理都运行在这套系统之上。分享称,此前没有人成功部署过如此大规模的国产卡集群,团队面对芯片内存容量和带宽相对受限、需要支持新结构模型的1M上下文窗口和多模态请求、生态不成熟、算子不完备、许多文档基本靠猜等挑战,最终由GLM-5.3驱动的Infra Agent完成。
GLM-5.3-Flash随后以匿名模型“Ox-Alpha”在OpenCode与OpenRouter上接受真实调用检验,上线一周成为双平台调用量最大的模型,6天token调用量超过62万亿。智谱实施了一系列内存优化,包括以算力换带宽、以通信换显存等方案;技术栈融合针对线性注意力和LM Head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合精度缓存量化以及Layer Split等。在此基础上,其引入Encode–Prefill–Decode分离式架构,实现端到端服务性能约3倍提升,硬件利用效率与单Token成本达到主流NVIDIA GPU的相当水平。
唐杰在前述内容中称端到端吞吐提升至初始基线的3.2倍,技术部分则表述为约3倍。分享还称,由于Infra Agent参与的反馈闭环贯穿优化过程,GLM-5.3-Flash在不到两周内完成从模型适配到生产可用的跨越。
唐杰认为,决定Infra Agent工程效果的,不只是模型自身的代码生成与推理能力,更取决于系统能否持续提供有效、可归因的反馈。代码库只能提供静态上下文,而推理系统中的精度异常、性能退化或优化目标未达预期,往往来自算子实现、并行策略、通信行为、内存管理与服务调度等多个层面的动态交互。端到端指标只能告诉Agent“结果变差了”,无法解释“为什么变差”。因此,智谱将正确性测试、运行日志、执行Trace、运行时事件、微基准测试和端到端指标纳入Agent迭代流程,并把这种组织方式称为“稠密反馈”,强调反馈应足够局部、能低成本及时获得,并支持客观验证。
在这一过程中,Agent发现了KDA算子上下文并行路径的精度问题。CP与非CP结果之间的偏差,指向并行执行引入的状态传播与合并计算。原实现中,tl.dot即使接收FP32输入也默认采用TF32计算,较低精度使误差在变换合并和状态更新中累积,长上下文下更明显。修复方法是将相关计算显式指定“tf32x3”,通过三次TF32 Tensor Core运算组合更高精度结果,同时尽量保留Tensor Core性能。工程师定义目标与系统边界,Agent负责分析、假设和修改,实验环境提供分层、及时且可验证的反馈。