据雷峰网报道,智谱AI于8月26日晚认领了近期在OpenRouter盲测榜上表现突出的“牛来”模型,正式命名为GLM-5.3-Flash。该模型上线首日便登顶OpenRouter调用量榜单,刷新长文本性价比标杆。然而,其底层配置被指与月之暗面旗下Kimi K3高度相似。
8月27日早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇在社交平台贴出对比图,指出GLM-5.3-Flash与Kimi K3均采用KDA线性注意力,核心参数“遗忘门下界”(gate_lower_bound)同为-5,排布逻辑高度重合。从Kimi K3公开技术报告发布到智谱上新,间隔不到一个月。
据雷峰网报道,这一参数之所以成为焦点,源于线性注意力机制在长文本场景中的特殊地位。传统Transformer的Softmax注意力需要保存全量KV缓存,百万级上下文会使显存占用达数十GB,推理成本极高。KDA等线性注意力采用固定大小状态矩阵压缩历史,用“遗忘门”控制旧信息衰减,使显存开销基本恒定,但循环乘法容易导致数值溢出或归零,训练中一旦出现NaN即崩溃。
Kimi团队在自研FlashKDA内核中设定了gate_lower_bound=-5,经过激活函数后对应约0.67%的旧信息留存率。这是通过大量工程试错得到的平衡点:若设为-3,留存率约5%,会导致信息过载;若设为-8,留存率仅约0.03%,模型将出现“健忘症”。-5在保证训练稳定性的同时,也使百万级长文本推理成为可能。
不过,相同的参数在两家模型中含义不同。Kimi K3采用混合注意力架构,gate_lower_bound=-5从预训练开始即为原生设计,并已在公开技术报告中披露。陈广宇猜测,智谱GLM-5.3-Flash中的该参数可能是“中途注入”,即在预训练中后期追加门控约束并调低学习率续训。有开发者认为这种改动属于“非侵入式”操作,相当于加了一道安全护栏;但也存在隐性分布偏移的风险,可能在超长代码等极端场景中导致“慢性中毒”。
国内另一家大模型公司DeepSeek则选择了不同技术路径,基于自研的MLA与NSA架构实现长序列数值稳定。据雷峰网报道,大推理时代模型需生成数十万字思维链,显存压力剧增,各团队纷纷下潜至算子层寻求突破口。在此背景下,基于Delta Rule的线性注意力在数学收敛区间上天然指向狭窄黄金带,参数趋同被视为行业集体挺进技术深水区的必然结果。