据雷峰网报道,GLM-5.3-Flash的项目配置文件显示,其45层架构中有34层采用Kimi路线的KDA线性注意力,另有11层采用DeepSeek路线的KPool-DSA稀疏注意力。Kimi与DeepSeek的方案出现在同一套模型架构中,成为大模型Attention路线从分流走向重组的一个具体案例。
Attention处理的是模型在生成当前token时,能否从越来越长的历史中找到有用信息。常见机制大致分为三类:全局注意力直接读取完整token历史,信息保留最充分,但计算和KV Cache成本最高;线性注意力把历史压缩进更紧凑的状态,以降低长序列计算成本;稀疏注意力保留更完整历史,只选择其中一部分重要信息参与计算。过去几年,高效注意力主要沿后两种方向演化。经典Transformer以Full Attention为主,上下文增长会迅速推高训练和推理成本,混合注意力架构因此流行:高效Attention负责降成本,少量全局Attention保留直接访问完整历史的机会。
MiniMax的架构变化几乎完整经历了这一轮反复。2023年底,长期研究Linear Attention的钟怡然在为该路线寻找愿意Scale Up的公司,此前最大实验模型做到15B。他接触过多家公司后,与MiniMax创始人闫俊杰交流,MiniMax决定接下这条尚未经过大规模验证的路线。钟怡然当时认为成功概率接近99%,闫俊杰估计只有约一半。若把Linear作为下一代主模型架构,MiniMax超过80%的研发资源都会被卷入。早期一版15B左右的纯Linear模型效果接近Transformer,但模型放大后,Linear在检索这类需要从长文本中准确找回细节的任务上出现问题。MiniMax最终把Full Attention加回来,形成MiniMax-01的7:1混合注意力架构:每7层Lightning Attention后加入1层传统SoftMax Attention。正式训练4560亿参数前,团队做了约3700次预训练实验。2025年1月模型发布时,7层Lightning Attention加1层Full Attention被保留,上下文长度推到400万token。
模型继续Scale后,第二轮问题出现在多跳推理。模型需要经过多个中间步骤,把前面的条件、推导和结论重新串起来时,混合注意力出现比Full Attention更明显的能力损失。小规模实验中,重新设计测试和训练方法后混合注意力可以追上Full Attention,但MiniMax更担心下一次尚未被发现的问题。Text-01时期的Benchmark并未提前暴露多跳推理差距,团队即使补上新测试,也无法证明更大模型和更复杂任务上不会出现新的能力缺口。到了M2,MiniMax重新采用Full Attention,接受更高成本以换取更可预期的能力边界和工程行为。
Agent又改变了这笔账。2026年6月发布的M3重新离开Full Attention,转向自研的MiniMax Sparse Attention。Text-01时期,长上下文更多是一次性读入更多材料;到了Agent阶段,上下文成为不断增长的工作历史,搜索结果、网页、代码、工具返回、报错和中间结果会随着任务逐轮累积。MiniMax在M3发布时把Context Scaling列为解决复杂Agent任务的核心问题。MSA先从长上下文中筛出真正需要参与Attention计算的部分。官方数据显示,在100万token上下文下,M3单token计算量约为上一代模型的1/20。
类似变化也出现在其他模型。2026年2月发布的MiniCPM-SALA把Lightning Attention和Sparse Attention放在一起;8月发布的Qwen3.8-Flash-Next延续三层Gated DeltaNet配一层Attention的结构,但把原本负责全局精确读取的Attention改造成Qwen Sparse Attention。到了GLM-5.3-Flash,45层中34层采用KDA,另外11层采用KPool-DSA。Linear擅长用较低成本维持很长的历史,却不擅长随时恢复某个具体细节;Sparse保留token级历史,每次只读取其中一小部分。两者在同一套模型中承担不同角色,Attention架构不再只寻找一种更好的机制,而是让不同机制分工。