据量子位报道,GPT-6 Astra发布后,其采用的“循环深度”技术让循环Transformer成为行业焦点。阿里团队早在11个月前已针对该技术的瓶颈发表两篇论文,分别被ICLR 2026和EMNLP 2026接收,意在解决循环模型“计算冗余”的问题。

“循环深度”指让同一组Transformer层反复运行,在不增加同等规模参数的情况下把计算做得更深。该技术被认为提供了新的Scaling方式,但也引发安全担忧。OpenAI首席科学家Jakub Pachocki因此遭到AI安全专家集体批评,他回应说正在写文章解释。

阿里团队的研究直接瞄准其短板。在Pythia-1.4B级别实验里,循环结构通过权重共享减少约33%非嵌入参数,加入MeSH后,零样本下游平均准确率从普通Transformer的49.50%提高到50.56%,新增参数与额外计算开销均极低。另一篇SpiralFormer则通过让不同循环处理不同序列分辨率,将计算量从14.08T FLOPs降至13.13T,5-shot下游平均准确率从51.93%提高到54.37%。

MeSH由阿里及合作高校团队提出,论文首版2025年10月公开。研究团队通过分析发现,循环模型存在“摸鱼”现象:后面的循环更新幅度小、相邻轮次表示相似、状态趋向低维。原因被归结为“计算无分化”和“信息过载”。MeSH为此引入具有多个记忆槽的Memory Buffer,将历史信息与当前任务分离,并用Write Router和Read Router动态调配每轮写入与读取的权重,使得各轮循环形成分工。

SpiralFormer则关注计算粒度。传统循环每一轮都在完整token序列上计算,而SpiralFormer会在每轮循环开始前对序列进行缩放,从1/8长度逐步扩展到完整序列,使模型先建立全局模式,再转向局部模式。该论文被EMNLP 2026接收。

背景方面,循环Transformer已不是第一次被带火。此前Claude Mythos发布时,其在图搜索测试GraphWalks BFS上的成绩接近GPT-5.4的四倍,也被外界与循环架构联系起来。如今GPT-6 Astra再次将这一路线推向台前。阿里两篇论文分别对应信息管理和计算粒度,被看作循环Transformer走向下一代高效大模型的基础工作。