据MarkTechPost报道,普林斯顿研究者Yifan Zhang在一份技术报告中提出Recurrent Looped Transformer(RLT),将解码器最终隐藏状态和逐层滑动窗口注意力(SWA)缓存跨令牌传递,参考配置下每个令牌执行96个逻辑块。报告是设计规范,明确没有给出效率、推理质量或扩展性实测结果。
RLT针对多数仅解码器大模型中令牌t最后一层不进入令牌t+1第一层、位置仅靠缓存键值注意力通信的问题,提出把最终隐藏状态和每层SWA键值带入下一令牌,在提示与回复间不重置。其架构把因果编码器与循环解码器配对:编码器并行处理令牌生成表示e_t,并投影键值记忆M≤t,记忆组可跨层共享(G=1)或逐层独立(G=L_D);解码器完整状态Ht由最终输出s_t与各层保留的SWA键值组成。每个令牌先以门控合并e_t和前一输出s_{t-1},再让每个解码器块执行因果SWA、交叉注意力和前馈网络。窗口W包含当前令牌,每层最多保留W-1个历史条目;下一令牌分布从s_t读出,BOS前用学习到的s*和空缓存初始化。
参考的权重绑定配置有48层编码器和48层解码器,二者共享兼容的注意力和前馈网络权重,因此每令牌执行96个逻辑块;但解码器块额外含交叉注意力,各块浮点运算量不等。Zhang称这是参数复用,不是激活复制。
报告列出三项设计原则,包括带无界时间深度的潜在推理、模型与硬件协同设计、模型与RL算法协同设计。在潜在推理方面,处理t个令牌后,从s0出发的状态路径经过t·L_D个解码器块,参考配置为48t,单令牌计算固定而结构深度随序列增长;报告警告门控和收缩可能抑制长路径,结构深度不保证推理能力。在硬件协同方面,已知令牌的编码器特征和记忆投影用令牌并行内核,解码器转移在序列内串行,独立序列的就绪更新可共享批处理内核;报告不假设非线性解码器可精确并行扫描,不宣称减少预填充时间,并称标准并行SWA解码器前向不等同于该循环。在RL协同方面,预训练、SFT、采样和RL回放共享同一状态转移;RL采样器记录动作在实际采样分布下的行为对数概率,训练器在当前参数下从序列起点重建编码器记忆、循环输出和每个SWA缓存后评分,旧rollout状态不复用。命题3.1称,固定令牌历史下移动提示与回复分割点不改变条件分布。
训练上,预训练用全序列下一令牌预测和完全时间反向传播;SFT把损失掩码到助手目标但不掩码状态更新,因此助手损失会通过用户和工具令牌反传。附录B指出,状态到状态雅可比通过解码器KV有交叉项,只截断s_t仍留有经过缓存的梯度路径。多轮服务中,精确前缀快照包含编码器缓存与记忆、完整解码器状态、位置元数据、窗口约定和模型版本;固定权重快照可复用,权重更新会使旧状态失效,编辑前缀需从更早检查点重算。
与先前工作相比,RLT的编码器派生记忆延续YOCO和DeepSeek-V4.1-Flash,但保留记忆并取消提示范围的解码器跳过;时间反馈建立在Feedback Transformer和Recurrent Transformer上,区别是把前一个最终解码器输出送入下一个解码器输入,并在提示上运行循环;深度复用与Universal Transformers和循环深度潜在推理相关。