据TechRadar报道,清华大学研究人员发表论文,提出一种名为Cache-to-Cache(C2C)的技术,使不同AI模型无需生成任何文本即可交换内部信息。该论文已被ICLR 2026接收,并随附面向开发者的开源代码。报道称,这项技术针对多个语言模型在同一流程中协作时的一类低效问题。
当前两个AI模型协作时,一个模型须先把思考转化为书面句子,另一个模型才能读取。这一书写步骤消耗计算时间,并丢弃第一个模型原始思考过程中的细微信息。每个AI模型都会保存已处理内容的“工作记忆”,技术上称为缓存。C2C绕过成文语言,让一个模型把工作记忆直接传入第二个模型的记忆库。
一个名为Fuser的小型辅助程序负责这次交接,对信息进行重塑和旋转,使第二个模型能够实际使用。不同AI模型存储记忆的内部布局、尺寸和结构完全不同,若直接把一个模型的原始记忆倒入另一个模型,可能令后者困惑或导致答案崩溃。为此,C2C加入智能过滤器,决定哪些传入记忆值得立即吸收。部分内部层立刻接受新信息,另一些层则不受外部干扰,继续独立推理。
研究人员称,这一设置使AI模型在共享协作任务中的运行速度提升100%至150%。按上限计算,约比通常的来回文字传递过程快2.5倍。团队还报告,模型协同时准确率最高提升14.2%;与仍通过文本通信的旧设置相比,准确率提升3.1%至5.4%。
该方法目前仅适用于开放权重模型,因为它需要直接访问模型的内部缓存和层结构。多数流行AI工具,即普通人在线聊天使用的那类工具,完全向外部用户隐藏这些内部细节。这意味着某些聊天机器人等日常应用无法使用这一捷径,除非其开发者私下将其内置。目前外界无法确定是否有公司已开始在内部使用类似方法。
研究团队认为,文本语言一直拖慢机器,因为它迫使机器像人一样思考。报道同时指出,这一论点需要谨慎看待,因为构建该系统的同一团队也运行了所有证明其有效的测试。这项技术能否达到所宣称的加速幅度,将取决于外部对该系统的其他测试。