据量子位9月7日报道,一家名为Mostik的初创团队开发出一种“桥”技术,使一个4B参数的小模型能够借助云端753B大模型的内部状态,在ARC-AGI 3基准上取得高分。测试中大模型不生成任何文字,全部输出由小模型完成,大模型侧推理成本被压缩到原来的约二十分之一。

Mostik成立仅4个月,团队15人,其中12名博士,首席科学家为日内瓦大学教授、2010年菲尔兹奖得主Stanislav Smirnov。该团队暂未披露完整技术细节,称比赛尚未结束。据其介绍,目前多模型协作依赖文本传递,效率极低。大模型生成一个token的过程中,内部会构建约两兆字节的状态信息,最终却只以约17比特的文字输出,其余信息被丢弃。可解释性研究显示,被丢弃部分包含深层计算信息:ICLR 2026发表的一篇论文发现,Qwen-3在写出“accountant”之前几个token,内部已携带该词表征;Anthropic团队在Claude 3.5 Haiku上也观察到模型动笔前已确定韵脚的现象。

Mostik的训练思路是让模型间的隐藏状态直接传递。他们训练了一个小型“桥”模块,发送方的隐藏状态穿过桥后,由接收方直接用于生成。在公开演示中,发送方为智谱GLM-5.2(753B参数),接收方为阿里Qwen-3.5(4B参数),两者权重完全冻结,桥是唯一被训练的部分。由于大模型只承担较为廉价的“预填充”过程,跳过逐token生成文本的“解码”环节,输出任务交给小模型,整体算力开销显著下降。

团队报告称,桥方案使4B模型弥补了与753B模型之间约50%的性能差距,自身准确率提高25%,在大小模型差距明显的难题子集上提升达到两倍。若不用桥而要达到同样成绩,需要部署一个中等规模模型,而桥方案的计算成本仅为该模型的五分之二。他们还将桥方案与传统文本接力等模型组合方法进行比较,在所有测试的大模型算力水平下,桥方案在性能-算力权衡上都更优,在“交接点极早”时优势尤其明显,因为此时大模型虽未输出文字,隐藏状态却已含有处理信息。

Smirnov认为,在两个AI模型之间找到可用的数学共同基础极为困难,“目前似乎还没有合适的数学语言来描述这件事”。公司CEO Sasha Malysheva是该方法开发者之一,她判断未来不一定是单一巨型模型包打天下,更可能是前沿模型与生物、物理等领域的专用模型高效配对。

Mostik计划把桥用于蒸馏、专项化训练和安全监控。例如,桥可将教师模型的内部状态同步给学生模型,使监督信号更早进入生成过程;小模型也能带着桥学习专业能力,同时保留通用能力。在安全方面,桥在两个模型间增加了新的观察面,发送方隐藏状态、转换结果与接收方行为均可被记录。这些方向仍处于早期阶段,是否适用于更多模型、任务和真实负载尚需验证。