据《The Information》独家报道,OpenAI即将发布的GPT-6(内部代号Astra)将采用一套名为“循环深度”的架构革新。该技术让大模型在内部的循环块中进行反复推理,不再需要生成冗长的思维链文本。与此同时,俄罗斯初创公司Mostik展示了一种模型间直接进行高维向量通信的方法,完全绕开人类语言和Token。两项进展均指向同一个趋势:AI计算正在从文本空间转向潜空间,建立在Token计费之上的商业模型面临根本挑战。

据雷峰网转述的这份报道,传统Transformer的层数固定,遇到难题时需要借助思维链临时加长思考深度,但中间文本会消耗显存与带宽。“循环深度”将核心运算层做成可循环结构,同一数据可反复经过同一组参数层,算力从“生成思考过程”转向真正的内部推演。2025年的一篇学术论文验证了该思路:一个35亿参数的小模型通过内部循环32次,在数理逻辑和代码任务上接近甚至超过传统500亿参数模型,且显存开销被封顶。OpenAI首席科学家Jakub Pachocki担忧,这种架构从底层将思维链“黑盒化”,可能使行业陷入不可监控状态的无序竞争。

另一条线来自俄罗斯。据美国《连线》杂志报道,初创公司Mostik训练出一个轻量桥接矩阵,能把一个大模型理解问题后的高维隐状态直接投影到另一个模型的输入潜空间,全程不生成任何Token,也无需微调两个原模型的权重。这家公司由数学博士Sasha Malysheva创立,并邀请2010年菲尔兹奖得主Stanislav Smirnov参与,依据是不同模型的潜空间存在共通的语义流形。在实验中,Mostik将GLM-5.2(753B)与Qwen-3.5(4B)搭桥,由云端大模型负责推理,端侧小模型执行,混合系统的推理成本仅为GLM-5.2单独运行时的二十分之一,在ARC-AGI排行榜上得分超过同期多个前沿模型。前谷歌DeepMind科学家卡尔·图尔斯评价称,这种“桥”释放了模型协作的效率。

“循环深度”从时间维度让单个模型在潜空间内纵向迭代,“潜空间桥接”从空间维度让多个模型横向组网。两者叠加后,可能出现大模型完成高阶推理后将潜空间直接分发给多个端侧模型并行执行的场景。这直接冲击了按Token计费的商业闭环。当前API按Token计价,思维链按输出Token收费是推理模型的重要毛利来源,硅谷公司联合指引的7500亿美元AI基础设施资本开支也锚定Token消耗增长。循环深度在思考环节削减输出Token,桥接则在协作环节取消模型间的文本传输,收入和成本开始脱钩。未来API可能改为按真实计算量、循环次数或结果定价,而人类可能得到答案却无法获得文本解释链。