据MarkTechPost报道,Google Research推出Retrieve-for-Train(R4T)框架,先以强化学习离线训练查询扇出策略,再蒸馏为小型扩散模型,在一次非自回归过程中生成全部检索方向。报道称,该方法使查询扇出推理速度提升12至20倍。

搜索和推荐系统常需返回一组结果。例如“露营装备”应返回帐篷、睡袋、炉具和头灯,而非10个近似的帐篷。团队指出,通用大模型推理时执行扇出有两个问题:一是释义坍缩,零样本Qwen3-4B面对“波西米亚音乐节风格”生成“bohemian festival fashion”和“festival bohemian clothes”等近义子查询,导致结果同质化;二是延迟,自回归生成加反复检索调用速度慢,Best-of-N可提升质量但成倍增加成本。

R4T分三步。扇出语言模型生成k个子查询,由冻结的密集检索器执行,集合级奖励对整个检索集合打分,而非逐项评分。监督合成阶段,训练后的模型以温度0.9为每个查询采样128个扇出,形成无需人工标注的(查询,目标集合)训练对;开放式任务以检索内容嵌入为目标,组合式任务以子查询嵌入为目标。最后训练扩散检索器:一个5390万参数的扩散Transformer在EDM框架内用方差爆炸形式,将查询嵌入映射为一组目标嵌入;推理时一次生成全部嵌入,再经最近邻搜索映射到数据库条目。

开放式抽象检索(OAR)奖励由三项加权组成:基础性权重0.6,惩罚子查询嵌入与最近数据库条目的距离;多样性权重0.2,用Vendi Score衡量代表性检索项;对齐性权重0.2,计算子查询与原查询的平均余弦相似度。弱监督组合式检索(WSCR)奖励为扇出检索到的参考集合条目比例。消融显示,仅用基础性时Gemma3-4B收敛到“line ending”类字符串;加入对齐性后坍缩更快;加入多样性后两个捷径均被关闭。训练使用GRPO和软PPO正则化,并加入前向与反向KL惩罚。

实验使用Polyvore时尚穿搭数据集和CLIP matryoshka编码器,以及带MuLan嵌入的专有专家歌单音乐数据集。每种扇出方法生成k=10个子查询,Best-of-N的N=5,OAR质量由大模型评审按5点李克特量表评分。Polyvore上,Gemma3-4B R4T-FOLM平均49.1,Best-of-N为40.9,零样本为38.5;多样性从56.0升至76.8,R4T-Diffusion保留74.3。Music上,Gemma3-4B R4T-FOLM平均58.1,Best-of-N为49.2。Polyvore的WSCR中,R4T-FOLM(Qwen)达20.9 Recall@5K和64.6 Hit@5K,Gemini-2.5-Flash为15.7和52.1,但其Vendi Score降至27.5;R4T-Diffusion(Qwen)Vendi Score为34.7,Recall@5K为16.5。

效率方面,批大小8时,自回归扇出约1.46秒,扩散模型为0.07秒;批大小1024时,自回归扇出接近50秒,扩散模型为4.21秒,作者报告稳定12至20倍加速。