据美国科技媒体MarkTechPost 9月6日报道,来自Meta FAIR、牛津大学和伦敦大学学院的研究团队提出一种名为“AI研究偏好模型”(RPM)的方法,让AI研究智能体在消耗GPU时间之前先对未执行的机器学习实验候选进行排序,只运行最有希望的候选。该技术达到基线最终分数的速度提升约1.6倍,并刷新了WinoGrande和SVAMP两项基准的最高纪录。
AI研究智能体已经能自行提出、实现和评估机器学习实验。想法生成成本很低,验证却昂贵——训练一个候选可能消耗数小时到数天GPU时间,因此候选数量往往远多于实际可运行数量。研究团队将“运行哪个候选”视为研究进度的关键,并引入RPM。RPM只比较未执行候选并选出其中一个执行,不预测实验的绝对分数,因为团队发现语言模型难以可靠预测指标或执行结果。
RPM作为选择层接入进化树搜索框架AIRA-dojo。在框架中,智能体通常生成一个子节点并执行;加入RPM后,智能体将同一操作并行应用15次,得到15个未执行候选,再通过两两比较的淘汰赛选出唯一胜者执行。每次比较都以搜索历史中采集的上下文节点及其验证分数为依据。
研究团队推出两种RPM变体。仅推理RPM让冻结的大语言模型充当评委,直接比较候选方案、代码和搜索历史;智能体RPM进一步克隆智能体环境,先运行小型试点实验,再让反馈模型决定下一步。两种变体都使用冻结的Qwen3.6-27B骨干,无需微调,但智能体RPM只参与Draft和Improve步骤,Debug步骤仍随机选择。
在AIRS-Bench基准上的测试中,研究团队使用20个公开文本和表格任务,每项任务在单块H200上运行24小时,并采用10个随机种子。结果显示,随机选择候选的平均归一化分数为0.684;仅推理RPM提高到0.711,智能体RPM提高到0.729。作为上限对照的验证预言机和测试预言机分别为0.748和0.759。RPM优于随机选择的概率约为0.59,95%置信区间下界略高于0.5。
效率方面,仅推理RPM和智能体RPM分别用14.88和15.50小时达到基线24小时跑出的最终分数,折合约1.6倍加速;计入自托管推理额外开销后,智能体RPM在23.34小时仍能得到0.708。报道还称,两种变体分别在WinoGrande和SVAMP上取得94.1%和95.7%的新最高分,高于此前的90.4%和94.2%。RPM的AIRA-dojo框架与AIRS-Bench基准已开源,骨干模型开放权重,整体仅部分可部署。