据 MarkTechPost 报道,Google Research 与东京大学、理化学研究所 AIP、东北大学的研究人员发布工具调用数据生成框架 ToolGrad,该框架把“先写用户问题、再搜索工具链”的流程倒转,改为先实际执行 API 构建可验证的工具调用链,再为这条链生成匹配的用户查询。研究团队称,在 ToolBench 上的数据生成通过率由 63.8% 提升到 99.8%。

此前的 ToolBench、ToolACE 等流程采用查询优先的配方:系统先采样一批 API,让大模型编造一条看似合理的用户指令,再派出深度优先搜索代理寻找能满足该指令的工具调用路径。搜索并不保证成功,一旦走进死胡同,探索所耗算力即为浪费,样本也随之丢弃。论文将这种做法描述为从复杂且经常失败的代理探索中蒸馏轨迹,效率低下。ToolGrad 的思路是反过来:先通过真实执行 API 构造出作为基准的工具调用链,再为这条链标注一条匹配的用户查询。一条明确、可运行的调用链比一个假设性的提示歧义更少,因此从链到查询只需一次大模型调用。

每轮迭代依次运行四个模块。API Proposer 从采样到的 API 中筛出若干可扩展当前工作流的候选;API Executors 并行执行这些候选并产出详细执行报告;API Selector 审阅报告,选出表现最佳的一次调用追加到工作流,其方向性反馈即所谓“文本梯度”;LLM Updater 重写合成的用户查询与 AI 回复,使其匹配更新后的 API 集合。循环重复后得到一条样本,包含用户查询、经核验的 API 工作流和最终回复。仓库默认配置为每个工作流在 50 个采样 API 上运行 10 轮迭代。

研究团队在包含 16000 多个真实 API 的 ToolBench 数据库上评估数据生成,并与 ToolBench 基于深度优先搜索的查询优先方法对比。论文给出的数据显示:通过率从 63.8% 升至 99.8%;每条样本包含的基准工具使用数从 2.1 升至 3.4,即链条更长;每条样本的工具使用步骤从 34.3 降至 20.0;每条样本的大模型调用次数从 64.5 略降至 63.9。0.2% 的失败情况出现在代理经 10 轮迭代仍无法从 3 个选定的 API 获得成功响应时,此时系统保存了一条空样本。

研究团队用 Gemini 2.5 Flash-Lite 生成了 500 条样本的数据集 ToolGrad-500,并据此对 1B、4B、12B 三种参数规模的 Gemma-3 进行后训练。评测在 Berkeley Function Calling Leaderboard 上进行,该榜单使用的工具集与 ToolBench 不同,构成一次工具未见过的分布外测试。作者报告的结果是:在 ToolGrad-500 上微调使各个参数规模的工具调用得分均有提升;ToolGrad-12B 得 83.1 分,发表时 Gemini 2.5 Pro 为 83.2 分、Claude 4.5 Opus 为 82.8 分、GPT-5 为 74.4 分。这一 12B 学生模型的成绩超过了生成其训练数据的教师模型 Gemini 2.5 Flash-Lite,也领先 ToolACE 和 Hammer-2.1-7B 等开源工具调用模型。

代码以 Apache-2.0 协议开放,ToolGrad-500 数据集与 1B、4B、12B 模型已发布在 Hugging Face,另有 PyPI 包可供安装。仓库的复现脚本通过定制分支面向 BFCL V1 与 V2,在 vLLM Docker 镜像中执行推理,并已在单张 NVIDIA A100 40GB 上验证。