AI Agent 在执行搜索、读取本地文件或运行 Python 脚本等任务时,依赖大语言模型正确调用外部工具。训练这类能力需要大量包含工具调用链及对应查询的数据集。此前 InstructPipe 采用人工标注,难以规模化;ToolBench、ToolACE 等方法则让智能体通过试错自动搜索调用路径,即先从 API 池生成假设性指令,再用深度优先搜索(DFS)寻找解决方案。这种从复杂探索中蒸馏轨迹的方式效率较低。
在 ACL 2026 上,Google Research 提出了 ToolGrad,采用相反的“答案优先”思路:先生成真实的工具调用链,再据此标注对应的用户提示。由于显式的工具调用方案比模糊的用户提示包含更明确的信息,这一方向只需一次 LLM 步骤即可完成标注,能够以更低的成本生成长周期的复杂工具调用数据。
文本梯度驱动的迭代框架
标准机器学习通过计算数值损失梯度更新权重,TextGrad 将这一概念迁移到提示工程,由 LLM 评审员提供纯文本形式的描述性反馈(即“文本梯度”)来指导提示词修改。ToolGrad 把文本梯度从提示优化引入合成数据集生成,用于从大型工具库中迭代构建有效的 API 工作流。
ToolGrad 框架包含四个依次运行的核心模块:
- API 提议器:每轮迭代从采样的 API 集合中筛选少量候选项,用于扩展当前工作流。
- API 执行器:并行测试被选中的 API,并生成详细的执行报告。
- API 选择器:审查执行报告,选出表现最优的一次 API 调用。该选择结果作为文本梯度提供方向性反馈,并被追加到工作流中。
- LLM 更新器:根据新的 API 集合修订合成的用户查询与 AI 响应。
重复上述过程后,最终产出一条包含用户查询、经验证的 API 工作流和最终 AI 响应的数据样本。
生成效率与模型表现
研究团队使用包含超过 1.6 万个真实 API 的 ToolBench 数据库评估数据生成的成本与质量。结果显示,相比基于 DFS 的“查询优先”方法,ToolGrad 能以更低的生成成本产出更复杂的工具调用数据,且通过率更高,整体数据生成通过率接近 100%。
在此基础上,团队生成了名为 ToolGrad-500 的小规模数据集,并用于微调 Gemma-3 的 1B、4B 和 12B 参数版本。这些模型在与训练集工具分布不同的 Berkeley Function Calling Leaderboard(BFCL)基准上接受评估。
实验表明,经 ToolGrad-500 微调后,各参数规模的 Gemma-3 模型工具调用能力均有提升。其中 ToolGrad-12B 得分为 83.1,与 gemini-2.5-pro(83.2)、claude-4.5 Opus(82.8)处于同一水平,高于 gpt-5(74.4)。与 ToolACE、Hammer-2.1-7B 等其他开源工具调用专用模型相比,ToolGrad-12B 也取得领先,尽管 ToolACE 使用了更先进的 API 数据库进行微调。
值得注意的是,ToolGrad-500 数据集由 gemini-2.5-flash-lite 生成,但基于该数据微调的 Gemma-3-12B 在评测中超越了其“教师模型”,展现出自我进化能力。
据 Google Research 介绍,后续研究计划将该框架扩展到更大规模、更动态的 API 生态,并探索将这种自我进化能力用于支持随时间推移的持续在线学习与个性化适配。
