现代搜索与推荐系统越来越多地需要返回一组连贯、互补的结果,而非单一最佳匹配。例如用户搜索“露营装备”时,期望看到帐篷、睡袋、便携炉具和头灯的组合,而不是十款略有差异的四人帐篷。为此,系统通常采用查询展开(query fan-out)技术,将一个宽泛提示拆分为多个相关子查询。
然而,让通用大语言模型动态执行数据库感知的查询拆分代价高昂。零样本 LLM 本质上是通用自回归文本预测器,并未针对特定语料的几何流形优化,往往需要大量测试时计算才能兼顾多样性、覆盖度、互补性和连贯性等集合级属性。据 Google Research 介绍,其在 ICML 2026 发表的论文提出了 Retrieve-for-Train 框架,通过奖励到数据的编译机制解决这一分解瓶颈。
通用 LLM 在集合检索中的结构性限制
依赖标准 LLM 处理数据库感知查询展开会面临两个核心问题。
首先是释义坍塌(paraphrastic collapse)。缺乏数据库感知优化时,零样本 LLM 倾向于生成冗余的近义查询,而非探索主题的互补侧面。以“波西米亚音乐节风格”为例,未经精细提示工程的模型可能输出“波西米亚音乐节时尚”和“波西米亚音乐节服装”,导致结果同质化,遗漏流苏夹克、钩针连衣裙或麂皮靴等具有区分度的方向。
其次是自回归延迟瓶颈。为将复杂查询拆分为互补侧面,现有模型通常需要生成数百个中间思维链(CoT)推理 token 来规划展开路径。这种逐 token 生成的架构在生产环境所需的亚秒级响应要求下构成结构性延迟下限,即使配合服务层优化也难以消除。
Retrieve-for-Train 的三阶段流程
该框架将训练视为一次性离线演练,而非每次用户查询时的在线决策。其流水线包含三个步骤:
- 展开语言模型训练:使用强化学习训练一个展开语言模型,使其输出符合集合级属性检查奖励的子查询。该奖励评估的是整组结果的综合表现,而非单个条目的孤立相关性。
- 监督信号合成:冻结后的展开语言模型完全在离线环境中合成“查询→目标集合”数据对,用于后续监督学习,无需人工标注。
- 扩散检索器训练:一个仅 53.9M 参数的紧凑扩散模型学习将查询嵌入直接映射为一组完整的目标嵌入,以单次非自回归方式完成,绕过基于文本的 CoT 推理 token。
复合奖励与防捷径锚点
传统监督训练通过学习排序评估逐点相关性,但集合检索的质量由不可分解的集合级属性定义——单一物品无法衡量多样性或互补性。Retrieve-for-Train 未依赖自然语言指令,而是使用严格的数学复合奖励,通过强化学习微调 Gemma3-4B 和 Qwen3-4B 两款 4B 开源模型。
在开放式抽象检索任务中,该复合奖励由三项相互制衡的指标加权构成:
- 落地性(Groundedness):惩罚与数据库流形的距离,确保每个子查询对应数据库中真实可检索的条目。
- 多样性(Diversity):使用 Vendi Score 衡量整个子查询集合,迫使模型探索更宽的语义范围。
- 对齐性(Alignment):将候选子查询锚定至原始宽泛提示,防止语义漂移。
训练中采用结合软 PPO 正则化的组相对策略优化(Soft-GRPO)。这三项奖励互为反向锚点:若仅优化落地性,模型会通过生成无意义但恰好映射到特定数据库坐标的字符串来“刷分”;加入对齐性后,策略又可能退化为重复改写用户提示。Vendi Score 的引入封堵了这些捷径,迫使策略在嵌入空间中找到既有效落地又语义各异的平衡区域。消融实验显示,缺少多样性项时,模型会迅速坍缩为生成如“line ending line ending”之类的退化字符串以利用向量坐标。
实验设置与性能表现
研究团队在两类集合检索场景中进行了评估:开放式抽象检索(无唯一基准答案,质量完全由集合级属性衡量)和弱监督组合检索(查询配有一个作为意图可行实现的弱参考集)。多模态嵌入骨干网络分别使用基于 CLIP 的检索器处理大规模时尚搭配数据集(文本到图像),以及使用 MuLan 处理专家生成的音乐播放列表工业数据集(文本到音乐)。每个主搜索提示均被要求精确生成 10 个子查询。
在检索质量上,Retrieve-for-Train 在两项任务中均优于传统单查询搜索、零样本展开以及经过重度优化的 Best-of-N 基线。定性结果显示,零样本 LLM 基线持续产生近义释义,而 Retrieve-for-Train 能够生成高度多样且严格落在数据库流形内的子查询。
在推理速度方面,直接部署经 RL 调优的语言模型虽能获得高质量搜索,但仍受限于自回归延迟和高计算开销。通过将学习到的行为蒸馏至 53.9M 参数的扩散模型,后者在连续嵌入空间中以单次并行传递同时生成所有目标方向,实现了相对于自回归方法 12 至 20 倍的加速。根据文中公布的数据,在大规模上下文批次下,自回归展开延迟线性增长至近 50 秒,而 Retrieve-for-Train-Diffusion 保持在亚秒至数秒区间。

