据 Google Cloud 官方博客介绍,强化学习(RL)是现代大语言模型后训练的关键环节,但通常需要大规模训练集群和模型内部访问权限。为此,Google Cloud 将这一流程封装为托管式 RL 微调服务(RLFT service):用户提供提示词和奖励函数,平台负责基础设施与专有模型的内部处理。
RLFT 的核心机制与能力边界
与传统监督微调(SFT)依赖大量标准答案不同,RLFT 通过用户定义的奖励信号来适配模型。在每个训练步骤中,服务针对提示词生成多个候选回复,使用奖励函数评分,并调整模型使高分回复的出现概率提升,同时保持与原 Gemini 模型能力的接近。
根据该指南,RLFT 具备三项特性:
- 从模型自身输出中学习:优化模型已有的生成能力,而非复制外部目标,因此对无关能力的干扰通常小于 SFT。
- 奖励结果而非路径:任何能达成良好结果的回复都能获得奖励,适合存在多种有效解法的开放式任务。
- 放大已有能力:可将偶尔的成功转化为稳定表现,但无法教会模型从未展示过的技能。
何时选择 RLFT
指南建议优先穷尽提示工程和 SFT。当能够低成本评估回复质量却难以编写标准答案、SFT 在关键指标上遇到瓶颈,或任务存在多个等效正确答案时,可引入 RLFT。
SFT 与 RLFT 可组合使用:若基础模型已能部分完成任务,可直接应用 RLFT;若基础成功率过低,则先用少量 SFT 数据进行轻量预热,再通过持续微调(Continuous Tuning)从 SFT 检查点启动 RL,避免过度拟合演示数据而压缩后续 RL 的优化空间。
五个典型应用场景
指南列举了早期采用者验证过的场景,均围绕“对业务关心的结果进行评分”展开:
- 游戏 AI NPC:针对多语言、多轮对话中的角色一致性问题,使用 LLM 作为裁判对每轮对话的人设、流畅度和状态语法评分。结果显示循环重复和语言漂移消失,状态语法保持稳定。
- 结构化实体提取:从发票等非结构化文档中提取字段时,SFT 常在长尾问题上停滞。基于规则的精确率/召回率奖励强制每个字段必须源自原文,提升了噪声文档上的字段级准确率。
- 内容审核:为防止模型产生误报或通过无效格式规避评估,结合 Cloud Run 奖励进行格式验证与确定性策略分级,使模型能够处理复杂的豁免规则并减少人工升级量。
- 代码执行评估:针对 SQL 或 API 调用,在安全沙箱中运行代码,仅在编译、执行且结果正确时给予奖励。模型据此可生成首次尝试即可执行的查询。
- HTML 演示文稿生成:纯文本训练无法发现视觉溢出或样式不一致。通过渲染幻灯片并对视觉设计、布局完整性和结构进行评分,模型能够输出无布局溢出的模块化幻灯片。
实施起点与注意事项
开始使用 RLFT 需要准备两项核心素材:一是包含多样性提示词及独立验证集的数据集,用于确认训练循环收敛且奖励方向正确,需严格隔离训练与评估数据以防过拟合被掩盖;二是奖励函数,指南将其视为决定质量的主导因素。
有效的奖励函数应与人类偏好相关,能稳健处理格式错误的输出(解析失败时返回明确的负分而非崩溃),并具备抗奖励攻击能力——例如采用集成裁判、惩罚过长输出、兜底退化结果,以及优先使用可验证的检查而非模型主观判断。指南建议在上线前离线验证奖励函数。
在实际训练中,可从默认配置起步,通过控制台观察奖励与评估曲线,并在验证奖励趋于饱和时选取检查点,而非直接使用最后一步的模型。

