返回 M01~M90 教材库
M43 · 预习教材教材已备 ≠ 学习已完成

M43:后训练方法地图:SFT、奖励模型、DPO、PPO/GRPO 与 RLVR

后训练把示范、偏好或可验证反馈转成学习信号,使预训练模型的输出分布更符合目标行为,但反馈定义本身决定了模型会追逐什么。

2026-10-05sft、reward-model、dpo、grpo、rlvr

内容类型:预习教材(不代表已完成)
日期:2026-10-05
阶段:P1 · AI Model Engineering 90
周次:W7 · Preference、DPO、GRPO/RLVR 与奖励科学
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:sft、reward-model、dpo、grpo、rlvr

一句话定义

后训练把示范、偏好或可验证反馈转成学习信号,使预训练模型的输出分布更符合目标行为,但反馈定义本身决定了模型会追逐什么。

学习目标

  1. 区分 SFT、奖励模型、DPO、PPO/GRPO 与 RLVR 的输入和训练信号。
  2. 能画出 feedback→reward/optimization→behavior 的完整路径。
  3. 理解后训练主要改变行为分布,不自动保证事实、价值或安全。

核心知识

  • SFT 使用 (prompt, ideal response) 示范做最大似然训练,回答“应该模仿什么”。它简单稳定,但一条示范不能显式表达多个答案的相对优劣。
  • Reward Model(RM) 从 chosen/rejected 或评分中学习标量奖励 r(x,y),把人类偏好推广到未标注回答。RM 自身会有分布偏差和可被利用的漏洞。
  • DPO 直接用偏好对调整策略相对参考模型的对数概率,不需要显式训练并在线查询一个奖励模型。它仍依赖偏好数据质量与参考策略。
  • PPO/GRPO 先从当前策略采样,再用奖励做策略更新。PPO 常使用 value/critic;GRPO 可用同一 prompt 的一组回答做相对优势,减少独立价值模型需求。
  • RLVR 使用可程序化验证的奖励,如数学答案、单元测试或格式检查。奖励更客观可扩展,但只覆盖验证器能看到的性质。

这些方法可形成流水线:先 SFT 获得可用策略,再做偏好或可验证强化。但不是任务越重要、算法越复杂越好;反馈可定义性、采样成本和错误代价决定方法。

机制/推导

可把学习信号分为三种:

  1. token-level imitation:SFT 对目标 token 求交叉熵。
  2. pairwise preference:要求 chosen 的相对分数或概率高于 rejected。
  3. trajectory/outcome reward:对完整回答或过程给标量奖励,再估计策略梯度。

后训练的关键不是“奖励越高越好”,而是代理目标与真实目标的距离。若奖励只检查 JSON 合法,模型可能学会永远输出合法但空洞的 JSON;若只奖励长度,模型会冗长。行为改变必须在独立任务、边界样例与未被奖励直接编码的指标上观察。

最小练习或观察步骤

  1. 选择一个任务,如“根据证据写可审计的争议摘要”。
  2. 分别设计一条 SFT 示范、一对 chosen/rejected 和一个可程序验证条件。
  3. 写出每种反馈明确奖励了什么、遗漏了什么。
  4. 画流程:数据/采样→反馈→损失或优势→参数更新→行为评估。
  5. 为五种方法记录是否需要在线采样、显式 RM、参考模型或 verifier。
  6. 选最简单可行方法,并写出升级到更复杂方法所需的证据。

常见误区

  • 把“RLHF”当成所有后训练方法的同义词。
  • 认为 DPO 不训练奖励模型,因此没有奖励偏差。
  • RLVR 有客观 verifier,就能覆盖解释质量和业务价值。
  • 只看训练 reward 上升,不检查策略是否钻空子或偏离分布。
  • 直接从预训练模型做复杂 RL,而没有稳定 SFT baseline。

金融 / Web3 / 文档场景连接

结构化抽取可用 schema verifier;智能合约代码可用编译与测试;金融解释的证据忠实度却很难由单一规则完全验证。适合把可验证格式作为硬约束,把事实引用和业务判断保留给独立证据评估,而不是合成一个不透明总分。

自检问题

  1. SFT 与 preference 数据提供的信号有何不同?
  2. DPO 为什么仍然包含隐含偏好目标?
  3. RLVR 最适合哪些可判定任务,又会遗漏什么?
  4. 训练 reward 上升为何不等于业务价值上升?

专业课程对齐

  • 精读 HF TRL Quickstart 中 SFTTrainer、DPOTrainer 和 GRPOTrainer 的最小输入/输出,只映射 dataset、policy、reference、reward function 与 trainer 角色。
  • 精读 ARENA 的 RLHF/对齐相关单元,关注 reward model、PPO、KL 约束和 policy update 的数据流。
  • 选读 Stanford CS224N 中 instruction tuning 与人类反馈课题,补充任务与评估视角。

深入学习提示

先用 TRL 识别工程接口,再用 ARENA 追踪优化机制,CS224N 仅作概念回看。为 SFT、RM、DPO、PPO/GRPO、RLVR 各画一行:数据形状→信号→损失/优势→更新对象→可观察行为。数学上至少区分 token NLL、pairwise log-sigmoid 与 policy-gradient 目标;资源上记录是否需要参考模型、reward/value 模型和 online sampling。反例是把 verifier 可检查的格式等同于真实性,或认为更复杂的 RL 必然优于高质量 SFT。

学后填写区

  • 我选择的任务:
  • 三种可用反馈:
  • 最小后训练方法:
  • 代理目标可能遗漏的性质:
  • 需要独立观察的行为:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。