M43:后训练方法地图:SFT、奖励模型、DPO、PPO/GRPO 与 RLVR
后训练把示范、偏好或可验证反馈转成学习信号,使预训练模型的输出分布更符合目标行为,但反馈定义本身决定了模型会追逐什么。
内容类型:预习教材(不代表已完成)
日期:2026-10-05
阶段:P1 · AI Model Engineering 90
周次:W7 · Preference、DPO、GRPO/RLVR 与奖励科学
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:sft、reward-model、dpo、grpo、rlvr
一句话定义
后训练把示范、偏好或可验证反馈转成学习信号,使预训练模型的输出分布更符合目标行为,但反馈定义本身决定了模型会追逐什么。
学习目标
- 区分 SFT、奖励模型、DPO、PPO/GRPO 与 RLVR 的输入和训练信号。
- 能画出 feedback→reward/optimization→behavior 的完整路径。
- 理解后训练主要改变行为分布,不自动保证事实、价值或安全。
核心知识
- SFT 使用
(prompt, ideal response)示范做最大似然训练,回答“应该模仿什么”。它简单稳定,但一条示范不能显式表达多个答案的相对优劣。 - Reward Model(RM) 从 chosen/rejected 或评分中学习标量奖励
r(x,y),把人类偏好推广到未标注回答。RM 自身会有分布偏差和可被利用的漏洞。 - DPO 直接用偏好对调整策略相对参考模型的对数概率,不需要显式训练并在线查询一个奖励模型。它仍依赖偏好数据质量与参考策略。
- PPO/GRPO 先从当前策略采样,再用奖励做策略更新。PPO 常使用 value/critic;GRPO 可用同一 prompt 的一组回答做相对优势,减少独立价值模型需求。
- RLVR 使用可程序化验证的奖励,如数学答案、单元测试或格式检查。奖励更客观可扩展,但只覆盖验证器能看到的性质。
这些方法可形成流水线:先 SFT 获得可用策略,再做偏好或可验证强化。但不是任务越重要、算法越复杂越好;反馈可定义性、采样成本和错误代价决定方法。
机制/推导
可把学习信号分为三种:
- token-level imitation:SFT 对目标 token 求交叉熵。
- pairwise preference:要求 chosen 的相对分数或概率高于 rejected。
- trajectory/outcome reward:对完整回答或过程给标量奖励,再估计策略梯度。
后训练的关键不是“奖励越高越好”,而是代理目标与真实目标的距离。若奖励只检查 JSON 合法,模型可能学会永远输出合法但空洞的 JSON;若只奖励长度,模型会冗长。行为改变必须在独立任务、边界样例与未被奖励直接编码的指标上观察。
最小练习或观察步骤
- 选择一个任务,如“根据证据写可审计的争议摘要”。
- 分别设计一条 SFT 示范、一对 chosen/rejected 和一个可程序验证条件。
- 写出每种反馈明确奖励了什么、遗漏了什么。
- 画流程:数据/采样→反馈→损失或优势→参数更新→行为评估。
- 为五种方法记录是否需要在线采样、显式 RM、参考模型或 verifier。
- 选最简单可行方法,并写出升级到更复杂方法所需的证据。
常见误区
- 把“RLHF”当成所有后训练方法的同义词。
- 认为 DPO 不训练奖励模型,因此没有奖励偏差。
- RLVR 有客观 verifier,就能覆盖解释质量和业务价值。
- 只看训练 reward 上升,不检查策略是否钻空子或偏离分布。
- 直接从预训练模型做复杂 RL,而没有稳定 SFT baseline。
金融 / Web3 / 文档场景连接
结构化抽取可用 schema verifier;智能合约代码可用编译与测试;金融解释的证据忠实度却很难由单一规则完全验证。适合把可验证格式作为硬约束,把事实引用和业务判断保留给独立证据评估,而不是合成一个不透明总分。
自检问题
- SFT 与 preference 数据提供的信号有何不同?
- DPO 为什么仍然包含隐含偏好目标?
- RLVR 最适合哪些可判定任务,又会遗漏什么?
- 训练 reward 上升为何不等于业务价值上升?
专业课程对齐
- 精读 HF TRL Quickstart 中 SFTTrainer、DPOTrainer 和 GRPOTrainer 的最小输入/输出,只映射 dataset、policy、reference、reward function 与 trainer 角色。
- 精读 ARENA 的 RLHF/对齐相关单元,关注 reward model、PPO、KL 约束和 policy update 的数据流。
- 选读 Stanford CS224N 中 instruction tuning 与人类反馈课题,补充任务与评估视角。
深入学习提示
先用 TRL 识别工程接口,再用 ARENA 追踪优化机制,CS224N 仅作概念回看。为 SFT、RM、DPO、PPO/GRPO、RLVR 各画一行:数据形状→信号→损失/优势→更新对象→可观察行为。数学上至少区分 token NLL、pairwise log-sigmoid 与 policy-gradient 目标;资源上记录是否需要参考模型、reward/value 模型和 online sampling。反例是把 verifier 可检查的格式等同于真实性,或认为更复杂的 RL 必然优于高质量 SFT。
学后填写区
- 我选择的任务:
- 三种可用反馈:
- 最小后训练方法:
- 代理目标可能遗漏的性质:
- 需要独立观察的行为: