返回 M01~M90 教材库
M47 · 预习教材教材已备 ≠ 学习已完成

M47:W7 一页小结:从偏好与奖励到行为和 Verifier

后训练的完整链条不是“奖励上升”,而是 SFT 建立行为起点、偏好或 verifier 定义更新方向、独立评估判断行为是否更接近真实目标。

2026-10-09post-training、preference、reward、behavior、verifier

内容类型:预习教材(不代表已完成)
日期:2026-10-09
阶段:P1 · AI Model Engineering 90
周次:W7 · Preference、DPO、GRPO/RLVR 与奖励科学
节奏:周五一页小结
状态:教材已备;学习未完成
标签:post-training、preference、reward、behavior、verifier

一句话定义

后训练的完整链条不是“奖励上升”,而是 SFT 建立行为起点、偏好或 verifier 定义更新方向、独立评估判断行为是否更接近真实目标。

学习目标

  1. 串联 SFT→preference→reward→behavior→verifier 的角色。
  2. 能区分训练奖励、验证器通过和真实业务价值。
  3. 建立奖励设计的轻量检查清单。

核心知识

SFT 用示范塑造基本输出分布;偏好对表达相对选择;奖励模型或规则把反馈转成分数;DPO/RL 方法改变策略;verifier 对可判定性质给信号。每一步都是信息压缩:复杂人类目标被压成示范、二选一或标量,必然损失信息。

“reward”至少有三种语义,不应混用:

  1. 训练 reward:参与参数更新的代理信号。
  2. 评估指标:在固定集上观察某项能力,可能与训练信号重合。
  3. 业务价值:正确、合规、及时、可解释且成本可接受的综合结果。

Verifier 的强度取决于覆盖范围。单元测试能证明给定用例通过,不能证明所有行为正确;schema 校验能证明结构合法,不能证明内容真实;人工偏好能覆盖难量化品质,但存在标准不一致与成本。

奖励科学的重点是研究测量过程:谁提供反馈、按什么准则、哪些分布、怎样被利用、何时失效。一个透明的多分量记录,通常比单一“综合质量 0.93”更可诊断。

机制/推导

可以画两条彼此分离的路径:

  • 优化环:采样→评分→损失/优势→更新→再次采样。
  • 证据环:冻结策略→保留集/边界集→独立指标→人工抽查→结论。

若同一数据、judge 和指标同时服务两条环路,模型会逐渐适配评估器,证据独立性下降。保留集、异构 verifier 和版本化准则,是维持证据价值的基本方法。

最小练习或观察步骤

  1. 在一页纸上画优化环与证据环,标出共享组件。
  2. 为一个任务分别写训练 reward、独立指标和业务价值定义。
  3. 列出一个硬约束、一个软偏好、一个只能人工判断的性质。
  4. 从 M46 选择一个高分失败例,放入保留边界集。
  5. 写出策略升级前的最低证据:不是目标分数,而是需要看到哪些错误减少且哪些副作用未增加。

常见误区

  • verifier 通过率提高就称为“对齐完成”。
  • 训练与最终评估使用完全相同的 judge 和提示。
  • 把多个冲突价值压成单分数却不保留分量。
  • 只看均值,忽略最严重失败与拒答覆盖。
  • 将模型适应奖励称为有意“欺骗”,忽略优化机制本身。

金融 / Web3 / 文档场景连接

支付争议摘要的业务价值可能包含数值准确、证据引用、时限、措辞合规和人工处理时间。编程 verifier 可覆盖数值与 schema;证据忠实度需对照原文;是否足以作出责任判断可能仍需人审。三层不可用一个格式分数替代。

自检问题

  1. 训练 reward、评估指标和业务价值有何不同?
  2. 为什么优化环和证据环要尽量保持独立?
  3. verifier 通过能支持什么范围的结论?
  4. 如何保存奖励冲突的可诊断性?

专业课程对齐

  • 精读 HF TRL Quickstart 中 SFT、DPO、GRPO 三条 trainer 路径,用统一表格记录数据 schema、需要的模型、损失/奖励和采样成本。
  • 精读 ARENA 的 RLHF 与对齐单元,回看 reward model、KL penalty、advantage、PPO 及评估边界。
  • 选读 Stanford CS224N 的 instruction tuning/alignment 课题,把方法放回语言任务与人类评估中。

深入学习提示

先精读 TRL 的工程差异,再用 ARENA 还原数学,最后选读 CS224N。将“优化环”与“证据环”分别画图:前者含 sampling、reward、loss/advantage、update,后者含 frozen policy、held-out probes、异构 verifier 与人工抽查。公式层连起 SFT NLL、DPO margin、group advantage 和 KL;资源层对比 online sampling 与 offline pairs。反例是同一 judge、同一数据同时用于训练和最终评估,却将 reward 上升报告为独立能力证据。

学后填写区

  • 我的两环图位置:
  • 一个硬约束:
  • 一个软偏好:
  • 一个必须保留人工判断的性质:
  • W7 最大的不确定性:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。