M47:W7 一页小结:从偏好与奖励到行为和 Verifier
后训练的完整链条不是“奖励上升”,而是 SFT 建立行为起点、偏好或 verifier 定义更新方向、独立评估判断行为是否更接近真实目标。
内容类型:预习教材(不代表已完成)
日期:2026-10-09
阶段:P1 · AI Model Engineering 90
周次:W7 · Preference、DPO、GRPO/RLVR 与奖励科学
节奏:周五一页小结
状态:教材已备;学习未完成
标签:post-training、preference、reward、behavior、verifier
一句话定义
后训练的完整链条不是“奖励上升”,而是 SFT 建立行为起点、偏好或 verifier 定义更新方向、独立评估判断行为是否更接近真实目标。
学习目标
- 串联 SFT→preference→reward→behavior→verifier 的角色。
- 能区分训练奖励、验证器通过和真实业务价值。
- 建立奖励设计的轻量检查清单。
核心知识
SFT 用示范塑造基本输出分布;偏好对表达相对选择;奖励模型或规则把反馈转成分数;DPO/RL 方法改变策略;verifier 对可判定性质给信号。每一步都是信息压缩:复杂人类目标被压成示范、二选一或标量,必然损失信息。
“reward”至少有三种语义,不应混用:
- 训练 reward:参与参数更新的代理信号。
- 评估指标:在固定集上观察某项能力,可能与训练信号重合。
- 业务价值:正确、合规、及时、可解释且成本可接受的综合结果。
Verifier 的强度取决于覆盖范围。单元测试能证明给定用例通过,不能证明所有行为正确;schema 校验能证明结构合法,不能证明内容真实;人工偏好能覆盖难量化品质,但存在标准不一致与成本。
奖励科学的重点是研究测量过程:谁提供反馈、按什么准则、哪些分布、怎样被利用、何时失效。一个透明的多分量记录,通常比单一“综合质量 0.93”更可诊断。
机制/推导
可以画两条彼此分离的路径:
- 优化环:采样→评分→损失/优势→更新→再次采样。
- 证据环:冻结策略→保留集/边界集→独立指标→人工抽查→结论。
若同一数据、judge 和指标同时服务两条环路,模型会逐渐适配评估器,证据独立性下降。保留集、异构 verifier 和版本化准则,是维持证据价值的基本方法。
最小练习或观察步骤
- 在一页纸上画优化环与证据环,标出共享组件。
- 为一个任务分别写训练 reward、独立指标和业务价值定义。
- 列出一个硬约束、一个软偏好、一个只能人工判断的性质。
- 从 M46 选择一个高分失败例,放入保留边界集。
- 写出策略升级前的最低证据:不是目标分数,而是需要看到哪些错误减少且哪些副作用未增加。
常见误区
- verifier 通过率提高就称为“对齐完成”。
- 训练与最终评估使用完全相同的 judge 和提示。
- 把多个冲突价值压成单分数却不保留分量。
- 只看均值,忽略最严重失败与拒答覆盖。
- 将模型适应奖励称为有意“欺骗”,忽略优化机制本身。
金融 / Web3 / 文档场景连接
支付争议摘要的业务价值可能包含数值准确、证据引用、时限、措辞合规和人工处理时间。编程 verifier 可覆盖数值与 schema;证据忠实度需对照原文;是否足以作出责任判断可能仍需人审。三层不可用一个格式分数替代。
自检问题
- 训练 reward、评估指标和业务价值有何不同?
- 为什么优化环和证据环要尽量保持独立?
- verifier 通过能支持什么范围的结论?
- 如何保存奖励冲突的可诊断性?
专业课程对齐
- 精读 HF TRL Quickstart 中 SFT、DPO、GRPO 三条 trainer 路径,用统一表格记录数据 schema、需要的模型、损失/奖励和采样成本。
- 精读 ARENA 的 RLHF 与对齐单元,回看 reward model、KL penalty、advantage、PPO 及评估边界。
- 选读 Stanford CS224N 的 instruction tuning/alignment 课题,把方法放回语言任务与人类评估中。
深入学习提示
先精读 TRL 的工程差异,再用 ARENA 还原数学,最后选读 CS224N。将“优化环”与“证据环”分别画图:前者含 sampling、reward、loss/advantage、update,后者含 frozen policy、held-out probes、异构 verifier 与人工抽查。公式层连起 SFT NLL、DPO margin、group advantage 和 KL;资源层对比 online sampling 与 offline pairs。反例是同一 judge、同一数据同时用于训练和最终评估,却将 reward 上升报告为独立能力证据。
学后填写区
- 我的两环图位置:
- 一个硬约束:
- 一个软偏好:
- 一个必须保留人工判断的性质:
- W7 最大的不确定性: