M49 · 预习教材教材已备 ≠ 学习已完成
M49:休息与回顾指南:退出奖励优化循环
今天无必修、不打卡、不引入新知识;不需要把所有后训练算法在一天内统一起来。
2026-10-11rest、recovery、reward-review
内容类型:休息与回顾指南(不代表已完成)
日期:2026-10-11
阶段:P1 · AI Model Engineering 90
周次:W7 · Preference、DPO、GRPO/RLVR 与奖励科学
节奏:周日休息
状态:教材已备;学习未完成
标签:rest、recovery、reward-review
一句话定义
今天无必修、不打卡、不引入新知识;不需要把所有后训练算法在一天内统一起来。
恢复建议
- 关闭 reward 表格、judge 对话和训练框架,安排真正与课程无关的活动。
- 若对公式感到疲劳,不做数学补课;能记住“代理指标可能被利用”已经足够。
- 允许 M48 完全未执行,真实 RL 训练从来不是本周完成条件。
可选回顾
精力自然充足时任选一项,最多 20 分钟:
- 口头区分 SFT、DPO、GRPO 与 RLVR 的反馈来源。
- 从日常产品中找一个“指标上升但目标变差”的非 AI 例子。
- 看一眼优化环与证据环,确认二者没有被画成同一条闭环。
停止条件
开始比较新算法、安装 TRL、生成偏好数据、调 judge prompt,或回顾超过 20 分钟时立即停止。若回顾引发“必须得到正确答案”的压力,也停止。
常见误区
- 用更多学习内容奖励自己的疲劳,形成个人层面的 Goodhart 效应。
- 为保持进度而填写并不存在的训练 reward。
- 把尚未理解的数学等同于本周没有收获。
可选课程回看(非必修)
今天没有阅读要求。若主动想回顾,最多 15 分钟打开 HF TRL Quickstart,只看 SFT、DPO、GRPO 三个标题并口头说出各自的反馈来源。不运行示例、不安装 TRL、不整理笔记;不回看即是正常休息。
学后填写区
- 今日选择(完全休息 / 可选回顾):
- 当前注意力状态:
- 若有,一个生活中的代理指标例子:
- 下周想带走的一条原则: