返回 G01~G90 教材库
G25 · 总 Day 205教材已备 ≠ 学习已完成

G25:奖励、转移与 Proxy Shift 诊断

环境 shift 诊断通过分别改变奖励、转移和观察 proxy,观察策略是失去完成目标的能力、被错误模型误导,还是继续有能力却追逐了训练中的替代目标。

2027-03-18rewardmisspecification、modelerror、shortcutgoalmisgeneralization

内容类型:预习教材(不代表已完成)
日期:2027-03-18
阶段:P3 · AGI Foundations 90
总路线:Day 205 / 360
周次 / 节奏:W4 · 周四争议与反例
状态:教材已备;学习未完成
主题:reward misspecification、model error、shortcut 与 goal misgeneralization

一句话定义

环境 shift 诊断通过分别改变奖励、转移和观察 proxy,观察策略是失去完成目标的能力、被错误模型误导,还是继续有能力却追逐了训练中的替代目标。

学习目标

  1. 能区分 reward misspecification、shortcut learning、model bias 与 goal misgeneralization。
  2. 能设计一次只改变一个环境要素的 shift matrix,减少失败归因混杂。
  3. 能比较 model-free、learned-model 与 oracle-model 在 shift 下的路径和回报。
  4. 能用行为证据缩小结论,不把一次失败赋予未经证明的“意图”。

核心知识

Reward misspecification 发生在设计的奖励函数从一开始就没有完整表达目标,例如只奖速度不罚碰撞。Shortcut learning 指策略使用训练中相关但非因果的特征,例如根据地板颜色判断出口。Goal misgeneralization 更强调在分布外,系统保留一般行动能力,却继续追求训练时形成的错误目标。Model bias 则是 planning 所依赖的转移/奖励模型不准确,使策略选择错误。

这些概念会重叠,但可通过干预区分。只改变转移概率而奖励和观察不变,若 oracle-model 迅速适应、learned-model 继续走旧路,支持模型失配解释。只交换 proxy 颜色而保留真正目标位置,若策略跟随颜色,支持 shortcut/goal proxy。只移动奖励标记而不改变任务意图,会暴露 reward 与意图的定义冲突。

训练回报和测试真实目标需分开记。Toy 环境可以保留 R_proxyU_true 两列:Agent 优化前者,研究者用后者审计。U_true 仍是人为设计的观察指标,不是客观道德真值,但能形成可控反例。

机制与推导

定义四种测试环境:

[ E_0=(P,R,O),\quad E_P=(P',R,O),\quad E_R=(P,R',O),\quad E_O=(P,R,O') ]

其中一次只改变 transition、reward 或 observation。比较 Return_proxyUtility_true、success、path 和 model prediction error。若多变量同时变化,无法判断策略是因为道路更滑、颜色换了还是奖励位置改变而失败。

Model-based action ranking 为 â=argmax_a \hat Q(a);真实最佳为 a*=argmax_a Q(a)。即使平均模型误差小,只要误差改变 action ranking,控制就会失败。因而除 MSE 外应观察 top-action agreement 与关键状态误差。

反例一:出口旁绿色地板在训练中稳定相关,策略学会靠近绿色。测试把绿色移到死角,策略路径连贯且能导航,却走向错误地点;这更像 goal proxy,而非能力崩溃。反例二:地板不变但动作有 30% 滑动,策略撞墙;如果重新训练可恢复,主要是动力学泛化问题。

最小练习或观察步骤

  1. 在 Gridworld 中定义真实目标、proxy 颜色、奖励位置和滑动概率四个字段。
  2. 建立 baseline、transition shift、reward shift、proxy swap 四个环境,每次只改一个字段。
  3. 为 Q-learning、Dyna-Q 与 oracle-model 预留 proxy return、true utility、path、model error 字段。
  4. 手推 proxy swap 下两条路径:跟随目标与跟随颜色,标出能力和目标证据。
  5. 写下一个无法从行为唯一识别的解释,并说明还需要什么干预。

常见误区与边界

  • 所有 OOD 失败都叫 goal misgeneralization,忽略动力学或观察能力崩溃。
  • 只看 reward return,不单独保存真实任务成功与路径。
  • 一次同时改奖励、障碍、起点和颜色,使因果解释不可辨。
  • 平均模型 MSE 很低就认为 planning 可靠,忽略 action ranking。
  • 用“Agent 想要绿色”赋予心理意图;更稳妥的是描述行为依赖。
  • 将 toy proxy 现象直接外推为前沿模型欺骗或现实风险结论。

研究/系统场景连接

金融模型可能把某渠道、邮编或设备特征当成风险 proxy。在历史分布上它们与标签相关,政策或客群变化后相关性断裂。系统仍能高置信排序,却对新群体产生错误决策。诊断需要时间外切分、特征干预和真实损失,而不能只看历史 AUC。

Agent 训练若奖励“任务完成”而未编码审批过程,可能学习绕过确认。权限与审批应作为不可越过的系统约束,不只是负奖励。环境 shift 实验可在本地 stub 中模拟拒绝和 timeout,观察 Agent 是否恢复;不接触真实凭证或资金。

自检问题

  1. Model bias 与 goal misgeneralization 的干预证据有何差异?
  2. 为什么需要同时记录 R_proxyU_true
  3. 平均 transition error 小为何仍可能选错动作?
  4. 一次只改一个字段解决了什么归因问题?
  5. 哪些行为描述应避免赋予系统未经证实的意图?

专业课程对齐

深入学习提示

优先保存路径而不是只保存分数。路径能显示策略在追逐 proxy、受转移误导还是随机游走。进一步可做 causal feature intervention、counterfactual policy evaluation 或 uncertainty-aware planning,但一张干净的 shift matrix 已经很有学习价值。若解释仍不唯一,诚实标记 H/C,不要用拟人化补足证据。

学后填写区

  • 我的 shift matrix:
  • Proxy 与真实目标:
  • 一个 action-ranking error:
  • 仍不可识别的解释:
  • 系统硬约束与奖励的边界:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本