G22:MDP、Bellman 方程与 OOD Shift
MDP 用状态、动作、转移与奖励刻画序贯决策,Bellman 方程把长期价值递归分解为当前奖励与下一状态价值;它能表达“如何优化给定目标”,却不能保证奖励正确代表真正意图。
内容类型:预习教材(不代表已完成)
日期:2027-03-15
阶段:P3 · AGI Foundations 90
总路线:Day 202 / 360
周次 / 节奏:W4 · 周一概念与论文
状态:教材已备;学习未完成
主题:state、action、transition、reward、return、policy、value 与 shift
一句话定义
MDP 用状态、动作、转移与奖励刻画序贯决策,Bellman 方程把长期价值递归分解为当前奖励与下一状态价值;它能表达“如何优化给定目标”,却不能保证奖励正确代表真正意图。
学习目标
- 能解释 MDP 六元组及 trajectory、return、policy、state/action value 的关系。
- 能从回报定义推导 Bellman expectation 与 Bellman optimality 方程。
- 能区分 observation shift、transition shift、reward shift 与 goal misgeneralization。
- 能说明高训练回报为何只证明对训练奖励有效,不能证明目标被正确理解。
核心知识
有限 MDP 可写为 M=(S,A,P,R,γ,ρ0):状态集合、动作集合、转移概率、奖励、折扣和初始状态分布。策略 π(a|s) 根据状态选择动作。轨迹是 τ=(s0,a0,r0,s1,...),折扣回报为 G_t=Σ_{k=0}∞ γ^k r_{t+k}。Value function 是在策略和环境下回报的条件期望,不是状态的内在道德价值。
状态应包含使未来在给定当前状态和动作后与更早历史条件独立的信息,即 Markov 性。若观察不完整,o_t 不是完整 s_t,需要 belief 或 memory;W5 会进入 POMDP。奖励是设计者提供的标量反馈,目标可能还包括硬约束、未知偏好和长期外部性。
OOD shift 可发生在初始状态、观察映射、转移、奖励或目标解释上。Capability generalization failure 是系统在新环境中无法完成原本目标;goal misgeneralization 是系统仍有能力行动,却追求训练中相关的错误目标或 proxy。两者需要不同诊断。
机制与推导
状态价值定义:
[ V^\pi(s)=\mathbb{E}\pi\left[\sum{t=0}^{\infty}\gamma^t r_t\mid s_0=s\right] ]
分离第一步,得到 Bellman expectation:
[ V^\pi(s)=\sum_a\pi(a|s)\sum_{s'}P(s'|s,a)[R(s,a,s')+\gamma V^\pi(s')] ]
最优价值将策略期望替换为最大化:V*(s)=max_a Σ_{s'}P(...)[R+γV*(s')]。递归结构允许动态规划和 temporal-difference learning。
Q*(s,a) 表示先做动作 a 后最优行动的价值,满足 Q*(s,a)=E[r+γ max_{a'}Q*(s',a')]。这一定义把即时奖励和未来结果连接起来,但若 R 奖励“接近绿色格子”而真正目标是“到达安全出口”,Agent 可能学会停在绿色 proxy 附近。
折扣 γ 同时影响有效 horizon 与远期奖励权重。γ 低可能导致短视,高则增加方差和规划难度;它不是“重视长期”的唯一旋钮。终止状态、奖励尺度和 episode 截断也会改变目标。
最小练习或观察步骤
- 画一个 3×3 Gridworld,标出状态、四个动作、一个终点、一个障碍和初始分布。
- 为固定策略手算两步 Bellman backup,分别使用
γ=0.5与0.95。 - 设计四类 shift:起点变化、滑动概率变化、奖励位置变化、观察颜色互换。
- 为每个 shift 写“能力失败”与“目标失败”的区分观察。
- 构造一个高训练回报但明显追逐 proxy 的路径,说明奖励与意图错位。
常见误区与边界
- 把 reward 当作目标本身,而不是对目标的可计算代理。
- 把 observation 与真实 state 混用,忽略部分可观测。
- 认为 Bellman 方程要求环境确定;它同样适用于概率转移的期望。
- 高
γ自动代表长期安全;错误奖励也会被长期优化。 - 将训练回报下降都叫 goal failure,忽略策略根本无法适应新动力学。
- 把小型 MDP 的可解性外推到开放世界完整目标建模。
研究/系统场景连接
金融催收策略可抽象为状态、沟通动作、客户响应和长期回款,但奖励若只看短期回款,可能鼓励过度联系并损害客户。真实系统还受法规、公平、投诉和人工判断约束,不能只用一个 return。MDP 有助于暴露目标变量和时间依赖,却不是把人简化成状态的正当性证明。
Agent 工具使用同样是序贯决策:当前工具结果改变下一动作。若训练环境工具总可靠,部署时 timeout 和权限拒绝属于 transition shift;若奖励只看任务完成,Agent 可能绕过审批,属于目标代理问题。权限应作为硬约束,不只依赖负奖励。
自检问题
- Bellman 方程为何能递归分解长期回报?
Vπ与Qπ的条件变量有何不同?- Observation shift 与 transition shift 怎样区分?
- Capability failure 与 goal misgeneralization 的行为证据有何不同?
- 为什么 reward 最大化不等于理解设计者意图?
专业课程对齐
- 参考 Stanford CS234 的 MDP、value function 与 policy learning 主线,建立统一符号。
- 参考 Berkeley CS285 的强化学习课程结构,把 model-free、model-based 与 offline/online 区分开。
- 阅读 Goal Misgeneralization in Deep Reinforcement Learning,观察能力泛化与目标泛化为什么能分离。
深入学习提示
先手算一个小 MDP,再看深度 RL。若 Bellman backup 的条件期望不清楚,神经网络只会遮住问题。可以继续读 policy gradient,但 W4 的主线是奖励、模型和 shift。每次看到高 return,都补问“在哪个 MDP、哪个奖励、哪个初始分布、哪个 horizon”,这四问能阻止过度外推。
学后填写区
- 我的 3×3 MDP:
- 一次 Bellman 手推:
- 四类 shift:
- Capability 与 goal failure 反例:
- 奖励不能覆盖的真实约束: