G27:Model Bias 如何经过 Planning 影响决策
Model bias 影响决策的关键不只是预测平均误差,而是误差沿 rollout 累积、偏向规划访问的分布,并最终改变候选动作的价值排序。
内容类型:预习教材(不代表已完成)
日期:2027-03-20
阶段:P3 · AGI Foundations 90
总路线:Day 207 / 360
周次 / 节奏:W4 · 周六可选探索
状态:教材已备;学习未完成
主题:prediction error、compounding error、action ranking 与 uncertainty
一句话定义
Model bias 影响决策的关键不只是预测平均误差,而是误差沿 rollout 累积、偏向规划访问的分布,并最终改变候选动作的价值排序。
学习目标
- 能画出
model error → rollout state shift → value error → action ranking → outcome证据链。 - 能区分一步预测准确、多步 rollout 准确与决策相关准确。
- 能构造平均误差小但关键动作排序错误的反例。
- 能解释 oracle、short horizon、uncertainty penalty 和真实回放各缓解什么,不提供何种保证。
核心知识
训练 transition model 通常最小化在数据分布上的一步预测误差。但 planner 会选择模型认为高价值的动作,访问的数据可能很少覆盖;这造成 distribution shift。模型的小偏差在常规状态无害,却可能在 planner 主动寻找的边界状态被利用。
多步 rollout 把预测状态再次作为模型输入。若一步误差改变下一输入,误差不再独立,可能复合。即使生成画面逼真,只要对 action consequence 或 reward-relevant feature 错误,planning 仍会失败。相反,像素重建差不一定影响控制,如果任务相关状态和 action ranking 保持正确。
决策相关评价包括 top-action agreement、regret 与 counterfactual consistency。regret=Q(a*)-Q(â) 衡量模型选择动作相对真实最佳的损失;它比全状态平均 MSE 更贴近控制目的,但真实 Q 在现实中通常未知,只能在 toy/oracle 环境观察。
机制与推导
设模型 dynamics 为 ŝ_{t+1}=\hat f(ŝ_t,a_t),真实 dynamics 为 s_{t+1}=f(s_t,a_t)。若模型 Lipschitz 常数为 L,一步误差上界 ε,简化多步误差可出现:
[ |s_h-\hat s_h|\lesssim \epsilon\sum_{k=0}^{h-1}L^k ]
当 L≥1,误差可能随 horizon 快速增长;这只是说明可能性,真实误差会因系统稳定性和反馈而不同。
价值误差可改变排名。真实 Q(a_1)=1.00,Q(a_2)=0.98,模型预测 0.96,0.99;每个误差仅 0.04/0.01,却选错动作。如果两动作价值差距很小,微小误差足以反转;因此关键状态应看 margin。
Short-horizon planning 减少复合误差但可能短视;uncertainty penalty 避免进入低覆盖区,却可能过于保守;ensemble 可揭示模型分歧但不保证覆盖共同偏差;频繁真实 replan 用新 observation 纠正状态,却增加环境交互。没有单一方法消除 model bias。
最小练习或观察步骤
- 构造两个动作的真实/预测 Q 表,让平均误差很小但 argmax 反转。
- 画三步 rollout,每步加入一个方向相同的微小误差,观察最终状态偏移。
- 比较 horizon 1/3/5 的计划,预留 prediction error、ranking agreement 和 return 字段。
- 标出训练数据覆盖区和 planner 选择的边界区,写出 distribution shift。
- 为 short horizon、uncertainty penalty、ensemble、replan 各写一条收益和一条代价。
常见误区与边界
- 一步 MSE 低就宣称模型适合长程控制。
- 只评价视觉逼真,不测试 counterfactual action consequence。
- 把所有多步误差假设为独立,低估系统偏差。
- Ensemble 一致就视为正确;成员可能共享数据盲区。
- 用过强 uncertainty penalty 让 Agent 永不探索,再称为安全。
- 从 toy error bound 推出真实神经模型的严格保证。
研究/系统场景连接
金融响应模型可能在常规客户上平均误差小,却错误估计少数高损失群体或长期干预效果。Planner 会偏向模型预测收益最大的策略,主动放大这些盲区。需要对关键 subgroup、政策边界和 counterfactual action 做额外观察,而不能仅看总体 RMSE。
Agent 的工具模拟器也会在异常返回、并发状态和权限拒绝上覆盖不足。计划在 stub 中通过,不代表真实 API 路径可执行。短 horizon 和每步重新验证能降低状态漂移,但有副作用动作仍需 human checkpoint 与幂等设计。
自检问题
- 一步误差如何变成 planning distribution shift?
- 为什么平均 MSE 小仍可能 action ranking 错?
- Horizon 缩短解决什么,又牺牲什么?
- Ensemble 分歧与真实不确定性有何差距?
- 哪项指标最直接连接模型预测与决策质量?
专业课程对齐
- 阅读 MuZero,思考“为 planning 学到足够模型”与完整观察重建的差异。
- 阅读 World Models,观察 learned dynamics、controller 与模拟 rollout 的关系,为 W5 做衔接。
- 阅读 Concrete Problems in AI Safety,把 distributional shift、safe exploration 与模型边界连接起来。
深入学习提示
不要只问模型“准不准”,要问它在哪些 action、state、horizon 上足以保持排序。可继续学习 model predictive control、Dyna-style uncertainty 或 pessimistic planning,但先画出一条具体错误传播链。若没有真实 oracle,就把结论降级为假设,并用回放或人工检查寻找反例。
学后填写区
- 我的 action-ranking 反例:
- 三步误差传播链:
- Planner 访问的低覆盖区:
- 四种缓解的取舍:
- 无 oracle 时的证据边界: