返回 G01~G90 教材库
G27 · 总 Day 207教材已备 ≠ 学习已完成

G27:Model Bias 如何经过 Planning 影响决策

Model bias 影响决策的关键不只是预测平均误差,而是误差沿 rollout 累积、偏向规划访问的分布,并最终改变候选动作的价值排序。

2027-03-20predictionerror、compoundingerror、actionrankinguncertainty

内容类型:预习教材(不代表已完成)
日期:2027-03-20
阶段:P3 · AGI Foundations 90
总路线:Day 207 / 360
周次 / 节奏:W4 · 周六可选探索
状态:教材已备;学习未完成
主题:prediction error、compounding error、action ranking 与 uncertainty

一句话定义

Model bias 影响决策的关键不只是预测平均误差,而是误差沿 rollout 累积、偏向规划访问的分布,并最终改变候选动作的价值排序。

学习目标

  1. 能画出 model error → rollout state shift → value error → action ranking → outcome 证据链。
  2. 能区分一步预测准确、多步 rollout 准确与决策相关准确。
  3. 能构造平均误差小但关键动作排序错误的反例。
  4. 能解释 oracle、short horizon、uncertainty penalty 和真实回放各缓解什么,不提供何种保证。

核心知识

训练 transition model 通常最小化在数据分布上的一步预测误差。但 planner 会选择模型认为高价值的动作,访问的数据可能很少覆盖;这造成 distribution shift。模型的小偏差在常规状态无害,却可能在 planner 主动寻找的边界状态被利用。

多步 rollout 把预测状态再次作为模型输入。若一步误差改变下一输入,误差不再独立,可能复合。即使生成画面逼真,只要对 action consequence 或 reward-relevant feature 错误,planning 仍会失败。相反,像素重建差不一定影响控制,如果任务相关状态和 action ranking 保持正确。

决策相关评价包括 top-action agreement、regret 与 counterfactual consistency。regret=Q(a*)-Q(â) 衡量模型选择动作相对真实最佳的损失;它比全状态平均 MSE 更贴近控制目的,但真实 Q 在现实中通常未知,只能在 toy/oracle 环境观察。

机制与推导

设模型 dynamics 为 ŝ_{t+1}=\hat f(ŝ_t,a_t),真实 dynamics 为 s_{t+1}=f(s_t,a_t)。若模型 Lipschitz 常数为 L,一步误差上界 ε,简化多步误差可出现:

[ |s_h-\hat s_h|\lesssim \epsilon\sum_{k=0}^{h-1}L^k ]

L≥1,误差可能随 horizon 快速增长;这只是说明可能性,真实误差会因系统稳定性和反馈而不同。

价值误差可改变排名。真实 Q(a_1)=1.00,Q(a_2)=0.98,模型预测 0.96,0.99;每个误差仅 0.04/0.01,却选错动作。如果两动作价值差距很小,微小误差足以反转;因此关键状态应看 margin。

Short-horizon planning 减少复合误差但可能短视;uncertainty penalty 避免进入低覆盖区,却可能过于保守;ensemble 可揭示模型分歧但不保证覆盖共同偏差;频繁真实 replan 用新 observation 纠正状态,却增加环境交互。没有单一方法消除 model bias。

最小练习或观察步骤

  1. 构造两个动作的真实/预测 Q 表,让平均误差很小但 argmax 反转。
  2. 画三步 rollout,每步加入一个方向相同的微小误差,观察最终状态偏移。
  3. 比较 horizon 1/3/5 的计划,预留 prediction error、ranking agreement 和 return 字段。
  4. 标出训练数据覆盖区和 planner 选择的边界区,写出 distribution shift。
  5. 为 short horizon、uncertainty penalty、ensemble、replan 各写一条收益和一条代价。

常见误区与边界

  • 一步 MSE 低就宣称模型适合长程控制。
  • 只评价视觉逼真,不测试 counterfactual action consequence。
  • 把所有多步误差假设为独立,低估系统偏差。
  • Ensemble 一致就视为正确;成员可能共享数据盲区。
  • 用过强 uncertainty penalty 让 Agent 永不探索,再称为安全。
  • 从 toy error bound 推出真实神经模型的严格保证。

研究/系统场景连接

金融响应模型可能在常规客户上平均误差小,却错误估计少数高损失群体或长期干预效果。Planner 会偏向模型预测收益最大的策略,主动放大这些盲区。需要对关键 subgroup、政策边界和 counterfactual action 做额外观察,而不能仅看总体 RMSE。

Agent 的工具模拟器也会在异常返回、并发状态和权限拒绝上覆盖不足。计划在 stub 中通过,不代表真实 API 路径可执行。短 horizon 和每步重新验证能降低状态漂移,但有副作用动作仍需 human checkpoint 与幂等设计。

自检问题

  1. 一步误差如何变成 planning distribution shift?
  2. 为什么平均 MSE 小仍可能 action ranking 错?
  3. Horizon 缩短解决什么,又牺牲什么?
  4. Ensemble 分歧与真实不确定性有何差距?
  5. 哪项指标最直接连接模型预测与决策质量?

专业课程对齐

  • 阅读 MuZero,思考“为 planning 学到足够模型”与完整观察重建的差异。
  • 阅读 World Models,观察 learned dynamics、controller 与模拟 rollout 的关系,为 W5 做衔接。
  • 阅读 Concrete Problems in AI Safety,把 distributional shift、safe exploration 与模型边界连接起来。

深入学习提示

不要只问模型“准不准”,要问它在哪些 action、state、horizon 上足以保持排序。可继续学习 model predictive control、Dyna-style uncertainty 或 pessimistic planning,但先画出一条具体错误传播链。若没有真实 oracle,就把结论降级为假设,并用回放或人工检查寻找反例。

学后填写区

  • 我的 action-ranking 反例:
  • 三步误差传播链:
  • Planner 访问的低覆盖区:
  • 四种缓解的取舍:
  • 无 oracle 时的证据边界:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本