返回 G01~G90 教材库
G31 · 总 Day 211教材已备 ≠ 学习已完成

G31:短视野 World Model Planner 与对照实验

短视野 world-model planner 是先用学习到的状态转移模型模拟有限步行动后果,再按预测回报选择当前动作的决策器;它检验的是“模型能否支持行动排序”,而不只是下一帧是否像真。

2027-03-24world-model、pomdp、latent-dynamics、planning、counterfactual

内容类型:预习教材(不代表已完成)
日期:2027-03-24
阶段:P3 · AGI Foundations 90
总路线:Day 211 / 360
周次:W5 · World Models、反事实与长程规划
节奏:周三引导实验
状态:教材已备;学习未完成
标签:world-model、pomdp、latent-dynamics、planning、counterfactual

一句话定义

短视野 world-model planner 是先用学习到的状态转移模型模拟有限步行动后果,再按预测回报选择当前动作的决策器;它检验的是“模型能否支持行动排序”,而不只是下一帧是否像真。

学习目标

  1. 区分 observation、latent state、transition、reward/value predictor 与 planner 的职责。
  2. 从 POMDP 写出 belief update,并解释 reactive、learned-model 与 oracle-state 三种对照各隔离什么变量。
  3. 理解一步预测误差、多步 rollout 误差和 action-ranking error 不是同一个指标。
  4. 设计一个本地 toy 实验,允许结果为正、为负或混合,不预填任何表现结论。

核心知识

  • 在部分可观测环境中,真实状态 (s_t) 不直接可见,Agent 只收到 (o_t\sim O(o\mid s_t))。同一观察可能对应多个真实状态,因此仅用当前 (o_t) 的 reactive policy 容易发生 perceptual aliasing。
  • World model 可以拆为编码器 (z_t=E(o_{\le t},a_{<t}))、潜在转移 (\hat z_{t+1}=T_\theta(z_t,a_t))、奖励模型 (\hat r_t=R_\theta(z_t,a_t)) 与可选 observation decoder。用于控制时,decoder 画得逼真并非必要;能保留会改变最优动作的 task-relevant state 才关键。
  • Model predictive control 在每个时刻枚举或采样候选序列 (a_{t:t+H-1}),最大化有限视野预测回报,执行第一个动作后重新规划。Receding horizon 能用新观察纠正一部分模型漂移,但不能消除错误动力学。
  • Oracle-state planner 直接读取真实状态并使用真实转移,给出“规划与信息都正确”时的参考;reactive baseline 不建模未来;learned planner 位于两者之间。三者的差异不能被简化为“模型越复杂越聪明”。
  • 反事实问题的形式是:在同一个历史 (h_t) 下,如果动作换成 (a'),后续状态与回报如何变化。训练数据若没有覆盖 (a'),模型可能只会预测行为策略常走的轨迹,而不会回答决策需要的反事实。

机制与推导

POMDP 可写为 ((\mathcal S,\mathcal A,T,R,\Omega,O,\gamma))。若已知模型,belief 的一次更新是:

[ b_{t+1}(s') \propto O(o_{t+1}\mid s')\sum_s T(s'\mid s,a_t)b_t(s) ]

toy 实现可用离散 belief 或循环向量 (z_t) 近似它。对候选动作序列 (\mathbf a),planner 计算:

[ \hat G_H(\mathbf a)=\sum_{k=0}^{H-1}\gamma^k\hat R(\hat z_{t+k},a_{t+k}) +\gamma^H\hat V(\hat z_{t+H}),\qquad a_t^=\operatorname{argmax}_{\mathbf a}\hat G_H(\mathbf a)[0] ]

这里有两类误差。模型误差是 (\epsilon_k=d(\hat z_{t+k},z_{t+k}));决策误差则是预测排序与真实排序不一致。若最优和次优动作的真实价值差为 margin (m=Q(a^*)-Q(a^{(2)})),即便预测均方误差不大,只要两个动作的价值误差之差超过 (m),排序仍会翻转。反过来,视觉重建误差很大但与奖励无关时,行动排序可能保持正确。

多步误差也不会简单等于一步误差乘以 (H)。若转移对状态的 Lipschitz 常数近似为 (L),粗略上界可写成:

[ \epsilon_H\lesssim \sum_{i=0}^{H-1}L^i\delta_{H-i} ]

当 (L>1) 时误差可能被放大;当系统收缩或每步重规划时,实际传播可能更缓。这个上界用于理解机制,不应当作真实实验结论。

最小练习或观察步骤

  1. 构造一个 5×5 toy POMDP:两条走廊拥有相同局部观察,但一条接近奖励、一条接近陷阱。固定随机种子生成训练与观察轨迹。
  2. 准备三个接口一致的 baseline:只看当前 observation 的 reactive policy、用学习转移做 horizon (H\in{1,3,5}) 搜索的 planner、读取真实状态和转移的 oracle planner。
  3. 对 learned model 分别记录一步 transition accuracy、三步 rollout state error、候选动作 Kendall 排序相关或 top-1 action agreement,以及环境中的真实 return。
  4. 保持候选序列数量近似一致,再比较不同 horizon;否则把更多搜索预算误判为更好的世界模型。
  5. 选择训练分布未覆盖的一条 action sequence 做 counterfactual probe,并在真实环境回放其后果。只记录观察到的值和失败,不写“预期应提升”。
  6. 分别标注 R(本人小实验)、E(论文证据)与 H(尚未测试假设);toy 环境结果不得外推到开放世界 Agent。

常见误区与边界

  • 用 reconstruction loss 作为唯一成功指标,忽略模型是否保留奖励相关变量与动作条件因果结构。
  • learned planner 优于 reactive 就宣称获得“世界理解”;差异可能来自多步搜索预算、额外历史输入或更强函数逼近器。
  • oracle planner 表现差时仍归咎于 learned model;这可能说明规划算法、奖励或 horizon 本身不合适。
  • 用行为策略采集的数据训练,却把未覆盖动作的预测当作可靠反事实。
  • 只跑一个 seed、一个地图和一个 horizon,然后推广到长程规划、现实物理或 AGI。
  • 本日不要求训练大型生成视频模型,也不把规划 demo 称为自主通用智能。

研究/系统场景连接

金融零售中的还款提醒 Agent 可以把“客户状态—联系动作—响应概率—风险变化”写成小型决策模型,但历史日志主要来自既有策略,未发送过的提醒方式缺乏反事实覆盖。预测客户下一步行为准确,不等于能安全决定行动。研究上应先用合成状态机验证 action conditioning、排序和 model bias,再讨论真实数据;涉及客户权益的动作保持只读建议和人工决定。Agent 系统中同理:工具调用轨迹像 observation,隐藏业务状态像 latent state,planner 的长链计划必须通过环境反馈不断重规划,而不能相信一次性想象轨迹。

自检问题

  1. 为什么 one-step accuracy 高仍可能选择错误动作?
  2. reactive、learned-model 与 oracle-state 对照分别回答什么问题?
  3. 哪种 observation aliasing 会让当前帧不足以决定行动?
  4. horizon 增长同时改变哪些误差与计算因素?
  5. toy POMDP 结果最远可以支持到什么范围?

专业课程对齐

  • 阅读 World Models 原始论文,只追踪 encoder、dynamics 与 controller 的信息流,用它核对“可生成”与“可控制”是否被区分。
  • 对齐 Stanford CS234 中 MDP、model-based RL 与 planning 的课程脉络,复习 Bellman value、有限视野与 oracle baseline,而不把整套作业变成本日 Gate。
  • 阅读 MuZero 原始论文 对 representation、dynamics、prediction 的拆分,关注它不要求重建完整 observation 的原因。

深入学习提示

先手推两状态 POMDP 的 belief update,再实现离散 planner,最后才考虑神经 latent model。深入时可研究 uncertainty-aware rollout、ensemble disagreement 与 value bootstrap,但必须同时写明它们何时过度保守或产生虚假置信。不要以扩大网络掩盖数据覆盖问题;优先改变 observation aliasing、action support 和 horizon,观察哪条因果链真正影响决策。

学后填写区

  • 实际阅读范围:
  • 实际实现或手推范围:
  • 一步预测与行动排序的观察:
  • 一个反事实覆盖缺口:
  • 证据标签与外推边界:
  • 仍然不理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本