G29:World Model、Latent Dynamics 与反事实地图
World model 是为预测行动后果与支持决策而学习的状态表示和动力学;它不因能生成逼真观察就自动适合规划,也不因无法重建全部像素就一定缺少任务相关结构。
内容类型:预习教材(不代表已完成)
日期:2027-03-22
阶段:P3 · AGI Foundations 90
总路线:Day 209 / 360
周次 / 节奏:W5 · 周一概念与论文
状态:教材已备;学习未完成
主题:observation→latent→transition→prediction/planning 与 counterfactual
一句话定义
World model 是为预测行动后果与支持决策而学习的状态表示和动力学;它不因能生成逼真观察就自动适合规划,也不因无法重建全部像素就一定缺少任务相关结构。
学习目标
- 能画出 observation encoder、latent state、transition、decoder/reward/value 与 policy/planner 的职责。
- 能区分 simulator、generative model、predictive model 和 task-relevant world model。
- 能解释一步预测、长程 rollout、counterfactual action prediction 与控制表现的关系。
- 能提出一个未见 action sequence 的反事实测试,并说明它不能证明完整因果理解。
核心知识
Observation 是传感器或环境给出的可见信息,可能不是完整 state。Encoder 将当前观察与历史压缩为 latent z_t;transition model 预测执行 a_t 后的 z_{t+1};observation decoder 可重建未来观察,reward/value head 预测任务相关信号;planner 在模型中比较候选 action sequence;policy 也可直接从 latent 选择动作。
Simulator 通常由已知规则实现,可在给定状态与动作后生成结果;learned world model 从数据估计规律;generative model 可能只追求样本逼真;predictive model 追求未来统计;task-relevant model 则要保留会改变 action ranking 的因素。四者有交集,但不是同义词。
反事实问题是“在相同历史条件下,如果采取另一个动作,后果会怎样”。观察数据只包含实际动作后的结果,未选动作的结果缺失;行为策略覆盖不足时,模型无法从相关性自动获得可靠反事实。Randomized toy environment 可以提供 oracle 对照,现实决策需要更谨慎的因果假设。
机制与推导
一个简化 latent model:
[ z_t=E(o_{\le t},a_{<t}),\quad \hat z_{t+1}=F(z_t,a_t),\quad \hat r_t=R(z_t,a_t),\quad \hat o_t=D(z_t) ]
给定候选动作序列 a_t:t+H-1,planner 在模型中 rollout 并最大化 Σ γ^k r̂_{t+k}。若 encoder 丢失会影响转移的隐藏变量,F 即使在训练轨迹平均准确,也会对特定历史产生多模态或偏差预测。
训练目标可能是 L = λ_o L_recon + λ_r L_reward + λ_dyn L_latent + λ_v L_value。权重改变 latent 保存的信息。像素重建占主导时,模型可能关注背景纹理;reward/value 目标占主导时,可能忽略与当前任务无关但未来 shift 重要的因素。不存在一个目标自动保证完整世界理解。
Counterfactual consistency 可在 toy simulator 中检查:固定同一 state,对每个合法 action 比较模型预测 F(z,a) 与 oracle next state。还要测试未见 action sequence,而不是只测试训练行为策略常走路径。即使全部通过,也只支持该环境和 horizon 范围。
最小练习或观察步骤
- 画六个模块:observation、encoder、latent、transition、reward/value、planner;标注训练信号。
- 为 Gridworld 选择一个与任务有关和一个无关的 observation feature,说明 encoder 应否保留。
- 设计实际动作
left与未采取动作right的反事实查询,写出 oracle 如何提供答案。 - 构造“帧预测好但 action ranking 错”和“重建差但路径正确”两个反例。
- 列出模型在 horizon 1/3/10 需要保存的评价字段,不预填结果。
常见误区与边界
- 把逼真视频生成直接称为具有可规划世界模型。
- 用一步 prediction loss 推出长程 rollout 和控制可靠。
- 训练行为只覆盖少数动作,却宣称模型掌握所有反事实。
- 将 latent 可视化的语义标签当作因果使用证据。
- Reward prediction 准确就认为目标正确;它只拟合给定奖励。
- 把 toy simulator 中的 oracle 经验外推到现实开放世界。
研究/系统场景连接
金融响应模型尝试预测“若发送提醒、改变额度或不采取行动会怎样”,本质上是反事实问题。历史日志由旧策略选择,未执行动作缺少结果,容易产生 selection bias。高预测准确率可能只适用于常见动作。现实应用还涉及合规与公平,不能让 learned simulator 单独决定客户行动。
Agent 工具规划中,world model 可以是本地状态机或 learned tool outcome predictor。它帮助在执行前比较方案,但 API 版本、权限和并发会造成 dynamics shift。真实副作用动作仍需重新验证。P4 进入具身环境后,latent dynamics 还要面对连续时间、接触和传感噪声。
自检问题
- Generative realism 与 task-relevant planning 各优化什么?
- Encoder 丢失隐藏变量会怎样影响 transition?
- 为什么观察轨迹不足以自动识别未采取动作后果?
- 多目标训练权重会怎样改变 latent 信息?
- 一个反事实测试通过后,结论仍受哪些 horizon 与覆盖边界限制?
专业课程对齐
- 阅读 World Models,识别 vision model、memory model 与 controller 的分工及其训练边界。
- 阅读 DreamerV3,关注 latent imagination 如何服务多领域控制,而非只看任务数量。
- 阅读 MuZero,比较学习完整 observation dynamics 与学习规划相关表示的差异。
深入学习提示
阅读 world-model 研究时,始终追问四个对象:训练行为覆盖了哪些 action,latent 由什么 loss 塑形,rollout 多长,最终以什么控制指标验证。可进一步研究 causal representation 或 predictive state representation,但不要把“world model”当作单一成熟组件。G30 会用 POMDP 和 belief update 把历史压缩问题具体化。
学后填写区
- 我的 world-model 模块图:
- 一个 task-relevant latent feature:
- 一个未见 action 反事实:
- 两个预测/控制分离反例:
- 仍缺少的因果假设: