返回 G01~G90 教材库
G29 · 总 Day 209教材已备 ≠ 学习已完成

G29:World Model、Latent Dynamics 与反事实地图

World model 是为预测行动后果与支持决策而学习的状态表示和动力学;它不因能生成逼真观察就自动适合规划,也不因无法重建全部像素就一定缺少任务相关结构。

2027-03-22observation→latent→transition→prediction/planningcounterfactual

内容类型:预习教材(不代表已完成)
日期:2027-03-22
阶段:P3 · AGI Foundations 90
总路线:Day 209 / 360
周次 / 节奏:W5 · 周一概念与论文
状态:教材已备;学习未完成
主题:observation→latent→transition→prediction/planning 与 counterfactual

一句话定义

World model 是为预测行动后果与支持决策而学习的状态表示和动力学;它不因能生成逼真观察就自动适合规划,也不因无法重建全部像素就一定缺少任务相关结构。

学习目标

  1. 能画出 observation encoder、latent state、transition、decoder/reward/value 与 policy/planner 的职责。
  2. 能区分 simulator、generative model、predictive model 和 task-relevant world model。
  3. 能解释一步预测、长程 rollout、counterfactual action prediction 与控制表现的关系。
  4. 能提出一个未见 action sequence 的反事实测试,并说明它不能证明完整因果理解。

核心知识

Observation 是传感器或环境给出的可见信息,可能不是完整 state。Encoder 将当前观察与历史压缩为 latent z_t;transition model 预测执行 a_t 后的 z_{t+1};observation decoder 可重建未来观察,reward/value head 预测任务相关信号;planner 在模型中比较候选 action sequence;policy 也可直接从 latent 选择动作。

Simulator 通常由已知规则实现,可在给定状态与动作后生成结果;learned world model 从数据估计规律;generative model 可能只追求样本逼真;predictive model 追求未来统计;task-relevant model 则要保留会改变 action ranking 的因素。四者有交集,但不是同义词。

反事实问题是“在相同历史条件下,如果采取另一个动作,后果会怎样”。观察数据只包含实际动作后的结果,未选动作的结果缺失;行为策略覆盖不足时,模型无法从相关性自动获得可靠反事实。Randomized toy environment 可以提供 oracle 对照,现实决策需要更谨慎的因果假设。

机制与推导

一个简化 latent model:

[ z_t=E(o_{\le t},a_{<t}),\quad \hat z_{t+1}=F(z_t,a_t),\quad \hat r_t=R(z_t,a_t),\quad \hat o_t=D(z_t) ]

给定候选动作序列 a_t:t+H-1,planner 在模型中 rollout 并最大化 Σ γ^k r̂_{t+k}。若 encoder 丢失会影响转移的隐藏变量,F 即使在训练轨迹平均准确,也会对特定历史产生多模态或偏差预测。

训练目标可能是 L = λ_o L_recon + λ_r L_reward + λ_dyn L_latent + λ_v L_value。权重改变 latent 保存的信息。像素重建占主导时,模型可能关注背景纹理;reward/value 目标占主导时,可能忽略与当前任务无关但未来 shift 重要的因素。不存在一个目标自动保证完整世界理解。

Counterfactual consistency 可在 toy simulator 中检查:固定同一 state,对每个合法 action 比较模型预测 F(z,a) 与 oracle next state。还要测试未见 action sequence,而不是只测试训练行为策略常走路径。即使全部通过,也只支持该环境和 horizon 范围。

最小练习或观察步骤

  1. 画六个模块:observation、encoder、latent、transition、reward/value、planner;标注训练信号。
  2. 为 Gridworld 选择一个与任务有关和一个无关的 observation feature,说明 encoder 应否保留。
  3. 设计实际动作 left 与未采取动作 right 的反事实查询,写出 oracle 如何提供答案。
  4. 构造“帧预测好但 action ranking 错”和“重建差但路径正确”两个反例。
  5. 列出模型在 horizon 1/3/10 需要保存的评价字段,不预填结果。

常见误区与边界

  • 把逼真视频生成直接称为具有可规划世界模型。
  • 用一步 prediction loss 推出长程 rollout 和控制可靠。
  • 训练行为只覆盖少数动作,却宣称模型掌握所有反事实。
  • 将 latent 可视化的语义标签当作因果使用证据。
  • Reward prediction 准确就认为目标正确;它只拟合给定奖励。
  • 把 toy simulator 中的 oracle 经验外推到现实开放世界。

研究/系统场景连接

金融响应模型尝试预测“若发送提醒、改变额度或不采取行动会怎样”,本质上是反事实问题。历史日志由旧策略选择,未执行动作缺少结果,容易产生 selection bias。高预测准确率可能只适用于常见动作。现实应用还涉及合规与公平,不能让 learned simulator 单独决定客户行动。

Agent 工具规划中,world model 可以是本地状态机或 learned tool outcome predictor。它帮助在执行前比较方案,但 API 版本、权限和并发会造成 dynamics shift。真实副作用动作仍需重新验证。P4 进入具身环境后,latent dynamics 还要面对连续时间、接触和传感噪声。

自检问题

  1. Generative realism 与 task-relevant planning 各优化什么?
  2. Encoder 丢失隐藏变量会怎样影响 transition?
  3. 为什么观察轨迹不足以自动识别未采取动作后果?
  4. 多目标训练权重会怎样改变 latent 信息?
  5. 一个反事实测试通过后,结论仍受哪些 horizon 与覆盖边界限制?

专业课程对齐

  • 阅读 World Models,识别 vision model、memory model 与 controller 的分工及其训练边界。
  • 阅读 DreamerV3,关注 latent imagination 如何服务多领域控制,而非只看任务数量。
  • 阅读 MuZero,比较学习完整 observation dynamics 与学习规划相关表示的差异。

深入学习提示

阅读 world-model 研究时,始终追问四个对象:训练行为覆盖了哪些 action,latent 由什么 loss 塑形,rollout 多长,最终以什么控制指标验证。可进一步研究 causal representation 或 predictive state representation,但不要把“world model”当作单一成熟组件。G30 会用 POMDP 和 belief update 把历史压缩问题具体化。

学后填写区

  • 我的 world-model 模块图:
  • 一个 task-relevant latent feature:
  • 一个未见 action 反事实:
  • 两个预测/控制分离反例:
  • 仍缺少的因果假设:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本