返回 G01~G90 教材库
G32 · 总 Day 212教材已备 ≠ 学习已完成

G32:Rollout Error、随机动力学与 Observation Aliasing

Rollout error 是模型在反复消费自身预测时产生的多步偏差,而随机动力学与 observation aliasing 会让“单条预测不准”同时包含不可约随机性、状态信息缺失和可修复模型偏差三种不同原因。

2027-03-25rollout-error、stochastic-dynamics、aliasing、uncertainty、model-bias

内容类型:预习教材(不代表已完成)
日期:2027-03-25
阶段:P3 · AGI Foundations 90
总路线:Day 212 / 360
周次:W5 · World Models、反事实与长程规划
节奏:周四争议与失败案例
状态:教材已备;学习未完成
标签:rollout-error、stochastic-dynamics、aliasing、uncertainty、model-bias

一句话定义

Rollout error 是模型在反复消费自身预测时产生的多步偏差,而随机动力学与 observation aliasing 会让“单条预测不准”同时包含不可约随机性、状态信息缺失和可修复模型偏差三种不同原因。

学习目标

  1. 把 aleatoric uncertainty、epistemic uncertainty 与 partial observability 分开讨论。
  2. 推导 teacher-forced 一步误差为何不能代表 free-running 多步误差。
  3. 设计 horizon、随机性和 aliasing 的正交扰动,观察误差如何传到 action ranking。
  4. 学会寻找支持、反对和尚未知证据,而不是预设 world model 必然改善规划。

核心知识

  • 训练 transition model 时通常输入真实 (z_t),测试 rollout 时第 (k) 步却输入自己的 (\hat z_{t+k})。这种输入分布偏移使局部误差进入下一步,再改变后续模型所见状态。
  • 随机环境的真实转移是分布 (T(s'\mid s,a)),用均方误差训练的点预测往往接近条件均值。对多峰结果,均值可能根本不是有效状态;“预测模糊”不必然说明训练不足。
  • Observation aliasing 指不同隐藏状态产生相同观察:(O(o\mid s_1)=O(o\mid s_2))。若它们对同一动作的后果不同,任何无记忆策略都存在信息论限制。增加模型参数无法恢复从未提供的信息。
  • Epistemic uncertainty 来自有限数据与模型未知,可借助 ensemble、posterior approximation 或 coverage 指标粗略估计;aleatoric uncertainty 是环境固有随机性,更多同分布数据只能更准确描述其分布,不能消除结果随机。
  • Planner 关心的是候选动作的期望效用、风险与排序。一个模型可以校准地表达宽分布,却在点预测误差上不漂亮;另一个模型的一步 RMSE 更低,却因遗漏尾部风险而做出危险选择。

机制与推导

令真实动力学 (z_{t+1}=f(z_t,a_t)+\eta_t),学习模型为 (\hat f)。free-running 误差为:

[ e_{t+1}=\hat f(\hat z_t,a_t)-f(z_t,a_t)-\eta_t ]

加减 (\hat f(z_t,a_t)) 后,可分为 propagated error、model bias 与 noise:

[ e_{t+1}=[\hat f(\hat z_t,a_t)-\hat f(z_t,a_t)] +[\hat f(z_t,a_t)-f(z_t,a_t)]-\eta_t ]

第一项只在模型消费自身预测时出现;若局部 Jacobian 的谱范数大,微小误差会扩张。第二项是系统性模型偏差;第三项是单条轨迹上不可提前知道的噪声。用单一 RMSE 把三项混在一起,就无法知道应增加历史、改变 loss、补数据还是输出分布。

对 aliased observation,belief 是充分统计量而 observation 不是。若 (o_t) 同时兼容 (s_A,s_B),则动作价值应按 belief 加权:

[ Q(b_t,a)=\sum_s b_t(s)\left[R(s,a)+\gamma\sum_{s'}T(s'\mid s,a)V(b_{t+1})\right] ]

仅以 (o_t) 代替 (b_t) 等于把两个条件分布合并。可构造反例:两条外观相同的走廊,只有之前看到的路标能决定下一路口左转还是右转;无记忆模型无论训练多久都最多依赖数据频率猜测。

规划误差应额外看 regret:

[ \text{regret}=Q_{env}(s,a^*)-Q_{env}(s,\hat a) ]

其中 (a^*) 来自 oracle,(\hat a) 来自 learned model。它比“动作是否相同”更细,因为两个不同动作可能价值接近;也不能只报平均 regret,因为稀有灾难状态可能被淹没。

最小练习或观察步骤

  1. 复用 toy POMDP,分别设置确定转移与以概率 (p\in{0,0.1,0.3}) 滑向相邻格的随机转移。
  2. 单独控制 aliasing:完整坐标、只见局部墙形、局部墙形加最近两步历史。不要同时修改模型容量。
  3. 对每种设置比较 teacher-forced one-step loss、free-running (H=1,3,5,10) loss、状态分布校准、action agreement 与 regret。
  4. 为点预测模型增加一个输出 categorical transition distribution 的版本,检查点均值和分布预测在多峰状态上的差别。
  5. 按训练访问频率划分常见与稀有状态;检查平均误差是否隐藏低覆盖区间的 planner failure。
  6. 在实验前写出两个相反假设,例如“H 增长使误差单调变坏”与“replanning 在新观察下抑制误差”,然后允许两者都只在部分条件成立。

常见误区与边界

  • 把环境随机结果与模型“幻觉”混为一谈,要求模型精确命中不可预测的单次抽样。
  • 看到 ensemble disagreement 小就认为模型正确;成员可能共享数据盲区和归纳偏置。
  • 只在模型行为策略覆盖的轨迹测误差,忽略 planner 会提出分布外动作序列。
  • 用更长历史改善 aliasing 后,把收益全部归因于更大网络,而不承认新增信息。
  • 以平均一步 loss 选择模型,却不看 action margin、regret、tail state 和 calibration。
  • toy 随机网格只能演示误差结构,不能证明视频 world model、经济环境或现实机器人动力学的可靠性。

研究/系统场景连接

在授信或流失干预场景中,两个客户可能拥有相同当前摘要,却处于不同历史路径;把摘要当完整状态会造成 aliasing。政策改变还会使动作数据偏离历史分布,反事实 rollout 更不可靠。学习重点是认识“模型缺信息”和“模型拟合差”需要不同修复:前者可能要补事件历史或维持 belief,后者才可能通过覆盖与建模改善。生产系统不应用离线 world model 自动改变客户权益;它至多生成有不确定性说明的情景分析,并由规则与人类决定。

自检问题

  1. teacher forcing 与 free-running 的输入分布有何不同?
  2. 如何区分不可约随机性、模型未知与 observation aliasing?
  3. 为什么 categorical transition 可能比条件均值更适合规划?
  4. action agreement 与 regret 各遗漏什么信息?
  5. 哪种结果会反驳“horizon 越长必然越差”的简单主张?

专业课程对齐

  • 阅读 DreamerV3 原始论文 的 latent imagination 与 actor-critic 关系,重点问 imagined trajectory 如何承受模型偏差,而非复现其大规模结果。
  • 对齐 Berkeley CS285 Deep Reinforcement Learning 中 model-based RL、uncertainty 与 planning 内容,挑选与本 toy 分解直接相关的讲义。
  • 回看 World Models 原始论文 的 rollout 方式,区分训练时观察序列与 controller 在模型内运行时的分布。

深入学习提示

可以进一步画 calibration curve、比较 ensemble disagreement 与真实误差的相关性,或用 scheduled sampling 观察暴露偏差是否变化。但不要把某个技巧的局部改善写成“解决 compounding error”。真正深入的问题是:哪些误差方向会改变决策边界,哪些只是无关像素;哪些不确定性能被数据缩小,哪些来自任务本身。

学后填写区

  • 实际完成的扰动组合:
  • teacher-forced 与 free-running 的差异:
  • 随机性、未知与 aliasing 的区分:
  • 一个 tail failure 或未出现现象:
  • 可支持与不可外推的结论:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本