G34:Task-Relevant World Model 的边界与反事实检验
Task-relevant world model 只承诺为明确任务、奖励、动作与环境范围保存足够的动力学信息;它能否回答未执行动作的反事实,必须由干预式测试而不是逼真生成来判断。
内容类型:预习教材(不代表已完成)
日期:2027-03-27
阶段:P3 · AGI Foundations 90
总路线:Day 214 / 360
周次:W5 · World Models、反事实与长程规划
节奏:周六可选探索
状态:教材已备;学习未完成
标签:world-model、counterfactual、causal-state、planning-boundary、epistemology
一句话定义
Task-relevant world model 只承诺为明确任务、奖励、动作与环境范围保存足够的动力学信息;它能否回答未执行动作的反事实,必须由干预式测试而不是逼真生成来判断。
学习目标
- 区分 simulator、generative model、predictive model 与用于控制的 task model。
- 理解 Markov sufficient state、causal state 与 reward-relative abstraction 的条件性。
- 设计未见 action sequence、环境结构变化和奖励变化三类外推测试。
- 用研究认识论说明哪些主张可由 toy 证据支持,哪些只能保持为假设。
核心知识
- Simulator 可以按规则生成轨迹,但未必学习自数据;generative model 能产生高似真样本,但未必尊重动作条件动力学;predictive model 可在观测分布上预测,却未必支持干预;world model 一词若不说明用途,容易把四者混在一起。
- 对给定决策问题,表示 (z=\phi(h)) 若使未来 reward-relevant distribution 在条件 (z,a) 下不再依赖完整历史,可视为任务充分状态。改变 reward、action space 或 intervention family 后,原表示可能不再充分。
- 观察数据识别的是行为策略分布下的条件关系。要回答 (do(a')) 反事实,需要动作覆盖、环境随机化、已知机制或额外因果假设;语言模型生成一段合理故事不提供识别保证。
- Long-horizon planning 同时依赖局部动力学、价值 bootstrap、搜索覆盖和停止条件。一个 horizon 内有效的 abstraction 可能在更长 horizon 丢失慢变量。
- “世界模型”应伴随 model card 式边界:训练分布、支持的动作、视野、已测 shift、uncertainty signal 与禁止用途。边界不是削弱成果,而是让主张可证伪。
机制与推导
令历史为 (h_t=(o_1,a_1,\ldots,o_t)),压缩表示 (z_t=\phi(h_t))。相对于奖励 (R) 和策略集合 (\Pi),一种任务充分条件是对所有 (\pi\in\Pi):
[ P(R_{t:t+H},o_{t+1:t+H}\mid h_t,do(\pi)) \approx P(R_{t:t+H},o_{t+1:t+H}\mid z_t,do(\pi)) ]
这个条件明确包含 intervention 与 horizon。只验证行为策略 (\mu) 下的:
[ P(o_{t+1}\mid h_t,a_t\sim\mu) ]
不能自动推广到另一个策略。若训练数据中 (a=B) 只在低风险状态出现,模型可能把动作 B 与安全结果相关联;planner 在高风险状态选择 B 时就越过支持集。
可以用 importance ratio (w=\pi(a\mid s)/\mu(a\mid s)) 粗略发现 policy shift,但当 (\mu(a\mid s)=0) 时比率无定义,离线数据无法识别该动作后果。此时最诚实的输出是“不知道”,而不是平滑外推。
再构造慢变量反例:电池健康每十步下降一次,短 horizon 内 observation 与 reward 几乎不受影响。只为 (H=3) 学到的表示可能丢掉健康状态,在 (H=30) 规划时持续透支。于是“足够状态”必须写明 horizon 与目标。
最小练习或观察步骤
- 为现有 toy model 写一张边界表:observation、action、reward、训练轨迹策略、最大验证 horizon、随机性与未覆盖状态。
- 准备三类 split:相同地图的未见动作序列、同一动作但改变门/障碍结构、保持动力学却更换 reward location。
- 在每类 split 上比较 one-step prediction、counterfactual action outcome、action ranking 和 regret;不要求全部实现,可先手工构造一个可证伪反例。
- 增加拒绝机制:当候选序列含低覆盖 state-action 时返回
unknown或缩短 horizon,观察覆盖率与错误风险的取舍。 - 做一次 reward change:不重新训练 representation,只替换 reward head 或 planner 目标,检查旧 latent 是否仍包含必要变量。
- 写出最强可支持主张、一个不能支持的主张、一个后续可验证假设;不要用“接近 AGI”描述任何结果。
常见误区与边界
- 把视频真实感、pixel reconstruction 或语言连贯性当成动力学与干预有效性的替代指标。
- 以相同环境的新 seed 叫作 OOD,却没有改变机制、组合、策略或支持集。
- 在行为数据无动作重叠时仍报告精确反事实,隐藏不可识别性。
- 一个 reward 上的 task-relevant representation 被当成通用世界状态。
- 拒绝率上升后只看剩余样本 accuracy,不报告 coverage,制造选择性漂亮结果。
- toy 反事实检验只证明实现范围内的机制现象,不证明现实客户、社会系统或物理世界可被完整模拟。
研究/系统场景连接
金融压力测试常用情景模型,但宏观政策变化、客户反应与机构行为存在反馈,历史相关性无法直接回答所有干预。可以将 task model 用于教育性 toy 情景:例如固定规则下观察还款计划如何改变现金流;不能把它升级为自动权益决策。Agent 系统也应给 world model 设置 action allowlist、horizon 与 uncertainty boundary:对只读 API 可模拟多个步骤,对资金、凭证或外部写操作必须停在计划建议并等待独立授权。
自检问题
- 生成模型、预测模型与控制模型为何不能由一个“逼真度”指标排序?
- task-relevant 中的 task 至少包含哪些变量?
- 行为策略没有覆盖某动作时,反事实为何可能不可识别?
- horizon 改变为何会使原来的充分状态失效?
- 拒绝机制的准确率必须与哪个指标一起报告?
专业课程对齐
- 阅读 Genie 研究页面,区分从视频学习可控环境的研究证据与对开放世界可靠性的更强主张。
- 阅读 World Models 原始论文,列出它的环境、控制器与评估边界,练习不越过论文实际实验范围。
- 对齐 Berkeley CS285 的 offline RL 与 model-based RL 主题,关注 distribution shift、action support 和 pessimism 的联系。
深入学习提示
进一步可阅读 causal state representation、bisimulation 与 offline model-based RL。每遇到“模型学会世界”的说法,改写成五元组:在哪个环境、哪些动作、哪个 horizon、什么评价、哪些 shift。若五项说不清,先把它标为宽泛叙事。探索可以停在概念与反例,不要求把所有方法实现成新 Gate。
学后填写区
- 本人实际定义的任务五元组:
- 完成或手推的反事实测试:
- 模型拒绝或低覆盖区域:
- 最强可支持主张:
- 明确不能支持的主张:
- 后续假设: