G87:论文链路二:RL → World Model → Memory/Tool → Continual Learning
这条链描述 Agent 如何从奖励下的序列决策,经学习动力学与规划、跨时间记忆和工具执行,再到任务流中的持续适应,同时暴露误差如何沿时间累积。
内容类型:知识整合教材(不代表已完成)
日期:2027-05-19
阶段:P3 · AGI Foundations 90
总路线:Day 267
周次节奏:知识整合 · 周三机制连接
状态:教材已备;学习未完成
一句话定义
这条链描述 Agent 如何从奖励下的序列决策,经学习动力学与规划、跨时间记忆和工具执行,再到任务流中的持续适应,同时暴露误差如何沿时间累积。
学习目标
- 将 model-free policy、learned dynamics、belief/memory、tool action 与 parameter update 放到不同时间尺度。
- 推导 model error、planning horizon、replanning 与 action failure 的关系。
- 连接 continual learning 的 stability–plasticity 与部署控制,避免在线适应破坏安全边界。
核心知识
RL 把问题写成状态、动作、转移、奖励与折扣;model-free 方法直接学习 value/policy,model-based 方法学习或使用 dynamics 做 rollout。World model 可压缩观察并预测未来,但预测准确不自动等于控制有用:误差可能落在无关维度,或小状态偏差在临界动作处造成大失败。
部分可观测环境下,当前 observation 不等于 state。Memory 可保存历史,belief state 表示对隐藏状态的分布;tool 则把 Agent 作用扩展到外部可执行接口。External memory 的读取失败、过期与污染不同于参数遗忘;tool failure、timeout 与幂等也不同于策略错误。统一称“Agent 不记得/不会做”会失去诊断性。
Continual learning 在任务流中更新参数,面临 stability–plasticity:适应新任务可能忘记旧能力。Replay 用旧样本约束,EWC 等正则保护重要参数,meta-learning 学快速适应先验。方法排序依赖任务相似度、buffer、顺序与评价协议,不能用单一平均最终分决定。
跨时间尺度尤其重要:controller 可能毫秒级,planner 秒级,memory episode 级,parameter update 小时/天级。让模型每步在线改参数可能破坏已验证策略;更稳妥的系统通常先写 episode memory,在离线审批流程中更新模型,再重新评估。
机制与推导
Learned dynamics ŝ_{t+1}=f_θ(ŝ_t,a_t) 的单步误差 (ε_t) 会随 rollout 递推:
||e_{t+1}|| ≤ L_f ||e_t|| + ε_t
若 Lipschitz 常数 (L_f>1),open-loop horizon 增长会放大误差;receding-horizon planning 每步用新观察校正,能截断一部分漂移,但受 observation noise 和计算延迟影响。
Belief 更新概念式:b_{t+1}(s') ∝ O(o_{t+1}|s') Σ_s T(s'|s,a_t)b_t(s)。文本 memory retrieval 只是 belief 的一种近似辅助,不能保证概率一致或最新。
Continual 指标需同时看:plasticity = new-task gain,forgetting_i = max_t perf_i(t)-perf_i(final),forward transfer 与资源成本。一个方法新任务学得快但旧任务严重下降,不可只报最终平均。在线更新进入 control 时还需 constraint:deploy(θ_{new}) only after offline eval + permission unchanged。
最小练习或观察步骤
- 画四个时间尺度:control、planning、episodic memory、parameter learning,并标每层输入输出。
- 取
L_f=1.1和固定 ε,手算 1、5、10 步误差上界;再写 replanning 如何改变递推。 - 构造 hidden-state toy:同一 observation 对应两个状态,比较无 memory、最近一步 memory 与 belief table。
- 设计两任务顺序 A→B 与 B→A,列 no replay、replay、EWC 的 plasticity/forgetting 空表。
- 写一个在线适应控制协议:允许记什么、何时更新、谁批准、什么 eval 后部署。
常见误区与边界
- World model 像真视频就称能可靠规划,没有测 action-sensitive error。
- Memory retrieval 命中就称 belief 正确,忽略过期与冲突证据。
- Tool 调用成功率高就忽略权限、超时和不可逆影响。
- Continual 最终平均分高就隐藏旧任务遗忘和顺序敏感。
- 在线参数更新自动发布,破坏已验证控制与可重放性。
研究/系统场景连接
金融案件 Agent 的 episode memory 可保存经批准的案件状态,参数更新应离线;world model 可用于流程预测但不能替代真实账务状态。Web3 action 必须经独立链状态和签名确认。P4 中 belief 变成传感器融合,world model 受连续动力学和接触影响,memory timestamp、control latency 与 safety controller 成为一等变量。
自检问题
- Model-free 与 model-based 方法的主要误差来源怎样不同?
- Replanning 为什么只能缓解而不能消除 model error?
- Episodic memory 与 parameter learning 的风险为何不同?
- Continual learning 如何与部署权限保持解耦?
专业课程对齐
- World Models:理解 representation、dynamics 与 controller 的分工,明确 toy/游戏证据的范围。
- Stanford CS234: Reinforcement Learning:回看 MDP、planning、model-based RL、exploration 与评价基础,为机制链提供正式语言。
- Overcoming Catastrophic Forgetting in Neural Networks:理解 EWC 的稳定性假设与实验设置,和 replay/任务顺序作条件式比较。
深入学习提示
将“Agent 跨时间行动”拆成四个时钟,并问误差在哪个时钟产生、多久被观测、谁能纠正。进入具身前,最值得带走的不是某个算法,而是 error propagation 与 feedback correction 的思维。
学后填写区
- 四时间尺度图:
- Rollout error 推导:
- Belief/memory toy:
- Stability–plasticity 表:
- 在线适应控制边界: