返回 G01~G90 教材库
G87 · 总 Day 267教材已备 ≠ 学习已完成

G87:论文链路二:RL → World Model → Memory/Tool → Continual Learning

这条链描述 Agent 如何从奖励下的序列决策,经学习动力学与规划、跨时间记忆和工具执行,再到任务流中的持续适应,同时暴露误差如何沿时间累积。

2027-05-19

内容类型:知识整合教材(不代表已完成)
日期:2027-05-19
阶段:P3 · AGI Foundations 90
总路线:Day 267
周次节奏:知识整合 · 周三机制连接
状态:教材已备;学习未完成

一句话定义

这条链描述 Agent 如何从奖励下的序列决策,经学习动力学与规划、跨时间记忆和工具执行,再到任务流中的持续适应,同时暴露误差如何沿时间累积。

学习目标

  1. 将 model-free policy、learned dynamics、belief/memory、tool action 与 parameter update 放到不同时间尺度。
  2. 推导 model error、planning horizon、replanning 与 action failure 的关系。
  3. 连接 continual learning 的 stability–plasticity 与部署控制,避免在线适应破坏安全边界。

核心知识

RL 把问题写成状态、动作、转移、奖励与折扣;model-free 方法直接学习 value/policy,model-based 方法学习或使用 dynamics 做 rollout。World model 可压缩观察并预测未来,但预测准确不自动等于控制有用:误差可能落在无关维度,或小状态偏差在临界动作处造成大失败。

部分可观测环境下,当前 observation 不等于 state。Memory 可保存历史,belief state 表示对隐藏状态的分布;tool 则把 Agent 作用扩展到外部可执行接口。External memory 的读取失败、过期与污染不同于参数遗忘;tool failure、timeout 与幂等也不同于策略错误。统一称“Agent 不记得/不会做”会失去诊断性。

Continual learning 在任务流中更新参数,面临 stability–plasticity:适应新任务可能忘记旧能力。Replay 用旧样本约束,EWC 等正则保护重要参数,meta-learning 学快速适应先验。方法排序依赖任务相似度、buffer、顺序与评价协议,不能用单一平均最终分决定。

跨时间尺度尤其重要:controller 可能毫秒级,planner 秒级,memory episode 级,parameter update 小时/天级。让模型每步在线改参数可能破坏已验证策略;更稳妥的系统通常先写 episode memory,在离线审批流程中更新模型,再重新评估。

机制与推导

Learned dynamics ŝ_{t+1}=f_θ(ŝ_t,a_t) 的单步误差 (ε_t) 会随 rollout 递推:

||e_{t+1}|| ≤ L_f ||e_t|| + ε_t

若 Lipschitz 常数 (L_f>1),open-loop horizon 增长会放大误差;receding-horizon planning 每步用新观察校正,能截断一部分漂移,但受 observation noise 和计算延迟影响。

Belief 更新概念式:b_{t+1}(s') ∝ O(o_{t+1}|s') Σ_s T(s'|s,a_t)b_t(s)。文本 memory retrieval 只是 belief 的一种近似辅助,不能保证概率一致或最新。

Continual 指标需同时看:plasticity = new-task gainforgetting_i = max_t perf_i(t)-perf_i(final)forward transfer 与资源成本。一个方法新任务学得快但旧任务严重下降,不可只报最终平均。在线更新进入 control 时还需 constraint:deploy(θ_{new}) only after offline eval + permission unchanged

最小练习或观察步骤

  1. 画四个时间尺度:control、planning、episodic memory、parameter learning,并标每层输入输出。
  2. L_f=1.1 和固定 ε,手算 1、5、10 步误差上界;再写 replanning 如何改变递推。
  3. 构造 hidden-state toy:同一 observation 对应两个状态,比较无 memory、最近一步 memory 与 belief table。
  4. 设计两任务顺序 A→B 与 B→A,列 no replay、replay、EWC 的 plasticity/forgetting 空表。
  5. 写一个在线适应控制协议:允许记什么、何时更新、谁批准、什么 eval 后部署。

常见误区与边界

  • World model 像真视频就称能可靠规划,没有测 action-sensitive error。
  • Memory retrieval 命中就称 belief 正确,忽略过期与冲突证据。
  • Tool 调用成功率高就忽略权限、超时和不可逆影响。
  • Continual 最终平均分高就隐藏旧任务遗忘和顺序敏感。
  • 在线参数更新自动发布,破坏已验证控制与可重放性。

研究/系统场景连接

金融案件 Agent 的 episode memory 可保存经批准的案件状态,参数更新应离线;world model 可用于流程预测但不能替代真实账务状态。Web3 action 必须经独立链状态和签名确认。P4 中 belief 变成传感器融合,world model 受连续动力学和接触影响,memory timestamp、control latency 与 safety controller 成为一等变量。

自检问题

  1. Model-free 与 model-based 方法的主要误差来源怎样不同?
  2. Replanning 为什么只能缓解而不能消除 model error?
  3. Episodic memory 与 parameter learning 的风险为何不同?
  4. Continual learning 如何与部署权限保持解耦?

专业课程对齐

深入学习提示

将“Agent 跨时间行动”拆成四个时钟,并问误差在哪个时钟产生、多久被观测、谁能纠正。进入具身前,最值得带走的不是某个算法,而是 error propagation 与 feedback correction 的思维。

学后填写区

  • 四时间尺度图:
  • Rollout error 推导:
  • Belief/memory toy:
  • Stability–plasticity 表:
  • 在线适应控制边界:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本