返回 G01~G90 教材库
G26 · 总 Day 206教材已备 ≠ 学习已完成

G26:阶段复盘一——Reactive、Model-Free 与 Model-Based

阶段复盘一把前四周的测量、scaling、search 与 RL 放进统一 Agent 接口,比较 reactive、model-free、learned-model 和 oracle-model 各自依赖什么信息、在哪类 shift 失败,而不是进行排名考试。

2027-03-19统一Agent接口、模型比较、证据边界与兴趣选择

内容类型:预习教材(不代表已完成)
日期:2027-03-19
阶段:P3 · AGI Foundations 90
总路线:Day 206 / 360
周次 / 节奏:W4 · 周五低压力阶段复盘
状态:教材已备;学习未完成
主题:统一 Agent 接口、模型比较、证据边界与兴趣选择

一句话定义

阶段复盘一把前四周的测量、scaling、search 与 RL 放进统一 Agent 接口,比较 reactive、model-free、learned-model 和 oracle-model 各自依赖什么信息、在哪类 shift 失败,而不是进行排名考试。

学习目标

  1. 能用统一 reset/act/observe/update 接口描述四类 Agent。
  2. 能比较它们在样本、计算、模型假设、适应速度和失败解释上的差异。
  3. 能串联 generality、test-time search、Bellman update、model bias 与 goal generalization。
  4. 能只记录当前理解、疑问和兴趣,不将复盘变成重做或 Gate。

核心知识

Reactive agent 直接从当前 observation 映射到 action,不显式保存长期状态或学习模型;它可能是固定规则或训练好的 policy。Model-free agent 从交互更新 value/policy,不显式建模转移。Model-based agent 学习 transition/reward 或与决策相关的 latent dynamics,再在模型中 planning。Oracle-model 只在 toy 环境作为理想参照,现实中不存在完整真值模型。

统一接口有助公平比较:所有 Agent 接收相同 observation、可用 action 和真实环境预算,输出 action 与可选诊断;环境保存轨迹。Model-based 还使用模拟 update,必须另记 compute。Reactive 可能包含大量人工规则,应把这些先验计入描述,而不是说它“没有学习成本”。

前四周形成两条主线。能力主线问系统能否跨任务、预算和 shift 有效行动;证据主线问分数由记忆、规模、搜索、模型还是 verifier 贡献。RL 引入第三条目标主线:即使能力提高,奖励 proxy 也可能让行动偏离意图。

机制与推导

可以建立对照矩阵,列为:uses history / learns Q or policy / learns dynamics / plans / real samples / simulated updates / shift sensitivity / target dependency。这不是评分表,而是机制地图。

同一 Gridworld 下,比较可写成:

[ Profile_i=(Return_{IID},Return_{P-shift},Utility_{proxy-swap},RealSteps,Updates,ModelError) ]

向量保留反转:Dyna-Q 可能在 IID 样本效率高,却在模型过时时更差;Q-learning 适应慢,但不受旧模型 replay 直接误导;oracle-model 表示规划上界,却使用现实不可得信息。不存在一个总分自然决定“更智能”。

连接 search:model-based planning 与 W3 tree search 都在内部状态展开候选,但前者状态转移由环境模型提供,后者可能是符号规则或语言 proposal。连接 scaling:更大模型可改善 transition prediction,但不保证 reward specification。连接 W1:高 return 是 performance 的一个维度,不自动说明 generality 或 autonomy。

轻量复盘只需五问:我能解释什么;哪个最小机制最有帮助;哪个反例改变直觉;证据不能支持什么;接下来更想深入哪个方向。没有运行的实验保持“教材/计划”,不填写成绩。

最小练习或观察步骤

  1. 画统一 Agent 接口,为 reactive、Q-learning、Dyna-Q、oracle-model 标出内部状态。
  2. 填机制对照矩阵,只写“使用/不使用/待理解”,不填虚构性能。
  3. 选择一个 transition shift 与一个 proxy shift,推演四类 Agent 可能出现的不同证据。
  4. 写一段不超过 200 字的阶段理解,必须含一条不能外推的边界。
  5. 选择 RL、world model 或只保留概念理解中的一个兴趣方向;选择不构成承诺。

常见误区与边界

  • 把阶段复盘当考试,要求补齐所有实验或重新跑结果。
  • Oracle-model 成绩被当作可部署方案,而不是解释性上界。
  • Reactive 被简单等同于“弱”,忽略窄任务上它可能更可靠。
  • Model-based 样本效率高就忽略额外 compute 与模型偏差。
  • 将 reward 高、能力泛化和目标正确合并成一个成功标签。
  • 因为仍有疑问就判定前四周没有学习价值。

研究/系统场景连接

金融业务经常组合四种机制:固定规则快速拦截、统计策略评分、响应模型模拟、人工审核提供最终边界。统一接口帮助说明责任和信息来源,却不要求所有组件被一个 Agent 替代。尤其 oracle 只存在于合成环境;现实“真实客户反应”永远受隐藏变量影响。

Agent runtime 可以同时含 reactive safety policy、model-free routing 与 model-based planner。能力模块越多,权限和审计越重要。复盘中应把“系统会什么”与“系统可以做什么”分开,为 W11 control 留下接口。

自检问题

  1. 四类 Agent 的核心信息差异是什么?
  2. Dyna-Q 在 shift 下为什么可能比 model-free 更慢恢复?
  3. Oracle baseline 的解释价值与现实边界是什么?
  4. Search planning 与 learned-model planning 的转移来源有何不同?
  5. 复盘后哪个问题仍标为 C/H

专业课程对齐

深入学习提示

如果某个概念仍模糊,只回看一条手推轨迹:Q update、model update、planning update 各使用什么证据。不要补做整周任务。下一周进入 world model 与 POMDP;最自然的衔接问题是:如果 observation 不等于 state,Agent 要如何形成 belief,模型误差又怎样随 horizon 累积?

学后填写区

  • 我的统一 Agent 接口:
  • 机制对照中最清楚的一列:
  • 最反直觉的失败案例:
  • 当前不能外推的结论:
  • 下一步兴趣(可变更):
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本