G26:阶段复盘一——Reactive、Model-Free 与 Model-Based
阶段复盘一把前四周的测量、scaling、search 与 RL 放进统一 Agent 接口,比较 reactive、model-free、learned-model 和 oracle-model 各自依赖什么信息、在哪类 shift 失败,而不是进行排名考试。
内容类型:预习教材(不代表已完成)
日期:2027-03-19
阶段:P3 · AGI Foundations 90
总路线:Day 206 / 360
周次 / 节奏:W4 · 周五低压力阶段复盘
状态:教材已备;学习未完成
主题:统一 Agent 接口、模型比较、证据边界与兴趣选择
一句话定义
阶段复盘一把前四周的测量、scaling、search 与 RL 放进统一 Agent 接口,比较 reactive、model-free、learned-model 和 oracle-model 各自依赖什么信息、在哪类 shift 失败,而不是进行排名考试。
学习目标
- 能用统一
reset/act/observe/update接口描述四类 Agent。 - 能比较它们在样本、计算、模型假设、适应速度和失败解释上的差异。
- 能串联 generality、test-time search、Bellman update、model bias 与 goal generalization。
- 能只记录当前理解、疑问和兴趣,不将复盘变成重做或 Gate。
核心知识
Reactive agent 直接从当前 observation 映射到 action,不显式保存长期状态或学习模型;它可能是固定规则或训练好的 policy。Model-free agent 从交互更新 value/policy,不显式建模转移。Model-based agent 学习 transition/reward 或与决策相关的 latent dynamics,再在模型中 planning。Oracle-model 只在 toy 环境作为理想参照,现实中不存在完整真值模型。
统一接口有助公平比较:所有 Agent 接收相同 observation、可用 action 和真实环境预算,输出 action 与可选诊断;环境保存轨迹。Model-based 还使用模拟 update,必须另记 compute。Reactive 可能包含大量人工规则,应把这些先验计入描述,而不是说它“没有学习成本”。
前四周形成两条主线。能力主线问系统能否跨任务、预算和 shift 有效行动;证据主线问分数由记忆、规模、搜索、模型还是 verifier 贡献。RL 引入第三条目标主线:即使能力提高,奖励 proxy 也可能让行动偏离意图。
机制与推导
可以建立对照矩阵,列为:uses history / learns Q or policy / learns dynamics / plans / real samples / simulated updates / shift sensitivity / target dependency。这不是评分表,而是机制地图。
同一 Gridworld 下,比较可写成:
[ Profile_i=(Return_{IID},Return_{P-shift},Utility_{proxy-swap},RealSteps,Updates,ModelError) ]
向量保留反转:Dyna-Q 可能在 IID 样本效率高,却在模型过时时更差;Q-learning 适应慢,但不受旧模型 replay 直接误导;oracle-model 表示规划上界,却使用现实不可得信息。不存在一个总分自然决定“更智能”。
连接 search:model-based planning 与 W3 tree search 都在内部状态展开候选,但前者状态转移由环境模型提供,后者可能是符号规则或语言 proposal。连接 scaling:更大模型可改善 transition prediction,但不保证 reward specification。连接 W1:高 return 是 performance 的一个维度,不自动说明 generality 或 autonomy。
轻量复盘只需五问:我能解释什么;哪个最小机制最有帮助;哪个反例改变直觉;证据不能支持什么;接下来更想深入哪个方向。没有运行的实验保持“教材/计划”,不填写成绩。
最小练习或观察步骤
- 画统一 Agent 接口,为 reactive、Q-learning、Dyna-Q、oracle-model 标出内部状态。
- 填机制对照矩阵,只写“使用/不使用/待理解”,不填虚构性能。
- 选择一个 transition shift 与一个 proxy shift,推演四类 Agent 可能出现的不同证据。
- 写一段不超过 200 字的阶段理解,必须含一条不能外推的边界。
- 选择 RL、world model 或只保留概念理解中的一个兴趣方向;选择不构成承诺。
常见误区与边界
- 把阶段复盘当考试,要求补齐所有实验或重新跑结果。
- Oracle-model 成绩被当作可部署方案,而不是解释性上界。
- Reactive 被简单等同于“弱”,忽略窄任务上它可能更可靠。
- Model-based 样本效率高就忽略额外 compute 与模型偏差。
- 将 reward 高、能力泛化和目标正确合并成一个成功标签。
- 因为仍有疑问就判定前四周没有学习价值。
研究/系统场景连接
金融业务经常组合四种机制:固定规则快速拦截、统计策略评分、响应模型模拟、人工审核提供最终边界。统一接口帮助说明责任和信息来源,却不要求所有组件被一个 Agent 替代。尤其 oracle 只存在于合成环境;现实“真实客户反应”永远受隐藏变量影响。
Agent runtime 可以同时含 reactive safety policy、model-free routing 与 model-based planner。能力模块越多,权限和审计越重要。复盘中应把“系统会什么”与“系统可以做什么”分开,为 W11 control 留下接口。
自检问题
- 四类 Agent 的核心信息差异是什么?
- Dyna-Q 在 shift 下为什么可能比 model-free 更慢恢复?
- Oracle baseline 的解释价值与现实边界是什么?
- Search planning 与 learned-model planning 的转移来源有何不同?
- 复盘后哪个问题仍标为
C/H?
专业课程对齐
- 回看 Stanford CS234 的 dynamic programming、model-free 与 model-based 主线,用统一符号串联 W4。
- 回看 Berkeley CS285 的算法地图,关注数据来源与优化目标,而不是追求覆盖全部课程。
- 重读 Goal Misgeneralization in Deep Reinforcement Learning,把能力失败与目标失败加入 Agent 对照矩阵。
深入学习提示
如果某个概念仍模糊,只回看一条手推轨迹:Q update、model update、planning update 各使用什么证据。不要补做整周任务。下一周进入 world model 与 POMDP;最自然的衔接问题是:如果 observation 不等于 state,Agent 要如何形成 belief,模型误差又怎样随 horizon 累积?
学后填写区
- 我的统一 Agent 接口:
- 机制对照中最清楚的一列:
- 最反直觉的失败案例:
- 当前不能外推的结论:
- 下一步兴趣(可变更):