返回 G01~G90 教材库
G54 · 总 Day 234教材已备 ≠ 学习已完成

G54:阶段复盘二:适应效率与旧任务遗忘

本次复盘把“学得快”“记得住”“迁移得好”拆成独立证据,只整理目前理解、疑问与兴趣,不要求算法齐全、达标或重做失败实验。

2027-04-16stage-review、continual-learning、adaptation、forgetting、evidence

内容类型:预习教材(不代表已完成)
日期:2027-04-16
阶段:P3 · AGI Foundations 90
总路线:Day 234 / 360
周次:W8 · Continual、Meta 与 Transfer Learning
节奏:周五低压力阶段复盘
状态:教材已备;学习未完成
标签:stage-review、continual-learning、adaptation、forgetting、evidence

一句话定义

本次复盘把“学得快”“记得住”“迁移得好”拆成独立证据,只整理目前理解、疑问与兴趣,不要求算法齐全、达标或重做失败实验。

学习目标

  1. 串联 W5 world model、W6 memory、W7 social learning 与 W8 continual adaptation。
  2. 用 task matrix 和 adaptation curve 区分参数学习、记忆读取与规划改善。
  3. 复核证据标签 R/E/C/H/S,不把教材和论文结果写成本人结果。
  4. 选择后续想深入的一条路径,而非完成统一 Gate。

核心知识

  • World model 通过预测未来支持规划;external memory 通过读取历史支持当前决定;continual learning 通过参数或结构更新改变未来行为。三者都可能表现为“第二次做得更好”,但机制不同。
  • 适应效率应画性能随样本、步数或交互变化的曲线;遗忘应回看每个旧任务。只报告新任务最终分数会遗漏稳定代价。
  • Replay、EWC、meta-learning 分别依赖历史样本、参数重要性近似和任务分布。它们解决的问题有交集,但数据访问与假设不同。
  • 阶段复盘允许结果缺失。若未跑实验,可只手推机制、列预期区分和开放问题;不能填入虚构 seed、曲线或分数。
  • 研究兴趣本身可以成为产出:选择更想理解的失败机制,有助于下一周进入自改进与合成数据,而非以完成清单驱动。

机制与推导

建立一张 mechanism table:

机制              改变的状态          适应速度        主要失败
in-context         activation/context  即时            context依赖/污染
external memory    datastore/state     写入后即时       过期/检索/来源
gradient update    parameters          多步优化         遗忘/漂移
world-model plan   chosen action        每次规划          model bias

对参数适应,可把目标写成多目标:

[ \min;(L_{new},;F_{old},;C_{adapt},;M_{stored}) ]

其中 (L_{new}) 是新任务 loss,(F_{old}) 是旧任务遗忘,(C_{adapt}) 是计算/样本成本,(M_{stored}) 是历史数据或状态。没有自然唯一标量,方法优劣取决于约束。

对本人证据,可做 claim ledger:

claim | evidence tag | task/config | supports | does not support | next question

例如“replay 在本 toy 顺序减少任务 A forgetting”只有真实运行后才能标 R;未运行前是 H。论文报告的现象标 E,冲突文献标 C,长期通用学习推论通常仍是 S

最小练习或观察步骤

  1. 用一张图连接:latent dynamics→planner、events→memory、partners→social adaptation、task stream→parameter update。
  2. 若已有真实结果,把 ACC/BWT/FWT 与每任务曲线放在同页;若没有,只保留空模板和手算例子。
  3. 为 replay、EWC、MAML 各写“它保留什么、需要什么、可能失败什么”,每项三句即可。
  4. 找一个行为改善案例,判断它可能来自 context、memory、planning 还是 gradient;列出能区分机制的干预。
  5. 回答五个低压力问题:能解释什么、哪个机制最有帮助、什么反直觉、证据止于哪里、最想继续什么。
  6. 选择“继续深入一项”或“保持概念理解”;两种都正确,不追加补作业。

常见误区与边界

  • 将预制教材、代码骨架或外部论文分数当作本人已完成证据。
  • 为了阶段复盘补跑所有 seed 和算法,变成重型 Gate。
  • 新任务进步就自动称为 transfer,没有独立 from-scratch baseline。
  • 旧知识来自外部检索,却称模型参数没有遗忘。
  • 只写成功方法,删除负结果和不理解之处。
  • 本复盘不评价是否“更接近 AGI”,只整理有限机制与研究问题。

研究/系统场景连接

金融系统常应优先选择版本化规则、检索和明确更新流程,而非在线改变模型参数。复盘可帮助判断“持续学习”需求实际是知识时效、用户个性化、模型更新还是环境适应。研究 Agent 若能跨 session 继续任务,首先检查它是否只读取状态;不要把系统记忆包装成模型获得了新通用能力。

自检问题

  1. 行为第二次变好可能来自哪四类机制?
  2. 为什么稳定—可塑问题不能只用一个准确率回答?
  3. Replay、EWC 与 MAML 的数据访问假设分别是什么?
  4. RE 的主体边界是什么?
  5. 哪条未解决问题最值得带入自改进主题?

专业课程对齐

  • 回看 EWC 原始论文,只整理它实际支持的遗忘范围与近似,不复述为通用解法。
  • 回看 MAML 原始论文,明确任务分布、support/query 和少步适应三项前提。
  • 对齐 Stanford CS330 的课程主题图,将本周问题放回 meta/transfer/continual 的关系,不要求完成课程作业。

深入学习提示

如果精力充足,选择一张最不理解的公式或一个失败轨迹继续;不要同时展开所有方法。复盘的质量来自边界清楚:哪些亲手做过、哪些只读过、哪些仍是假设。保留空白比填入想象结果更符合研究认识论。

学后填写区

  • 目前能解释的机制:
  • 实际证据与标签:
  • 一个反直觉或负结果:
  • 当前最大疑问:
  • 想继续深入 / 暂不深入的方向:
  • 证据外推边界:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本