返回 G01~G90 教材库
G52 · 总 Day 232教材已备 ≠ 学习已完成

G52:EWC、MAML 与两种“快速适应”机制

EWC 用参数重要性约束后续更新以保护旧任务,MAML 则学习一个能经少量梯度步适应新任务的初始化;两者都涉及跨任务信息,却优化不同问题并依赖不同数据访问条件。

2027-04-14ewc、maml、regularization、meta-learning、adaptation

内容类型:预习教材(不代表已完成)
日期:2027-04-14
阶段:P3 · AGI Foundations 90
总路线:Day 232 / 360
周次:W8 · Continual、Meta 与 Transfer Learning
节奏:周三引导实验
状态:教材已备;学习未完成
标签:ewc、maml、regularization、meta-learning、adaptation

一句话定义

EWC 用参数重要性约束后续更新以保护旧任务,MAML 则学习一个能经少量梯度步适应新任务的初始化;两者都涉及跨任务信息,却优化不同问题并依赖不同数据访问条件。

学习目标

  1. 推导 EWC 的 Fisher-weighted quadratic penalty 及其近似假设。
  2. 推导 MAML 的 inner/outer loop,并区分 meta-train 与 meta-test task。
  3. 在 toy task 上把旧能力保持和新任务快速适应分别测量。
  4. 识别任务分布、计算预算与超参选择造成的结论偏差。

核心知识

  • EWC 把旧任务后验用以旧最优参数为中心的对角 Gaussian 近似,Fisher diagonal 代表参数对旧任务 likelihood 的局部重要性。
  • 对角 Fisher 忽略参数相关性,且只在旧最优附近提供局部约束。任务差异大或模型过参数化时,重要性解释需谨慎。
  • MAML 在每个 sampled task 上用 support set 做 inner update,再用 query set 评价并更新共享初始化。它学习“易适应参数区域”,不是记住任意未来任务。
  • First-order MAML 忽略二阶导,Reptile 使用参数差近似跨任务更新;计算和精确性不同,不应因名称接近而混用。
  • EWC 需要旧任务参数/Fisher 摘要但不必保留全部旧数据;MAML 训练期需要 task distribution 和支持/查询切分。两者的公平比较需先定义问题。

机制与推导

EWC 在新任务 B 上优化:

[ L(\theta)=L_B(\theta)+\frac{\lambda}{2}\sum_iF_i(\theta_i-\theta^*_{A,i})^2 ]

(F_i) 大的参数更难移动。若 (\lambda\to\infty),稳定性高但可能无法学习 B;若 (\lambda=0),退化为 naive fine-tuning。Fisher 估计样本与方式会改变约束。

MAML 对 task (\tau) 的 inner update:

[ \theta'\tau=\theta-\alpha\nabla\theta L^{support}_\tau(\theta) ]

outer objective:

[ \min_\theta\mathbb E_{\tau\sim p(\tau)}L^{query}\tau(\theta'\tau) ]

梯度要穿过 inner update,因此含二阶项。Meta-test 任务必须来自同一广义 task family 但不与训练 task 重合;若 query 样本泄漏到 support,适应曲线失真。

二者的结果轴也不同:EWC 主要看 (R_{B,A}) 与 (R_{B,B}) 的取舍;MAML 看新任务 0、1、5 个梯度步后的 query performance,并与随机初始化或普通预训练比较。

最小练习或观察步骤

  1. 对两个顺序任务实现 diagonal Fisher:在任务 A 学完后,用少量 A 样本估计平方梯度均值。
  2. 比较 naive、replay、EWC 三种条件,固定任务 B 的训练步;记录 A 保留和 B 学习,而非寻找最优 (\lambda)。
  3. 另用正弦回归或线性分类 task family 手推/实现一阶 MAML;严格分开 meta-train task 与 meta-test task。
  4. 画 meta-test 在 0、1、3、5 个 inner steps 的曲线,并与普通 joint pretraining 初始化比较。
  5. 构造一个 task family 外的新任务,例如函数类型改变,观察“快速适应”主张何处失效。
  6. 精力不足时只手推一维 quadratic 的 EWC 和一次 MAML 更新,不要求同时跑两个完整实验。

常见误区与边界

  • 把 Fisher 当参数真实因果重要性;它是依赖模型、数据和局部点的近似。
  • EWC 旧任务好、新任务差仍只报告遗忘改善。
  • MAML 训练和测试使用相同具体 task,实际是任务记忆。
  • support/query 泄漏,或用 meta-test query 选择步数和超参。
  • 将少步适应称为“学会学习”而不写 task distribution。
  • toy 正弦回归不支持开放世界迁移、AGI 或无限自我改进结论。

研究/系统场景连接

不同地区金融政策可视作相关任务,但权威规则不宜靠 MAML 快速参数适应来替代显式版本控制。EWC 也不能保证旧合规行为,因为参数重要性近似不等于业务不变量。研究价值在于理解参数层稳定—适应机制;系统落地仍需要外部政策、评测和人工控制。Agent 若通过几条示例改变行为,还要区分 context adaptation 与真正参数更新。

自检问题

  1. EWC 的 Fisher penalty 隐含哪些局部近似?
  2. (\lambda) 极大和极小时分别发生什么?
  3. MAML support 与 query 各承担什么作用?
  4. Meta-test task 怎样才既未见又与训练分布有关?
  5. EWC 与 MAML 最主要的评价轴为什么不同?

专业课程对齐

  • 研读 EWC 原始论文,核对 Bayesian/Laplace 直觉、Fisher 近似和实验范围。
  • 研读 MAML 原始论文,手推 inner/outer objective,并区分 few-shot classification 与 RL 的任务设置。
  • 对齐 Stanford CS330 的 meta-learning 课程材料,优先理解 task distribution 与 adaptation protocol,不把全部课程作业变成 Gate。

深入学习提示

可继续比较 online EWC、Laplace approximation、Reptile、ANIL 与 implicit gradient。先问“方法共享了什么、更新了什么、保留了什么数据”。若一个方法靠更强任务先验胜出,这不是作弊,但应明确它的归纳偏置和外推边界。

学后填写区

  • 实际手推或实现范围:
  • EWC stability/plasticity 观察:
  • MAML adaptation curve:
  • task-family 外反例:
  • 方法假设:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本