G52:EWC、MAML 与两种“快速适应”机制
EWC 用参数重要性约束后续更新以保护旧任务,MAML 则学习一个能经少量梯度步适应新任务的初始化;两者都涉及跨任务信息,却优化不同问题并依赖不同数据访问条件。
内容类型:预习教材(不代表已完成)
日期:2027-04-14
阶段:P3 · AGI Foundations 90
总路线:Day 232 / 360
周次:W8 · Continual、Meta 与 Transfer Learning
节奏:周三引导实验
状态:教材已备;学习未完成
标签:ewc、maml、regularization、meta-learning、adaptation
一句话定义
EWC 用参数重要性约束后续更新以保护旧任务,MAML 则学习一个能经少量梯度步适应新任务的初始化;两者都涉及跨任务信息,却优化不同问题并依赖不同数据访问条件。
学习目标
- 推导 EWC 的 Fisher-weighted quadratic penalty 及其近似假设。
- 推导 MAML 的 inner/outer loop,并区分 meta-train 与 meta-test task。
- 在 toy task 上把旧能力保持和新任务快速适应分别测量。
- 识别任务分布、计算预算与超参选择造成的结论偏差。
核心知识
- EWC 把旧任务后验用以旧最优参数为中心的对角 Gaussian 近似,Fisher diagonal 代表参数对旧任务 likelihood 的局部重要性。
- 对角 Fisher 忽略参数相关性,且只在旧最优附近提供局部约束。任务差异大或模型过参数化时,重要性解释需谨慎。
- MAML 在每个 sampled task 上用 support set 做 inner update,再用 query set 评价并更新共享初始化。它学习“易适应参数区域”,不是记住任意未来任务。
- First-order MAML 忽略二阶导,Reptile 使用参数差近似跨任务更新;计算和精确性不同,不应因名称接近而混用。
- EWC 需要旧任务参数/Fisher 摘要但不必保留全部旧数据;MAML 训练期需要 task distribution 和支持/查询切分。两者的公平比较需先定义问题。
机制与推导
EWC 在新任务 B 上优化:
[ L(\theta)=L_B(\theta)+\frac{\lambda}{2}\sum_iF_i(\theta_i-\theta^*_{A,i})^2 ]
(F_i) 大的参数更难移动。若 (\lambda\to\infty),稳定性高但可能无法学习 B;若 (\lambda=0),退化为 naive fine-tuning。Fisher 估计样本与方式会改变约束。
MAML 对 task (\tau) 的 inner update:
[ \theta'\tau=\theta-\alpha\nabla\theta L^{support}_\tau(\theta) ]
outer objective:
[ \min_\theta\mathbb E_{\tau\sim p(\tau)}L^{query}\tau(\theta'\tau) ]
梯度要穿过 inner update,因此含二阶项。Meta-test 任务必须来自同一广义 task family 但不与训练 task 重合;若 query 样本泄漏到 support,适应曲线失真。
二者的结果轴也不同:EWC 主要看 (R_{B,A}) 与 (R_{B,B}) 的取舍;MAML 看新任务 0、1、5 个梯度步后的 query performance,并与随机初始化或普通预训练比较。
最小练习或观察步骤
- 对两个顺序任务实现 diagonal Fisher:在任务 A 学完后,用少量 A 样本估计平方梯度均值。
- 比较 naive、replay、EWC 三种条件,固定任务 B 的训练步;记录 A 保留和 B 学习,而非寻找最优 (\lambda)。
- 另用正弦回归或线性分类 task family 手推/实现一阶 MAML;严格分开 meta-train task 与 meta-test task。
- 画 meta-test 在 0、1、3、5 个 inner steps 的曲线,并与普通 joint pretraining 初始化比较。
- 构造一个 task family 外的新任务,例如函数类型改变,观察“快速适应”主张何处失效。
- 精力不足时只手推一维 quadratic 的 EWC 和一次 MAML 更新,不要求同时跑两个完整实验。
常见误区与边界
- 把 Fisher 当参数真实因果重要性;它是依赖模型、数据和局部点的近似。
- EWC 旧任务好、新任务差仍只报告遗忘改善。
- MAML 训练和测试使用相同具体 task,实际是任务记忆。
- support/query 泄漏,或用 meta-test query 选择步数和超参。
- 将少步适应称为“学会学习”而不写 task distribution。
- toy 正弦回归不支持开放世界迁移、AGI 或无限自我改进结论。
研究/系统场景连接
不同地区金融政策可视作相关任务,但权威规则不宜靠 MAML 快速参数适应来替代显式版本控制。EWC 也不能保证旧合规行为,因为参数重要性近似不等于业务不变量。研究价值在于理解参数层稳定—适应机制;系统落地仍需要外部政策、评测和人工控制。Agent 若通过几条示例改变行为,还要区分 context adaptation 与真正参数更新。
自检问题
- EWC 的 Fisher penalty 隐含哪些局部近似?
- (\lambda) 极大和极小时分别发生什么?
- MAML support 与 query 各承担什么作用?
- Meta-test task 怎样才既未见又与训练分布有关?
- EWC 与 MAML 最主要的评价轴为什么不同?
专业课程对齐
- 研读 EWC 原始论文,核对 Bayesian/Laplace 直觉、Fisher 近似和实验范围。
- 研读 MAML 原始论文,手推 inner/outer objective,并区分 few-shot classification 与 RL 的任务设置。
- 对齐 Stanford CS330 的 meta-learning 课程材料,优先理解 task distribution 与 adaptation protocol,不把全部课程作业变成 Gate。
深入学习提示
可继续比较 online EWC、Laplace approximation、Reptile、ANIL 与 implicit gradient。先问“方法共享了什么、更新了什么、保留了什么数据”。若一个方法靠更强任务先验胜出,这不是作弊,但应明确它的归纳偏置和外推边界。
学后填写区
- 实际手推或实现范围:
- EWC stability/plasticity 观察:
- MAML adaptation curve:
- task-family 外反例:
- 方法假设:
- 尚未理解的问题: