G50:Continual、Meta 与 Transfer Learning 的指标地图
Continual learning 研究任务流中学习新能力与保留旧能力的取舍,meta learning 研究跨任务获得更快适应机制,transfer 则描述一个任务的学习如何影响另一个任务;三者不能用最终平均分混为一谈。
内容类型:预习教材(不代表已完成)
日期:2027-04-12
阶段:P3 · AGI Foundations 90
总路线:Day 230 / 360
周次:W8 · Continual、Meta 与 Transfer Learning
节奏:周一概念与论文
状态:教材已备;学习未完成
标签:continual-learning、forgetting、bwt、fwt、meta-learning
一句话定义
Continual learning 研究任务流中学习新能力与保留旧能力的取舍,meta learning 研究跨任务获得更快适应机制,transfer 则描述一个任务的学习如何影响另一个任务;三者不能用最终平均分混为一谈。
学习目标
- 区分 catastrophic forgetting、stability–plasticity、forward/backward transfer 与 adaptation efficiency。
- 从 task-performance matrix 推导 ACC、BWT、FWT 与 forgetting。
- 区分参数更新、in-context adaptation 和 external memory update。
- 设计任务顺序、相似性与基线,使研究主张可证伪。
核心知识
- Catastrophic forgetting 指学习新任务后旧任务性能显著下降;自然的小幅下降、评价噪声或旧任务分布改变不应自动贴此标签。
- Stability 是保留已有能力,plasticity 是吸收新信息。过度稳定会学不动,过度可塑会覆盖旧知识;不存在脱离任务流与资源预算的单一最优点。
- Forward transfer 衡量先前任务是否帮助后续未学任务;backward transfer 衡量学后续任务是否改善或损害旧任务。二者可正、零或负。
- Meta-learning 通过任务分布学习初始化、更新规则或表示,使新任务用更少样本适应。它仍依赖 train/test task distribution,不能等同于无界通用学习。
- In-context adaptation 改变当前激活与输入,external memory 改变系统状态,gradient learning 改变参数。观察到行为变化前应先辨认机制。
机制与推导
对 (T) 个按序任务,令 (R_{i,j}) 表示学完任务 (i) 后在任务 (j) 的性能,形成下三角矩阵。最终平均准确率:
[ ACC=\frac1T\sum_{j=1}^{T}R_{T,j} ]
Backward transfer 的一种定义:
[ BWT=\frac1{T-1}\sum_{j=1}^{T-1}(R_{T,j}-R_{j,j}) ]
负 BWT 暗示旧任务退化,但平均会隐藏单任务灾难。Forgetting 可按每任务历史最好值计算:
[ F_j=\max_{i\in{j,\ldots,T-1}}R_{i,j}-R_{T,j} ]
Forward transfer 需与从随机初始化或未见任务基线 (b_j) 比:
[ FWT=\frac1{T-1}\sum_{j=2}^{T}(R_{j-1,j}-b_j) ]
不同论文定义可能略异,报告时必须写公式。若只看 ACC,策略可能通过严重忘记任务 1、提升任务 3 获得相同平均分。
Adaptation curve 还应看新任务第 (k) 个样本或梯度步后的性能 (A(k)),而非只看最终值。样本效率、计算和旧任务代价共同描述适应。
最小练习或观察步骤
- 准备三个小任务:旋转二维分类、不同规则的序列映射或分块 MNIST 子集;先明确任务边界和是否共享标签。
- 手工填写一个 3×3 假想 (R) matrix,计算 ACC、BWT、FWT 与每任务 forgetting,寻找相同 ACC 的两个反例。
- 定义 joint training、single-task oracle、naive sequential 三个 reference;它们分别回答上界、任务难度和遗忘下界。
- 对每个任务保存学习前、学习后、最终三个评价点;若只跑一个序列,明确证据范围。
- 另建一列说明行为变化机制:context、external memory 或 parameter update,防止术语混用。
- 不设统一通过线;指标用于看取舍和失败,不是必须全部改善的 Gate。
常见误区与边界
- 最终平均分高就声称没有遗忘,忽略单任务轨迹与任务难度。
- 用 joint training 上界直接与严格在线方法比,却不说明 joint 方法可重看全部数据。
- 任务标签泄漏给模型,使 task inference 问题被绕过。
- 将检索旧样本的 external memory 成功称为参数已持续学习。
- 在同一任务不同 seed 上得到改善就称为 transfer。
- 三个小任务只能解释指标机制,不能证明 general intelligence 或长期自主学习。
研究/系统场景连接
银行政策助手更新新规后仍需保留旧规则适用日期,但这更像 temporal knowledge management,不一定要梯度持续学习。把权威规则放外部版本库通常比不断微调更可审计。研究中可用 toy task 流理解参数干扰,再比较 retrieval 与 gradient 的不同失效。未来具身学习还会遇到传感器漂移、动作技能和安全约束,指标需延伸到行为风险。
自检问题
- ACC 相同的两个系统为何可能有完全不同的遗忘?
- BWT 与 forgetting 的参考点有什么差别?
- FWT 必须与什么 baseline 比较?
- in-context、memory 和 gradient adaptation 的状态改变在哪里?
- task distribution 如何限制 meta-learning 外推?
专业课程对齐
- 阅读 EWC 原始论文,先理解灾难性遗忘问题和参数重要性,不预设正则化能解决所有任务流。
- 阅读 MAML 原始论文,关注 train task distribution、inner adaptation 与 outer objective 的边界。
- 阅读 Gato 官方研究介绍,区分多任务序列建模的广度与在线 continual adaptation 的不同主张。
深入学习提示
可进一步阅读 continual learning taxonomy、online learning regret 与 task-free continual learning。先用矩阵手算,确认每个指标的分母和参考点,再看排行榜。深入不是收集更多缩写,而是能指出每个数值隐含的数据可访问性、任务身份和顺序假设。
学后填写区
- 实际使用的 task matrix:
- ACC/BWT/FWT/forgetting 计算:
- 一个平均值掩盖案例:
- 行为变化属于哪种机制:
- 外推边界:
- 尚未理解的问题: