返回 G01~G90 教材库
G53 · 总 Day 233教材已备 ≠ 学习已完成

G53:任务顺序、相似性与 Replay Size 的干扰实验

任务顺序与相似性改变梯度干扰和可迁移结构,因此同一 continual 方法在不同 curriculum 上可能从正迁移变成遗忘,单一顺序的平均结果不足以支持普遍结论。

2027-04-15task-order、interference、replay-size、sequence-effect、negative-transfer

内容类型:预习教材(不代表已完成)
日期:2027-04-15
阶段:P3 · AGI Foundations 90
总路线:Day 233 / 360
周次:W8 · Continual、Meta 与 Transfer Learning
节奏:周四争议与失败案例
状态:教材已备;学习未完成
标签:task-order、interference、replay-size、sequence-effect、negative-transfer

一句话定义

任务顺序与相似性改变梯度干扰和可迁移结构,因此同一 continual 方法在不同 curriculum 上可能从正迁移变成遗忘,单一顺序的平均结果不足以支持普遍结论。

学习目标

  1. 分解 task order、task similarity、buffer size 与随机 seed 的影响。
  2. 理解 representational overlap、gradient alignment 与 label conflict 的不同机制。
  3. 设计最小的顺序敏感性实验,避免组合爆炸和重型 Gate。
  4. 报告 per-task trajectory、order variance 与负迁移反例。

核心知识

  • 相似任务可能共享表示并产生正迁移,也可能因标签或决策边界冲突而增加干扰。“相似”必须说明是输入、标签、机制还是最优策略相似。
  • Curriculum 从易到难可能改善优化,却也可能让早期任务占据容量;反向顺序可能更快适应复杂任务但忘记简单边界。结论取决于模型与训练预算。
  • Replay size 增加通常提高旧任务覆盖,却不必单调改善结果:低质量、过时或类别失衡样本可能固化偏差。
  • Order effect 需要至少两个顺序比较;随机打乱一个序列不是足够证据。任务数小时可枚举,任务数大时采样代表性顺序。
  • 平均 ACC 可隐藏某顺序中的单任务崩溃。建议报告每个 (R_{i,j}) 和顺序间 variance。

机制与推导

对任务 A、B 的局部梯度 (g_A,g_B),若:

[ g_A^\top g_B>0 ]

一次更新可能同时降低两者 loss;若内积为负则存在局部干扰。梯度对参数点、batch 和尺度敏感,只能作为诊断线索。

对任务顺序 (\sigma),最终指标写为 (M(\sigma))。顺序敏感度可用:

[ Var_{\sigma\sim\Sigma}[M(\sigma)] ]

但只有少数顺序时,不应报告高精度统计显著性。更有用的是画每个顺序的 task matrix 和差异轨迹。

Replay buffer 容量 (K) 对任务 j 的有效覆盖近似依赖流占比 (p_j):期望样本约 (Kp_j)。稀有任务的 (Kp_j<1) 时常完全缺失。Class-balanced buffer 改善任务覆盖,却改变真实数据频率,可能损害校准。

构造 label-conflict 反例:A 与 B 输入完全相同,但同一区域标签相反。表示相似很高,却无法在无 task identity 的单头模型中同时完美解决。这提醒我们先检查问题是否可解。

最小练习或观察步骤

  1. 设计三个二维任务:A 原始边界、B 旋转边界、C 输入相似但局部标签冲突。
  2. 选三个顺序即可,例如 A→B→C、C→B→A、A→C→B;不必枚举全部。
  3. 对 naive 与一种 replay 方法,比较 (K=20,100);固定每任务训练步和总 seed 数。
  4. 每学完一任务评价全部已见与一个未见任务,保存完整 matrix、每任务 forgetting 和 FWT。
  5. 抽样几个 batch 记录 gradient cosine,查看它与后续遗忘是否一致;不一致也是有价值的反例。
  6. 报告顺序特定结果和未覆盖组合,不把最好顺序挑出来代表方法。

常见误区与边界

  • 用输入距离定义任务相似,却忽略标签函数冲突。
  • 只跑对方法有利的 curriculum,写成算法普遍优势。
  • Replay buffer 更大同时增加训练样本数,预算不公平。
  • 梯度 cosine 为正就预测长期无遗忘,忽略非线性轨迹。
  • 多 seed 平均隐藏某些顺序的灾难任务。
  • toy 顺序效应不能直接外推到模型持续预训练、线上用户或开放环境。

研究/系统场景连接

政策按时间到达并非可自由排序的 curriculum,且新规则可能明确废止旧规则;此时“保留全部旧能力”反而错误。系统需将适用日期和 jurisdiction 放在权威外部状态,而非只依赖参数记忆。研究 Agent 的任务流也会因先读哪些论文形成路径依赖,应通过反方材料和原始证据缓解,但不应假装完全消除顺序效应。

自检问题

  1. 任务相似至少有哪些不同定义?
  2. 梯度内积为何只提供局部诊断?
  3. 为什么 class-balanced replay 同时带来收益和分布偏差?
  4. 哪类 label conflict 使无 task identity 的目标不可同时满足?
  5. 怎样避免 cherry-pick 最优任务顺序?

专业课程对齐

  • 阅读 EWC 原始论文,检查任务序列设置和参数重要性如何依赖已经学过的任务。
  • 阅读 MAML 原始论文,比较 task distribution sampling 与固定 continual sequence 的研究问题。
  • 阅读 Gato 官方研究介绍,观察多任务混合训练的设置,并与按序、不可回看的 continual protocol 区分。

深入学习提示

可进一步研究 curriculum learning、gradient surgery、task similarity estimation 与 task-free boundaries。先尝试制造一个方法失败的顺序,而不是调参消除它。研究成熟度来自解释结论对任务生成过程的敏感性,而非找到一组最好数字。

学后填写区

  • 实际任务与相似性定义:
  • 实际顺序和 buffer:
  • per-task/order 观察:
  • 梯度诊断与反例:
  • 不可解或未覆盖边界:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本