M25:移除 Transformer 组件会发生什么
组件消融通过移除或替换一个结构,观察模型不变量、数值尺度和学习行为怎样改变,从而建立机制而非背组件清单。
内容类型:预习教材(不代表已完成)
日期:2026-09-17
阶段:P1 · AI Model Engineering 90
周次:W4 · Transformer 第一性原理
节奏:周四案例与连接
状态:教材已备;学习未完成
标签:Ablation、Scale、Mask、Residual、Normalization、Causal Leak
一句话定义
组件消融通过移除或替换一个结构,观察模型不变量、数值尺度和学习行为怎样改变,从而建立机制而非背组件清单。
学习目标
- 预测移除 scale、mask、residual、normalization 的不同影响。
- 区分即时结构错误与需要训练后才显现的稳定性问题。
- 设计最小 causal leak 检查。
- 不把一次消融曲线解释为组件的全部作用。
核心知识
移除 scale 不会改变 scores 的排序,但会随 head 维度放大绝对值,使 softmax 更尖锐、熵降低,梯度更易饱和。影响在 d_k 较大时更显著;微型二维例子可能看不出训练问题,却仍可观察权重分布变化。
移除 causal mask 是信息边界错误:过去位置可以读取未来 token。训练 next-token 任务时 loss 可能异常下降,因为模型获得部署时不存在的信息。它不是普通超参数退化,而是数据泄漏,应通过输入扰动和上三角权重检查立即发现。
移除 residual 会切断恒等信息路径,使每层必须完全重构表示,深层梯度传播更困难。移除 normalization 会让层间尺度漂移,对初始化和学习率更加敏感。二者影响常在多层训练中显现,单次 forward 输出仍可能是有限数字。
机制与消融设计
建立“组件—直接数学作用—即时不变量—训练症状—替代解释”表:
- scale:控制 score 方差;观察 attention 熵;症状可能是过尖与梯度不稳。
- mask:限制可见位置;观察未来扰动不影响过去;失效即 causal leak。
- residual:加入 x 的直接路径;观察表示与梯度通路;深层退化更明显。
- norm:稳定每个 token 的通道尺度;观察均值/均方根;失效可能放大层间漂移。
每次只移除一项并保持权重、输入、seed 和训练步数相同。先做不需训练的结构检查,再决定是否做短训练曲线;不能为追求明显结果无限增加深度或步数。
最小练习
- 对 scale 与 mask 做 forward 级实验设计,先写预期。
- 将最后一个 token 改动,检查早期位置输出是否变化。
- 计算有/无 scale 时同一行 attention 权重或熵。
- 对 residual/norm 只画多层信息路径,也可不跑训练。
- 汇总一个“结构边界案例”,实际结果必须运行后填写。
常见误区
- mask 移除后 loss 更低就认为模型更强。
- 微型模型未发散就断言 normalization 无用。
- 同时移除 residual 与 norm,无法归因。
- 只看最终 loss,不观察 attention 熵、激活和梯度。
- 消融结论脱离模型深度、维度、训练预算和架构变体。
文档与金融场景连接
时间序列或逐步决策若错误允许读取未来交易、最终案件标签或后续文档,离线评估会虚高。causal mask 的思想可迁移为更广义的“决策时点信息边界”。
自检问题
- scale 改变 attention 排序吗?它主要改变什么?
- 为什么 causal leak 可能让训练指标变好?
- residual 与 normalization 的作用能否只靠一次 forward 判断?
- 哪些条件需要固定才能解释消融结果?
专业课程对齐
- Stanford CS224N:对应 Transformer 架构,复核 scale、mask、residual、normalization、FFN 各自的功能边界。
- Stanford CS336:对应语言模型实现与训练稳定性,用于设计能在结构检查和短训练中区分的消融。
- Stanford CS231n:对应神经网络训练与消融实验方法,帮助控制变量并谨慎解释曲线。
深入学习提示
先精读 CS224N 确认组件机制,再看 CS336 的实现位置,最后用 CS231n 的实验纪律设计单变量消融。移除 mask 可用未来 token 不变性立即检测;移除 scale 应观察 logits/attention entropy 随 d_k 的变化;移除 residual 或 normalization 则更可能在深度、梯度范数和训练稳定性中显现。公式重点是点积方差与 √d_k,以及 residual x+F(x) 提供的恒等路径。反例包括一次删除多个组件、同时改变初始化、用单次随机种子解释普遍规律、看到无 mask 的 loss 更低就认为更优。每项先写预期信号、再做结构测试、最后才选做短训练;若短模型看不出差异,应记录“实验灵敏度不足”,不能补造结论。
学后填写区
- 消融预测表:____
- causal leak 检查:____
- 实际 attention 熵观察:____
- 保留的不确定性:____
- 实际学习日期与用时:____