G69:Attention 与因果干预:可选回看中的解释边界
Attention 是模型计算中的路由权重而不是天然解释;只有结合 value 内容、下游读取、行为干预和竞争对照,才能判断某条注意路径是否具有局部因果作用。
内容类型:预习教材(不代表已完成)
日期:2027-05-01
阶段:P3 · AGI Foundations 90
总路线:Day 249
周次节奏:W10 · 周六可选探索
状态:教材已备;学习未完成
一句话定义
Attention 是模型计算中的路由权重而不是天然解释;只有结合 value 内容、下游读取、行为干预和竞争对照,才能判断某条注意路径是否具有局部因果作用。
学习目标
- 解释 attention pattern、OV 写入、residual contribution 与最终行为之间的缺失环节。
- 识别“attention is explanation”和“attention 完全无用”两种过度立场。
- 将一幅 attention 图转换成三个可检验假设与最小干预。
核心知识
Attention 权重 (p_{ij}) 表示位置 (i) 对不同位置 value 的加权比例,但输出还依赖 value 向量和 (W_O)。高权重位置可能写入与任务无关的信息,低权重位置也可能因 value 范数大而贡献显著;多个 head 和 MLP 会继续修改 residual stream。于是“模型关注某词所以这样决定”通常跳过了内容、写入、读取和输出四步。
然而 attention 也不是毫无意义。它是模型真实计算的一部分,可帮助发现位置路由、复制、前一 token 或 delimiter 等候选结构。正确用法是 hypothesis generation:先观察 pattern,提出“head 从匹配位置读取某 feature”的候选,再检查 OV 方向、downstream composition、patch 与 ablation。观察与验证应分开数据,避免图像引导后仍在同一例子上确认。
“替换 attention 分布但输出不变”并不总能证明 attention 无解释价值,因为替换可能由 value 冗余补偿;反之,强行改变 attention 导致输出变化,也可能是 off-manifold 扰动。解释的单位不是一幅图,而是一组输入、一个组件、一个行为和一套干预协议。
对用户可读解释还要再跨一层:mechanistic description(内部怎样算)不同于 normative rationale(业务上为何合理)与 counterfactual explanation(怎样改变结果)。即使确认一个 head 复制了地区 token,也不能自动把它作为客户决策理由。
机制与推导
Head 输出为 o_i=W_O Σ_j p_ij v_j。对来源位置 (j) 的粗略贡献可写成 c_ij=p_ij·W_O v_j,其对目标 logit 的直接影响近似 u_targetᵀ c_ij,但后续层会产生非线性交互,因此 direct logit attribution 仍不是完整因果效应。
三步验证协议:
- Route:attention 是否在目标输入族上稳定指向算法相关位置,并区别竞争位置?
- Write/read:被读取的 value 经 OV 写入什么方向,下游组件是否读取该方向?
- Intervene:patch 路由或输出能否特异改变 margin,随机位置与等价输入是否不产生同样效应?
若只有第一步,结论停在相关候选;完成二、三步也只能称该输入族上的局部 circuit。一个反例协议是保持匹配位置不变但更换符号,和保持距离不变但更换匹配位置,区分 token identity 与固定距离 shortcut。
最小练习或观察步骤
- 取一幅 toy attention pattern,用一句中性话描述“权重在哪里”,不使用“理解、关注、理由”等心理词。
- 写三个候选:读取 token identity、读取固定距离、读取 delimiter;为每个候选设计一个反例输入。
- 手算两个来源位置的
p_ij·W_Ov_j,观察高 attention 是否必然带来大 logit contribution。 - 计划一次 head-output patch 与一次 pattern-only patch,明确它们干预的变量不同。
- 写出可以对用户展示的业务反事实与内部机制证据为何不是同一文本。
常见误区与边界
- 把 heatmap 当成自然语言 rationale,使用拟人化词汇制造确定感。
- 因为 attention 不足以解释,就否定它作为电路候选定位的价值。
- 只看权重,不看 OV、残差与下游读取。
- 对 pattern 做任意替换后行为变化,就忽略 off-manifold 干预。
- 将内部机制证据直接用于法律、信贷或客户可解释性结论。
研究/系统场景连接
解释面板可把 attention 作为调试线索,但应显示模型版本、输入切片、干预证据和不确定性,不能只显示彩色图。客服模型若注意到客户姓名,系统应进一步做删除/替换反事实和输出审计;即便内部依赖真实存在,也需要数据最小化与业务政策判断。具身视觉策略的 saliency 或 attention 同样不等于机器人“看懂”物体,需遮挡、位置交换与控制响应干预。
自检问题
- 高 attention 权重为何不必然产生高输出贡献?
- Attention 作为候选定位工具的合理边界是什么?
- Pattern patch 与 head-output patch 分别改变什么?
- 机制解释、业务理由和反事实解释如何区分?
专业课程对齐
- Attention is not Explanation:理解注意分布与模型预测之间可能脱钩的实证论证,同时审视其干预假设。
- A Mathematical Framework for Transformer Circuits:用 QK 路由与 OV 写入的分解补全 attention heatmap 缺失的计算环节。
- ARENA Interpretability Curriculum:选择 attention heads、induction circuits 或 patching 小节,将观察转成最小可证伪练习。
深入学习提示
每次看到“模型关注了 X”时,强制补问:从 X 读出了什么、写到哪里、谁继续读取、移除后哪个具体行为改变?只要其中一环没有证据,就把语言降级为“候选关联”。
学后填写区
- 一幅图的中性描述:
- 三个候选机制:
- Route / write-read / intervene 证据:
- 一个 off-manifold 风险:
- 不能对用户声称什么: