G64:机制可解释性的因果假设:从可视化走向可证伪机制
机制可解释性试图提出并干预模型内部计算的因果假设,说明哪些组件在什么输入分布上对某一行为既有必要性或充分性,而不只是展示相关图案。
内容类型:预习教材(不代表已完成)
日期:2027-04-26
阶段:P3 · AGI Foundations 90
总路线:Day 244
周次节奏:W10 · 周一概念与论文
状态:教材已备;学习未完成
一句话定义
机制可解释性试图提出并干预模型内部计算的因果假设,说明哪些组件在什么输入分布上对某一行为既有必要性或充分性,而不只是展示相关图案。
学习目标
- 区分 representation、feature、neuron、head、circuit、algorithm 与 behavior 的分析层级。
- 将“某处可解码信息”改写成包含干预、对照和反例的可证伪 circuit hypothesis。
- 理解 necessity、sufficiency、mediation 与 causal abstraction 各自提供的证据范围。
核心知识
行为层只说明输入到输出的映射;表示层询问内部状态编码了什么;机制层还要回答这些状态怎样被下游使用。Linear probe 在某层解码出变量 (z),只证明 activation 与 (z) 有统计关联。若模型在真实计算中忽略这部分方向,probe 仍可很准,因此 decodability 不等于 usage。
一个 circuit hypothesis 应明确:输入集合、目标行为、候选组件、信息流方向、预计干预效应和失败条件。例如:“在重复 token 预测任务上,第 1 层某 head 将前一出现位置写入 residual stream,第 2 层某 head 读取它;patch 写入端会恢复目标 logit,而 patch 不相关 head 不会。”这比“发现一个 induction head”更可检验。
必要性问移除组件是否破坏行为;充分性问只保留或植入组件是否能产生行为。二者都依赖干预分布:ablation 可能制造训练外 activation,导致模型因异常输入而坏掉;patching 如果同时带入多个相关变量,也不能隔离单一机制。Causal mediation 试图量化某中介承载多少处理效应;causal abstraction 则要求高层算法变量与低层神经状态之间,在一组干预下保持对应。
解释具有尺度和范围。一个 toy Transformer 的已知算法适合训练研究方法,因为 ground truth 可控;它不证明同样电路存在于大模型,更不能证明理解了模型“想法”。机制解释也不是安全证明:识别一条路径不代表没有冗余、替代或分布外路径。
机制与推导
设 clean 输入 (x_c) 得分 (s_c),corrupt 输入 (x_k) 得分 (s_k)。把 clean 的组件 activation (a_j(x_c)) patch 到 corrupt run 得 (s_{patch,j}),可定义归一化恢复量:
recovery_j = (s_patch,j - s_k) / (s_c - s_k)
它衡量该 patch 在当前 clean/corrupt 对上的行为恢复,不等于组件的普遍因果贡献。若分母很小、patch 同时修改位置和语义、或 corrupt 输入本身改变难度,指标会误导。
因果假设最好有四类对照:随机组件 patch、同层不相关位置 patch、均值/零/重采样 ablation,以及改变表面形式但保持算法变量的输入。必要性检验 do(a_j←baseline),充分性检验 do(a_j←clean);只有在预先指定的输入族、多个 seed 和多个对照上方向一致,才可暂称局部机制证据。任何失败都应区分“假设错”“干预不自然”“行为指标不敏感”。
最小练习或观察步骤
- 选一个程序化任务,如
AB…A → B的重复模式,写出高层算法的三步状态转换。 - 在看 activation 前写候选 circuit:哪些位置、哪层、哪种信息流,以及 patch 后预期哪个 logit 改变。
- 设计 clean/corrupt 对,确保只改变一个算法相关变量;另做一个表面变化但算法不变的反例。
- 列出必要性、充分性和随机对照各一个操作,先保留 planned 状态。
- 写清外推边界:任务、模型大小、seed、输入长度与干预类型。
常见误区与边界
- Attention heatmap 漂亮就称为解释,没有行为干预。
- Probe accuracy 高就说模型使用了该变量,忽略冗余表示和线性可解码性。
- 先看结果再编 circuit 故事,没有预注册预测或反例。
- 零 ablation 造成异常 activation,却把行为崩溃全部归因于组件必要性。
- 用一个局部机制声称“理解整个模型”或“模型因此安全”。
研究/系统场景连接
研究上,mechanistic hypothesis 可以连接行为失败与内部计算,但需要保存模型 hash、输入生成器、hook 位置、干预值与 scorer。系统上不应把解释面板直接接成自动批准器;它更适合作为诊断证据,与行为 eval、数据切片和人工复核并列。金融文本分类若发现某 feature 响应邮编,仍需通过反事实替换检验模型是否依赖地域 proxy,而不是凭 feature 命名下结论。
自检问题
- 可解码与被模型使用之间缺少哪一步证据?
- necessity 与 sufficiency 为什么必须分别测试?
- activation patching 的 recovery 指标在哪些情况下失真?
- 一个合格 circuit hypothesis 至少要限定哪些范围?
专业课程对齐
- A Mathematical Framework for Transformer Circuits:学习 residual stream、attention head composition 与 circuit 语言,重点理解分析对象而非背术语。
- Causal Abstraction 原论文:精读高低层变量的干预对应关系,用于区分相关性描述与因果机制主张。
- ARENA Interpretability Curriculum:选择 transformer hooks、activation patching 与 circuit analysis 相关小节,只做与当天 toy 假设直接相关的练习。
深入学习提示
把每个解释句改写为“如果该机制是真的,做干预 X 时指标 Y 应怎样变;反例 Z 应不变”。如果无法写出操作和反例,它仍是描述性观察。优先在机制已知的 toy task 上训练研究方法,再把不确定性带到更大模型。
学后填写区
- 目标行为与输入族:
- 候选 circuit hypothesis:
- necessity / sufficiency 干预:
- 随机与语义对照:
- 当前证据边界: