返回 G01~G90 教材库
G64 · 总 Day 244教材已备 ≠ 学习已完成

G64:机制可解释性的因果假设:从可视化走向可证伪机制

机制可解释性试图提出并干预模型内部计算的因果假设,说明哪些组件在什么输入分布上对某一行为既有必要性或充分性,而不只是展示相关图案。

2027-04-26

内容类型:预习教材(不代表已完成)
日期:2027-04-26
阶段:P3 · AGI Foundations 90
总路线:Day 244
周次节奏:W10 · 周一概念与论文
状态:教材已备;学习未完成

一句话定义

机制可解释性试图提出并干预模型内部计算的因果假设,说明哪些组件在什么输入分布上对某一行为既有必要性或充分性,而不只是展示相关图案。

学习目标

  1. 区分 representation、feature、neuron、head、circuit、algorithm 与 behavior 的分析层级。
  2. 将“某处可解码信息”改写成包含干预、对照和反例的可证伪 circuit hypothesis。
  3. 理解 necessity、sufficiency、mediation 与 causal abstraction 各自提供的证据范围。

核心知识

行为层只说明输入到输出的映射;表示层询问内部状态编码了什么;机制层还要回答这些状态怎样被下游使用。Linear probe 在某层解码出变量 (z),只证明 activation 与 (z) 有统计关联。若模型在真实计算中忽略这部分方向,probe 仍可很准,因此 decodability 不等于 usage。

一个 circuit hypothesis 应明确:输入集合、目标行为、候选组件、信息流方向、预计干预效应和失败条件。例如:“在重复 token 预测任务上,第 1 层某 head 将前一出现位置写入 residual stream,第 2 层某 head 读取它;patch 写入端会恢复目标 logit,而 patch 不相关 head 不会。”这比“发现一个 induction head”更可检验。

必要性问移除组件是否破坏行为;充分性问只保留或植入组件是否能产生行为。二者都依赖干预分布:ablation 可能制造训练外 activation,导致模型因异常输入而坏掉;patching 如果同时带入多个相关变量,也不能隔离单一机制。Causal mediation 试图量化某中介承载多少处理效应;causal abstraction 则要求高层算法变量与低层神经状态之间,在一组干预下保持对应。

解释具有尺度和范围。一个 toy Transformer 的已知算法适合训练研究方法,因为 ground truth 可控;它不证明同样电路存在于大模型,更不能证明理解了模型“想法”。机制解释也不是安全证明:识别一条路径不代表没有冗余、替代或分布外路径。

机制与推导

设 clean 输入 (x_c) 得分 (s_c),corrupt 输入 (x_k) 得分 (s_k)。把 clean 的组件 activation (a_j(x_c)) patch 到 corrupt run 得 (s_{patch,j}),可定义归一化恢复量:

recovery_j = (s_patch,j - s_k) / (s_c - s_k)

它衡量该 patch 在当前 clean/corrupt 对上的行为恢复,不等于组件的普遍因果贡献。若分母很小、patch 同时修改位置和语义、或 corrupt 输入本身改变难度,指标会误导。

因果假设最好有四类对照:随机组件 patch、同层不相关位置 patch、均值/零/重采样 ablation,以及改变表面形式但保持算法变量的输入。必要性检验 do(a_j←baseline),充分性检验 do(a_j←clean);只有在预先指定的输入族、多个 seed 和多个对照上方向一致,才可暂称局部机制证据。任何失败都应区分“假设错”“干预不自然”“行为指标不敏感”。

最小练习或观察步骤

  1. 选一个程序化任务,如 AB…A → B 的重复模式,写出高层算法的三步状态转换。
  2. 在看 activation 前写候选 circuit:哪些位置、哪层、哪种信息流,以及 patch 后预期哪个 logit 改变。
  3. 设计 clean/corrupt 对,确保只改变一个算法相关变量;另做一个表面变化但算法不变的反例。
  4. 列出必要性、充分性和随机对照各一个操作,先保留 planned 状态。
  5. 写清外推边界:任务、模型大小、seed、输入长度与干预类型。

常见误区与边界

  • Attention heatmap 漂亮就称为解释,没有行为干预。
  • Probe accuracy 高就说模型使用了该变量,忽略冗余表示和线性可解码性。
  • 先看结果再编 circuit 故事,没有预注册预测或反例。
  • 零 ablation 造成异常 activation,却把行为崩溃全部归因于组件必要性。
  • 用一个局部机制声称“理解整个模型”或“模型因此安全”。

研究/系统场景连接

研究上,mechanistic hypothesis 可以连接行为失败与内部计算,但需要保存模型 hash、输入生成器、hook 位置、干预值与 scorer。系统上不应把解释面板直接接成自动批准器;它更适合作为诊断证据,与行为 eval、数据切片和人工复核并列。金融文本分类若发现某 feature 响应邮编,仍需通过反事实替换检验模型是否依赖地域 proxy,而不是凭 feature 命名下结论。

自检问题

  1. 可解码与被模型使用之间缺少哪一步证据?
  2. necessity 与 sufficiency 为什么必须分别测试?
  3. activation patching 的 recovery 指标在哪些情况下失真?
  4. 一个合格 circuit hypothesis 至少要限定哪些范围?

专业课程对齐

深入学习提示

把每个解释句改写为“如果该机制是真的,做干预 X 时指标 Y 应怎样变;反例 Z 应不变”。如果无法写出操作和反例,它仍是描述性观察。优先在机制已知的 toy task 上训练研究方法,再把不确定性带到更大模型。

学后填写区

  • 目标行为与输入族:
  • 候选 circuit hypothesis:
  • necessity / sufficiency 干预:
  • 随机与语义对照:
  • 当前证据边界:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本