G66:Probe、Patching 与 Ablation:三种证据不能互相替代
Probe 测量信息能否从 activation 解码,patching 测量替换内部状态能否改变行为,ablation 测量移除组件造成的损失;三者回答不同问题,组合后才可能支持局部机制。
内容类型:预习教材(不代表已完成)
日期:2027-04-28
阶段:P3 · AGI Foundations 90
总路线:Day 246
周次节奏:W10 · 周三引导实验
状态:教材已备;学习未完成
一句话定义
Probe 测量信息能否从 activation 解码,patching 测量替换内部状态能否改变行为,ablation 测量移除组件造成的损失;三者回答不同问题,组合后才可能支持局部机制。
学习目标
- 为 probe、patching、ablation 分别写出研究问题、对照、指标和不可推出的结论。
- 识别 probe 容量、干预自然性、冗余 circuit 与 distribution shift 造成的假阳性或假阴性。
- 设计一个两方法交叉验证的 toy 实验,而非追求更多可视化。
核心知识
Linear probe 学习 z_hat=W a+b。高准确率可能因为目标变量在 activation 中线性编码,也可能因为数据有混杂、probe 记住输入身份、样本数太小或高维表示使随机标签也易拟合。Control task、selectivity、相同容量下的随机标签和 train/test 结构切分,可以减少但不能消除这些问题。Probe 最稳妥的表述是“在该切分和探针容量下可解码”。
Activation patching 从 clean run 取内部状态,放到 corrupt run,观察目标行为是否恢复。它比 probe 更接近因果,因为真正改变模型计算;但一个 activation 可能同时携带多个变量,patch 整个向量会共同恢复它们。Clean/corrupt 对如果改变多个语义属性,patch 的效果也难归因。因此需要精心构造配对、位置和随机 patch 对照。
Ablation 通过零化、均值替换、重采样或删除组件观察行为下降。零化简单,却可能把 activation 推离自然流形;均值替换会抹去上下文但保留尺度;resample ablation 从另一个样本取值,更自然却带入别的信息。组件被移除后行为不降,既可能说明它不必要,也可能说明存在冗余补偿;行为下降则可能是全局破坏而非特定算法作用。
三种方法可形成证据三角:probe 定位候选信息,patch 检验其在 clean/corrupt 差异中的中介作用,ablation 检验候选组件对行为的必要性。如果 probe 高而 patch/ablation 无效,合理结论是“可解码但未证实被使用”;若 patch 有效而 probe 低,可能是 probe 形式不匹配或分布信息非线性;若 ablation 有效但 patch 无效,可能是干预值不正确或组件作用不通过当前 clean/corrupt 变量。
机制与推导
Probe selectivity 可简化为:
selectivity = Acc(target labels) - Acc(control labels)
控制标签应保持类型或频率结构又与目标语义无关,否则差值并不公平。Patching 的平均因果效应可写为:
ACE_patch = E[s(do(a_j=a_j^clean), x_corrupt) - s(x_corrupt)]
Ablation 效应为:
ACE_ablate = E[s(x) - s(do(a_j=b_j), x)]
其中 baseline (b_j) 的选择是研究假设的一部分。若想测试中介,需同时比较 total effect(clean 与 corrupt 行为差)、direct effect(保持 mediator 为 corrupt)与 mediated recovery,而不是只看单次 patch 百分比。
预注册一个判定表更重要:probe↑, patch↑, ablation↑ 支持候选局部机制;任何组合不一致都触发替代解释检查,不强行把结果归一为“发现 circuit”。多 seed 的效应量和方向比只展示最好的一次更可靠。
最小练习或观察步骤
- 在 G65 toy task 选一个 ground-truth 状态变量,定义结构切分,避免同模板泄漏到 probe 测试集。
- 计划训练一个 linear probe 和一个相同容量的 control probe,写下 selectivity 而非只写准确率。
- 构造只改变该状态变量的 clean/corrupt 对,并计划 patch 一个位置、一个随机位置和一个随机 head。
- 选择 mean 与 resample 两种 ablation,预测若候选组件真正必要,两个操作应怎样影响 margin。
- 画 3×3 结果解释表;所有单元都允许出现,不预填实际数值。
常见误区与边界
- Probe 在训练集上高分就宣布找到概念神经元。
- 用高容量非线性 probe 从任意 activation 中提取标签,却不做 control task。
- Patch 整层后恢复行为,就把该层所有组件称为 circuit。
- 零 ablation 破坏归一化统计,仍把下降解释为算法必要性。
- 只保留支持故事的 seed,忽略不稳定或相反方向。
研究/系统场景连接
在系统诊断中,probe 可作为候选异常 detector,但不能直接作为授权或风控决定;patching/ablation 通常只适合离线沙箱。金融模型若可解码客户地区,不代表决策使用地区;应设计保持其他信息不变的反事实和内部干预,并同时检查输出差异。进入具身场景后,ablation 可能改变控制稳定性,真实执行前必须停留在仿真或离线 replay。
自检问题
- Probe 高准确率最多能支持哪一句话?
- 为什么 clean/corrupt 配对决定 patching 的解释力?
- 零、均值和 resample ablation 各自引入什么假设?
- 三种证据不一致时应先检查哪些替代解释?
专业课程对齐
- Designing and Interpreting Probes with Control Tasks:精读 control task 与 selectivity,理解探针容量和记忆能力带来的混杂。
- Locating and Editing Factual Associations in GPT:关注 causal tracing 的 clean/corrupt/restore 结构,不把模型编辑结果泛化为完整知识机制。
- ARENA Interpretability Curriculum:选做与 linear probes、activation patching、ablation 对应的最小练习,保留课程代码与本人结论的分界。
深入学习提示
把方法选择倒过来:先写你要区分的两个因果故事,再决定 probe、patch 或 ablation 能否区分。若两个故事在当前干预下产生相同预测,再多画图也没有新增证据,应改变任务或干预。
学后填写区
- 目标变量与切分:
- Probe/control 设计:
- Patch 对与随机对照:
- Ablation baseline:
- 不一致结果的替代解释: