返回 G01~G90 教材库
G66 · 总 Day 246教材已备 ≠ 学习已完成

G66:Probe、Patching 与 Ablation:三种证据不能互相替代

Probe 测量信息能否从 activation 解码,patching 测量替换内部状态能否改变行为,ablation 测量移除组件造成的损失;三者回答不同问题,组合后才可能支持局部机制。

2027-04-28

内容类型:预习教材(不代表已完成)
日期:2027-04-28
阶段:P3 · AGI Foundations 90
总路线:Day 246
周次节奏:W10 · 周三引导实验
状态:教材已备;学习未完成

一句话定义

Probe 测量信息能否从 activation 解码,patching 测量替换内部状态能否改变行为,ablation 测量移除组件造成的损失;三者回答不同问题,组合后才可能支持局部机制。

学习目标

  1. 为 probe、patching、ablation 分别写出研究问题、对照、指标和不可推出的结论。
  2. 识别 probe 容量、干预自然性、冗余 circuit 与 distribution shift 造成的假阳性或假阴性。
  3. 设计一个两方法交叉验证的 toy 实验,而非追求更多可视化。

核心知识

Linear probe 学习 z_hat=W a+b。高准确率可能因为目标变量在 activation 中线性编码,也可能因为数据有混杂、probe 记住输入身份、样本数太小或高维表示使随机标签也易拟合。Control task、selectivity、相同容量下的随机标签和 train/test 结构切分,可以减少但不能消除这些问题。Probe 最稳妥的表述是“在该切分和探针容量下可解码”。

Activation patching 从 clean run 取内部状态,放到 corrupt run,观察目标行为是否恢复。它比 probe 更接近因果,因为真正改变模型计算;但一个 activation 可能同时携带多个变量,patch 整个向量会共同恢复它们。Clean/corrupt 对如果改变多个语义属性,patch 的效果也难归因。因此需要精心构造配对、位置和随机 patch 对照。

Ablation 通过零化、均值替换、重采样或删除组件观察行为下降。零化简单,却可能把 activation 推离自然流形;均值替换会抹去上下文但保留尺度;resample ablation 从另一个样本取值,更自然却带入别的信息。组件被移除后行为不降,既可能说明它不必要,也可能说明存在冗余补偿;行为下降则可能是全局破坏而非特定算法作用。

三种方法可形成证据三角:probe 定位候选信息,patch 检验其在 clean/corrupt 差异中的中介作用,ablation 检验候选组件对行为的必要性。如果 probe 高而 patch/ablation 无效,合理结论是“可解码但未证实被使用”;若 patch 有效而 probe 低,可能是 probe 形式不匹配或分布信息非线性;若 ablation 有效但 patch 无效,可能是干预值不正确或组件作用不通过当前 clean/corrupt 变量。

机制与推导

Probe selectivity 可简化为:

selectivity = Acc(target labels) - Acc(control labels)

控制标签应保持类型或频率结构又与目标语义无关,否则差值并不公平。Patching 的平均因果效应可写为:

ACE_patch = E[s(do(a_j=a_j^clean), x_corrupt) - s(x_corrupt)]

Ablation 效应为:

ACE_ablate = E[s(x) - s(do(a_j=b_j), x)]

其中 baseline (b_j) 的选择是研究假设的一部分。若想测试中介,需同时比较 total effect(clean 与 corrupt 行为差)、direct effect(保持 mediator 为 corrupt)与 mediated recovery,而不是只看单次 patch 百分比。

预注册一个判定表更重要:probe↑, patch↑, ablation↑ 支持候选局部机制;任何组合不一致都触发替代解释检查,不强行把结果归一为“发现 circuit”。多 seed 的效应量和方向比只展示最好的一次更可靠。

最小练习或观察步骤

  1. 在 G65 toy task 选一个 ground-truth 状态变量,定义结构切分,避免同模板泄漏到 probe 测试集。
  2. 计划训练一个 linear probe 和一个相同容量的 control probe,写下 selectivity 而非只写准确率。
  3. 构造只改变该状态变量的 clean/corrupt 对,并计划 patch 一个位置、一个随机位置和一个随机 head。
  4. 选择 mean 与 resample 两种 ablation,预测若候选组件真正必要,两个操作应怎样影响 margin。
  5. 画 3×3 结果解释表;所有单元都允许出现,不预填实际数值。

常见误区与边界

  • Probe 在训练集上高分就宣布找到概念神经元。
  • 用高容量非线性 probe 从任意 activation 中提取标签,却不做 control task。
  • Patch 整层后恢复行为,就把该层所有组件称为 circuit。
  • 零 ablation 破坏归一化统计,仍把下降解释为算法必要性。
  • 只保留支持故事的 seed,忽略不稳定或相反方向。

研究/系统场景连接

在系统诊断中,probe 可作为候选异常 detector,但不能直接作为授权或风控决定;patching/ablation 通常只适合离线沙箱。金融模型若可解码客户地区,不代表决策使用地区;应设计保持其他信息不变的反事实和内部干预,并同时检查输出差异。进入具身场景后,ablation 可能改变控制稳定性,真实执行前必须停留在仿真或离线 replay。

自检问题

  1. Probe 高准确率最多能支持哪一句话?
  2. 为什么 clean/corrupt 配对决定 patching 的解释力?
  3. 零、均值和 resample ablation 各自引入什么假设?
  4. 三种证据不一致时应先检查哪些替代解释?

专业课程对齐

深入学习提示

把方法选择倒过来:先写你要区分的两个因果故事,再决定 probe、patch 或 ablation 能否区分。若两个故事在当前干预下产生相同预测,再多画图也没有新增证据,应改变任务或干预。

学后填写区

  • 目标变量与切分:
  • Probe/control 设计:
  • Patch 对与随机对照:
  • Ablation baseline:
  • 不一致结果的替代解释:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本