G67:Clean/Corrupt 因果对照:防止事后故事化
Clean/corrupt 对照通过最小改变一个算法变量并在内部重建它,检验候选 circuit 是否真正中介行为差异,同时用随机与等价输入阻止事后叙事。
内容类型:预习教材(不代表已完成)
日期:2027-04-29
阶段:P3 · AGI Foundations 90
总路线:Day 247
周次节奏:W10 · 周四争议与反例
状态:教材已备;学习未完成
一句话定义
Clean/corrupt 对照通过最小改变一个算法变量并在内部重建它,检验候选 circuit 是否真正中介行为差异,同时用随机与等价输入阻止事后叙事。
学习目标
- 构造只改变目标因子、尽量保持难度和表面统计一致的 clean/corrupt 输入。
- 设计位置、层、随机组件、语义等价与 negative-control 干预。
- 在看结果前写出竞争机制和各自预测,使负结果也能更新理解。
核心知识
Clean 输入应使目标行为成立,corrupt 输入应以可控方式破坏目标变量。若 clean 是简单句、corrupt 是长而罕见的句子,行为差可能来自难度或 tokenization;若一次替换同时改变实体、语法和标签,patch 恢复也无法说明恢复了哪个因子。理想配对不是“看起来相似”,而是由程序化生成器保证除目标变量外的结构分布匹配。
内部干预同样要配对。把 clean activation patch 到 corrupt run 是 treatment;随机层、随机 head、错误位置或另一个无关 clean 样本是 negative controls;把 corrupt activation 放回 clean run 可测试方向反转;对称 swap 能帮助排除单边异常。语义等价控制则改变符号名称或表面顺序但保持高层算法不变,检验 circuit 是否追踪抽象变量而非词面。
事后故事化常源于高维搜索:研究者看遍所有层、位置、head 和指标,再挑一个热点解释。即便每个点的假阳性率不高,成百上千次查看也会让偶然热点必然出现。可采用 split:在 discovery set 定位候选,在未看的 confirmatory set 检验预注册位置、方向与阈值;不需要正式 Gate,只是研究卫生。
竞争假设尤其重要。例如 H1:head 追踪“上一相同 token”;H2:head 只追踪固定距离;H3:head 响应分隔符位置。长度变化、符号重命名和分隔符移动会给出不同预测。只有能区分竞争故事的输入,才增加机制信息。
机制与推导
把行为分数记为 (Y),目标算法变量记为 (Z),组件 activation 为 (A)。我们想检验近似中介链 Z → A → Y。Clean/corrupt 操作改变 (Z),patch 近似执行 do(A=A_clean)。但若 clean/corrupt 还改变混杂变量 (U),则 patch 的 (A) 同时携带 (Z,U),恢复不能单独归于 (Z)。
可用差分中的差分减弱一般 patch 效应:
SpecificEffect = (Y_target_patch - Y_corrupt) - (Y_random_patch - Y_corrupt)
再在语义等价输入、错误位置和多 seed 上计算。若测试了 (K) 个候选再选最大值,必须在新样本验证,不能把探索最大值当无偏 effect size。对竞争假设可写预测矩阵:每行一个干预,每列 H1/H2/H3,若两列预测完全相同,当前实验无法区分它们。
最小练习或观察步骤
- 为重复规则任务定义三种腐化:改变匹配 token、移动距离、移动分隔符;标出每次真正改变的变量。
- 写 H1/H2/H3 三个竞争机制,并为三种腐化各写预期行为和 patch 方向。
- 选择一个 discovery 集定位组件,另生成未看的 confirmatory seed 与符号集。
- 计划四个对照:随机 head、错误位置、反向 patch、语义等价重命名。
- 预先定义什么结果支持、削弱或无法区分假设;不在未运行时填“已验证”。
常见误区与边界
- Clean/corrupt 同时改变长度、词频、语法与标签,却声称隔离了一个概念。
- 浏览全部热点后只报告最强 head,没有 confirmatory split。
- 随机对照只抽一次;一个偶然低效的随机点不足以构成基线。
- Patch 恢复行为便忽略组件冗余、共同携带变量和 off-manifold 问题。
- 把“当前实验区分不了”误写成两个机制等价。
研究/系统场景连接
在反欺诈文本研究中,可保持金额、时间和商户类别不变,仅替换一个 proxy 属性,观察内部与行为差异;但真实公平判断还需合法、业务和统计语境。系统应保存输入生成规则、discovery/confirmatory 标识、干预矩阵和所有候选,而不是只保留最终图。未来机器人仿真可将 lighting、object identity、position 分别干预,避免把视觉相关性当作控制策略因果变量。
自检问题
- Clean/corrupt 配对中最难控制的混杂是什么?
- 为什么 discovery 与 confirmatory 数据应分开?
- 竞争假设预测矩阵怎样发现实验不可辨识?
- 随机 patch 为什么需要分布而不是单点?
专业课程对齐
- Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability:用干预一致性理解高层算法与低层状态之间的可检验对应。
- ACDC: Automatic Circuit Discovery:观察自动搜索 circuit 时的阈值、任务指标与验证问题,警惕高维候选选择偏差。
- In-context Learning and Induction Heads:分析其任务、匹配模式和多种证据,练习区分机制主张与外推主张。
深入学习提示
先做“实验可辨识性审查”:如果 H1 与 H2 对所有计划干预都给出同样预测,优先设计新输入,不急着运行。把最好看的热点留在 discovery,真正的学习来自它在新符号、长度与 seed 上是否按预期变化。
学后填写区
- Clean/corrupt 变量表:
- 三个竞争假设:
- Confirmatory split:
- Negative controls:
- 不能区分的故事: