返回 M01~M90 教材库
M57 · 预习教材教材已备 ≠ 学习已完成

M57:行为、相关、机制与因果证据阶梯

证据强度阶梯区分“模型做了什么”“内部量与行为相关”“干预能否改变行为”和“这些证据能否支持业务解释”,防止把漂亮可视化越级称为因果机制。

2026-10-19behavior、correlation、mechanism、causal-evidence、explanation

内容类型:预习教材(不代表已完成)
日期:2026-10-19
阶段:P1 · AI Model Engineering 90
周次:W9 · 机制可解释性、推理与 verifier
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:behavior、correlation、mechanism、causal-evidence、explanation

一句话定义

证据强度阶梯区分“模型做了什么”“内部量与行为相关”“干预能否改变行为”和“这些证据能否支持业务解释”,防止把漂亮可视化越级称为因果机制。

学习目标

  1. 能区分 behavior、correlation、mechanism、causal evidence 与 business explanation。
  2. 能为不同主张匹配恰当的证据强度。
  3. 理解内部解释与面向客户的理由属于不同证据任务。

核心知识

行为证据来自输入输出测试:模型在某类样例上是否正确、稳定或拒答。它直接描述功能,但不说明内部如何实现。

相关证据显示某个 attention pattern、activation 或 feature 与输出同时变化。例如某特征在包含金额的文本上活跃。相关性可用于提出机制假设,但可能由共同原因、冗余通路或选择偏差造成。

机制假设给出可检验的计算故事:某层某特征如何把输入信息传到输出。好假设应明确组件、路径、适用输入和预测,而不是只说“模型关注了这里”。

因果证据通过 ablation、replacement、patching 或受控编辑干预内部变量,并观察目标行为是否按预测改变。单次干预仍可能有分布外副作用,需要对照、局部性与复现。

业务解释回答为什么作出某项现实决策,通常需要输入事实、规则、来源和责任边界。模型内部某个神经元激活不能替代客户理由,也不能自动满足审计要求。

机制/推导

可以按主张强度建立阶梯:

  1. 输出符合某模式——需要行为样例与统计;
  2. 内部变量预测该输出——需要相关分析与保留集;
  3. 内部变量参与产生输出——需要干预与对照;
  4. 已找到充分且必要机制——需要多方向干预、替代路径检查和广泛复现;
  5. 可据此解释业务决定——还需要外部事实、规则和人类可审计链。

必要性与充分性不同:消融某特征使行为消失,支持它在当前条件下必要;激活该特征能诱发行为,才接近充分性证据。Transformer 中存在冗余,消融无效也不能直接证明组件无关。

最小练习或观察步骤

  1. 选择一个主张,例如“模型使用金额字段判断高风险”。
  2. 分别写出行为、相关、机制、因果与业务解释层的可接受证据。
  3. 设计一个相关观察:捕获某层 activation,并在含/不含金额样例间比较。
  4. 设计一个最小干预:替换或消融 activation,同时保持其他输入不变。
  5. 写出至少两个替代解释,如金额与某模板词共现、干预破坏一般流畅性。
  6. 明确当前证据最多能支持到哪一层,不要求实际运行。

常见误区

  • attention 权重高就称为模型“依据”或“原因”。
  • 只挑支持假设的 token 可视化,不设对照样例。
  • 消融后输出变化,就忽略干预造成的普遍分布破坏。
  • 从 tiny model 的机制直接推到大型生产模型。
  • 用内部 feature 名称替代面向客户的事实与规则解释。

金融 / Web3 / 文档场景连接

信用、AML 或争议决策需要说明输入证据与规则,而不是“第 12 层激活较高”。机制研究可以帮助发现模型是否依赖不应使用的字段,但最终业务解释仍须回到可验证事实、政策版本与人类责任。

自检问题

  1. 行为证据与机制证据分别回答什么?
  2. correlation 为什么不足以支持因果主张?
  3. 必要性与充分性干预有何区别?
  4. 内部解释为何不能直接当客户理由?

专业课程对齐

  • 精读 ARENA 的 mechanistic interpretability 单元,按“观测 activation/attention→提出 circuit 假设→ablation/patching→对照”标注每个练习的证据类型。
  • 精读 Stanford CS224N 中 interpretability、probing 或 attention analysis 相关课题,用来区分 predictive probe 与 causal intervention。
  • 选读 PyTorch Tutorials 的 hooks 与 model analysis 主题,只识别观测代码与修改 forward 的实现边界。

深入学习提示

先用 ARENA 练习建立术语,再用 CS224N 审视相关性,最后查 PyTorch hook。为同一主张分别写 behavior、correlation、mechanism hypothesis、causal intervention、business explanation 五行,并标注必要性与充分性需要不同干预。特别保留边界:行为测试只能证明模型“做了什么”,行为证据不等于机制证据。反例是 attention heatmap 与金额 token 同时变化就声称模型依据金额决策,或一次 ablation 无效就宣称该组件不参与计算,忽略冗余路径。

学后填写区

  • 我选择的机制主张:
  • 当前拥有的证据层:
  • 最小因果干预:
  • 两个替代解释:
  • 结论不可越过的边界:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。