M57:行为、相关、机制与因果证据阶梯
证据强度阶梯区分“模型做了什么”“内部量与行为相关”“干预能否改变行为”和“这些证据能否支持业务解释”,防止把漂亮可视化越级称为因果机制。
内容类型:预习教材(不代表已完成)
日期:2026-10-19
阶段:P1 · AI Model Engineering 90
周次:W9 · 机制可解释性、推理与 verifier
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:behavior、correlation、mechanism、causal-evidence、explanation
一句话定义
证据强度阶梯区分“模型做了什么”“内部量与行为相关”“干预能否改变行为”和“这些证据能否支持业务解释”,防止把漂亮可视化越级称为因果机制。
学习目标
- 能区分 behavior、correlation、mechanism、causal evidence 与 business explanation。
- 能为不同主张匹配恰当的证据强度。
- 理解内部解释与面向客户的理由属于不同证据任务。
核心知识
行为证据来自输入输出测试:模型在某类样例上是否正确、稳定或拒答。它直接描述功能,但不说明内部如何实现。
相关证据显示某个 attention pattern、activation 或 feature 与输出同时变化。例如某特征在包含金额的文本上活跃。相关性可用于提出机制假设,但可能由共同原因、冗余通路或选择偏差造成。
机制假设给出可检验的计算故事:某层某特征如何把输入信息传到输出。好假设应明确组件、路径、适用输入和预测,而不是只说“模型关注了这里”。
因果证据通过 ablation、replacement、patching 或受控编辑干预内部变量,并观察目标行为是否按预测改变。单次干预仍可能有分布外副作用,需要对照、局部性与复现。
业务解释回答为什么作出某项现实决策,通常需要输入事实、规则、来源和责任边界。模型内部某个神经元激活不能替代客户理由,也不能自动满足审计要求。
机制/推导
可以按主张强度建立阶梯:
- 输出符合某模式——需要行为样例与统计;
- 内部变量预测该输出——需要相关分析与保留集;
- 内部变量参与产生输出——需要干预与对照;
- 已找到充分且必要机制——需要多方向干预、替代路径检查和广泛复现;
- 可据此解释业务决定——还需要外部事实、规则和人类可审计链。
必要性与充分性不同:消融某特征使行为消失,支持它在当前条件下必要;激活该特征能诱发行为,才接近充分性证据。Transformer 中存在冗余,消融无效也不能直接证明组件无关。
最小练习或观察步骤
- 选择一个主张,例如“模型使用金额字段判断高风险”。
- 分别写出行为、相关、机制、因果与业务解释层的可接受证据。
- 设计一个相关观察:捕获某层 activation,并在含/不含金额样例间比较。
- 设计一个最小干预:替换或消融 activation,同时保持其他输入不变。
- 写出至少两个替代解释,如金额与某模板词共现、干预破坏一般流畅性。
- 明确当前证据最多能支持到哪一层,不要求实际运行。
常见误区
- attention 权重高就称为模型“依据”或“原因”。
- 只挑支持假设的 token 可视化,不设对照样例。
- 消融后输出变化,就忽略干预造成的普遍分布破坏。
- 从 tiny model 的机制直接推到大型生产模型。
- 用内部 feature 名称替代面向客户的事实与规则解释。
金融 / Web3 / 文档场景连接
信用、AML 或争议决策需要说明输入证据与规则,而不是“第 12 层激活较高”。机制研究可以帮助发现模型是否依赖不应使用的字段,但最终业务解释仍须回到可验证事实、政策版本与人类责任。
自检问题
- 行为证据与机制证据分别回答什么?
- correlation 为什么不足以支持因果主张?
- 必要性与充分性干预有何区别?
- 内部解释为何不能直接当客户理由?
专业课程对齐
- 精读 ARENA 的 mechanistic interpretability 单元,按“观测 activation/attention→提出 circuit 假设→ablation/patching→对照”标注每个练习的证据类型。
- 精读 Stanford CS224N 中 interpretability、probing 或 attention analysis 相关课题,用来区分 predictive probe 与 causal intervention。
- 选读 PyTorch Tutorials 的 hooks 与 model analysis 主题,只识别观测代码与修改 forward 的实现边界。
深入学习提示
先用 ARENA 练习建立术语,再用 CS224N 审视相关性,最后查 PyTorch hook。为同一主张分别写 behavior、correlation、mechanism hypothesis、causal intervention、business explanation 五行,并标注必要性与充分性需要不同干预。特别保留边界:行为测试只能证明模型“做了什么”,行为证据不等于机制证据。反例是 attention heatmap 与金额 token 同时变化就声称模型依据金额决策,或一次 ablation 无效就宣称该组件不参与计算,忽略冗余路径。
学后填写区
- 我选择的机制主张:
- 当前拥有的证据层:
- 最小因果干预:
- 两个替代解释:
- 结论不可越过的边界: