返回 M01~M90 教材库
M60 · 预习教材教材已备 ≠ 学习已完成

M60:证据边界案例:可视化合理,不等于干预成立

解释边界要求每个结论只达到证据允许的层级:可视化产生假设,受控干预测试机制,业务理由则必须回到可验证的输入事实与规则。

2026-10-22interpretability、visualization、causal-evidence、explanation-boundary、audit

内容类型:预习教材(不代表已完成)
日期:2026-10-22
阶段:P1 · AI Model Engineering 90
周次:W9 · 机制可解释性、推理与 verifier
节奏:周四案例与连接
状态:教材已备;学习未完成
标签:interpretability、visualization、causal-evidence、explanation-boundary、audit

一句话定义

解释边界要求每个结论只达到证据允许的层级:可视化产生假设,受控干预测试机制,业务理由则必须回到可验证的输入事实与规则。

学习目标

  1. 分析“图看似合理但干预不成立”的典型案例。
  2. 识别从内部相关到客户解释的越级语言。
  3. 能写出一份主张—证据—替代解释—允许措辞表。

核心知识

想象一个文档分类模型:金额 token 对某 attention head 的权重很高,热力图很符合直觉,于是报告称“模型因为金额较高判定风险”。随后消融该 head,输出几乎不变;替换金额 token 后分类却变化。可能解释包括:

  • 该 head 与行为相关但不是必要路径,其他 head 冗余补偿;
  • 热力图展示的是 attention weight,不是完整 value contribution;
  • 金额替换同时改变 tokenizer、位置或共现文本;
  • 分类真正依赖另一个层的数值表示;
  • 当前样例太少,现象不稳定。

因此,干预“不成立”不是研究失败,而是原机制故事没有获得支持。应缩小主张或设计更好的控制,不应继续挑图证明。

解释越级常见措辞包括“模型理解了”“模型依据该字段”“这个神经元代表欺诈”。更合适的层级化措辞是:“在这组样例中,该 activation 与输出相关”“置换此状态使目标 logit 平均发生某方向变化”“这支持它参与该局部计算,但不足以构成完整业务理由”。

机制/推导

一个可审计证据表可包含:

主张需要的最低证据替代解释允许措辞
模型输出受金额变化影响配对输入行为测试token 长度、模板共变“输出对该修改敏感”
某内部状态参与作用局部干预与随机对照一般性破坏、冗余“支持局部因果参与”
业务决定因金额而作出来源、规则、决策记录其他证据、政策例外“规则与证据链显示……”

内部机制与外部理由可以互相校验,但不能互相替代。机制工具可发现模型使用禁用字段;客户解释系统则应引用输入证据和政策,不暴露不稳定的内部故事。

最小练习或观察步骤

  1. 使用上述案例,先写一段“越级解释”,再逐句标出证据缺口。
  2. 设计四个检查:配对输入、随机 head 消融、activation replacement、一般性能对照。
  3. 为每个可能结果写允许结论,包含“不支持原假设”。
  4. 单独写客户/审计理由需要的外部证据:字段来源、规则版本、时间和责任人。
  5. 将最终描述限制在最弱充分措辞,不用拟人化词汇填补未知机制。
  6. 若无模型可运行,完成证据设计仍是本日有效练习。

常见误区

  • 干预不支持时继续更换配色、层或样例,直到出现想要的图。
  • 把 attention weight 当作特征贡献总量。
  • 只检查目标输出变化,不检查模型是否整体损坏。
  • 用“可解释 AI”标签掩盖没有来源与规则的客户理由。
  • 把研究性机制结论写成稳定生产承诺。

金融 / Web3 / 文档场景连接

监管、信贷或 AML 场景的解释首先是制度和证据问题。内部分析可用于模型验证、偏差发现和调试;对客户或审计的说明应引用交易、条款、模型版本与人工决策链。Web3 地址风险也不能用一个 activation 图替代可核验的链上行为。

自检问题

  1. 热力图合理而消融无效,至少有哪些替代解释?
  2. “敏感”“参与机制”“业务原因”三种说法的证据门槛有何不同?
  3. 为什么 attention weight 不是完整贡献度?
  4. 客户理由至少需要哪些外部证据?

专业课程对齐

  • 精读 ARENA 的 mechanistic interpretability 单元,把 attention visualization、linear probe、ablation、activation patching 逐一对齐到可支持的最高主张层级。
  • 精读 Stanford CS224N 中 attention/probing/interpretability 课题,检查可视化、可预测性和因果参与之间的语言边界。
  • 选读 PyTorch Tutorials 的 model analysis 与 hook 主题,用于审查“消融了什么张量”而不是只接受图表标签。

深入学习提示

先对一个热力图案例填“主张—证据—替代解释—允许措辞”表,再按 ARENA 设计 clean/corrupted、局部 patch 与随机对照,同时测目标 logit 与通用行为损坏。必须明写:“配对输入上输出敏感”是行为证据,不是机制证据;“局部干预改变目标指标”也只支持限定条件下的因果参与。反例是消融一个 head 无变化就否定所有路径,或将 activation 故事直接改写为客户决策理由;业务解释仍须引用可验证输入、规则与责任链。

学后填写区

  • 我识别的一句越级解释:
  • 对应证据缺口:
  • 最小干预与对照:
  • 当前允许的结论措辞:
  • 业务解释仍需的外部证据:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。