M60:证据边界案例:可视化合理,不等于干预成立
解释边界要求每个结论只达到证据允许的层级:可视化产生假设,受控干预测试机制,业务理由则必须回到可验证的输入事实与规则。
内容类型:预习教材(不代表已完成)
日期:2026-10-22
阶段:P1 · AI Model Engineering 90
周次:W9 · 机制可解释性、推理与 verifier
节奏:周四案例与连接
状态:教材已备;学习未完成
标签:interpretability、visualization、causal-evidence、explanation-boundary、audit
一句话定义
解释边界要求每个结论只达到证据允许的层级:可视化产生假设,受控干预测试机制,业务理由则必须回到可验证的输入事实与规则。
学习目标
- 分析“图看似合理但干预不成立”的典型案例。
- 识别从内部相关到客户解释的越级语言。
- 能写出一份主张—证据—替代解释—允许措辞表。
核心知识
想象一个文档分类模型:金额 token 对某 attention head 的权重很高,热力图很符合直觉,于是报告称“模型因为金额较高判定风险”。随后消融该 head,输出几乎不变;替换金额 token 后分类却变化。可能解释包括:
- 该 head 与行为相关但不是必要路径,其他 head 冗余补偿;
- 热力图展示的是 attention weight,不是完整 value contribution;
- 金额替换同时改变 tokenizer、位置或共现文本;
- 分类真正依赖另一个层的数值表示;
- 当前样例太少,现象不稳定。
因此,干预“不成立”不是研究失败,而是原机制故事没有获得支持。应缩小主张或设计更好的控制,不应继续挑图证明。
解释越级常见措辞包括“模型理解了”“模型依据该字段”“这个神经元代表欺诈”。更合适的层级化措辞是:“在这组样例中,该 activation 与输出相关”“置换此状态使目标 logit 平均发生某方向变化”“这支持它参与该局部计算,但不足以构成完整业务理由”。
机制/推导
一个可审计证据表可包含:
| 主张 | 需要的最低证据 | 替代解释 | 允许措辞 |
|---|---|---|---|
| 模型输出受金额变化影响 | 配对输入行为测试 | token 长度、模板共变 | “输出对该修改敏感” |
| 某内部状态参与作用 | 局部干预与随机对照 | 一般性破坏、冗余 | “支持局部因果参与” |
| 业务决定因金额而作出 | 来源、规则、决策记录 | 其他证据、政策例外 | “规则与证据链显示……” |
内部机制与外部理由可以互相校验,但不能互相替代。机制工具可发现模型使用禁用字段;客户解释系统则应引用输入证据和政策,不暴露不稳定的内部故事。
最小练习或观察步骤
- 使用上述案例,先写一段“越级解释”,再逐句标出证据缺口。
- 设计四个检查:配对输入、随机 head 消融、activation replacement、一般性能对照。
- 为每个可能结果写允许结论,包含“不支持原假设”。
- 单独写客户/审计理由需要的外部证据:字段来源、规则版本、时间和责任人。
- 将最终描述限制在最弱充分措辞,不用拟人化词汇填补未知机制。
- 若无模型可运行,完成证据设计仍是本日有效练习。
常见误区
- 干预不支持时继续更换配色、层或样例,直到出现想要的图。
- 把 attention weight 当作特征贡献总量。
- 只检查目标输出变化,不检查模型是否整体损坏。
- 用“可解释 AI”标签掩盖没有来源与规则的客户理由。
- 把研究性机制结论写成稳定生产承诺。
金融 / Web3 / 文档场景连接
监管、信贷或 AML 场景的解释首先是制度和证据问题。内部分析可用于模型验证、偏差发现和调试;对客户或审计的说明应引用交易、条款、模型版本与人工决策链。Web3 地址风险也不能用一个 activation 图替代可核验的链上行为。
自检问题
- 热力图合理而消融无效,至少有哪些替代解释?
- “敏感”“参与机制”“业务原因”三种说法的证据门槛有何不同?
- 为什么 attention weight 不是完整贡献度?
- 客户理由至少需要哪些外部证据?
专业课程对齐
- 精读 ARENA 的 mechanistic interpretability 单元,把 attention visualization、linear probe、ablation、activation patching 逐一对齐到可支持的最高主张层级。
- 精读 Stanford CS224N 中 attention/probing/interpretability 课题,检查可视化、可预测性和因果参与之间的语言边界。
- 选读 PyTorch Tutorials 的 model analysis 与 hook 主题,用于审查“消融了什么张量”而不是只接受图表标签。
深入学习提示
先对一个热力图案例填“主张—证据—替代解释—允许措辞”表,再按 ARENA 设计 clean/corrupted、局部 patch 与随机对照,同时测目标 logit 与通用行为损坏。必须明写:“配对输入上输出敏感”是行为证据,不是机制证据;“局部干预改变目标指标”也只支持限定条件下的因果参与。反例是消融一个 head 无变化就否定所有路径,或将 activation 故事直接改写为客户决策理由;业务解释仍须引用可验证输入、规则与责任链。
学后填写区
- 我识别的一句越级解释:
- 对应证据缺口:
- 最小干预与对照:
- 当前允许的结论措辞:
- 业务解释仍需的外部证据: