返回 M01~M90 教材库
M62 · 预习教材教材已备 ≠ 学习已完成

M62:可选探索:Activation 位置或 Verifier 阈值

本日用一次单变量探索体会:改变 activation 的观测/干预位置是在追问内部因果,改变 verifier 阈值是在调整外部决策边界,两者解决的是不同层次的问题。

2026-10-24activation-patchingthresholdprecision-recalloptional-lab

内容类型:预习教材(不代表已完成)
日期:2026-10-24
阶段:P1 · AI Model Engineering 90
周次:W9
节奏:周六可选探索 / 补课
状态:教材已备;学习未完成
标签activation-patching threshold precision-recall optional-lab

一句话定义

本日用一次单变量探索体会:改变 activation 的观测/干预位置是在追问内部因果,改变 verifier 阈值是在调整外部决策边界,两者解决的是不同层次的问题。

学习目标

  1. 学会一次只改变一个变量,避免把探索做成无边界调参。
  2. 了解层、token 位置和通道选择怎样影响 activation 解释。
  3. 了解 verifier 阈值怎样改变通过率、误放与误拒。
  4. 在精力不足时,知道怎样把本日安全地用于补课或恢复。

核心知识

路线 A:换一个 Activation 位置

对同一对输入,记录早层、中层和晚层,或问题 token、证据 token 与答案 token 的 activation。早层往往更接近局部形式,晚层更接近任务输出,但这只是常见趋势,不是普遍定律。若做 replacement/patching,应保持模型、输入、生成配置不变,只替换一个明确位置,并比较目标指标。

合理的问题是:“把干净样本在层 L、位置 P 的状态替换到受扰样本后,目标 token 概率是否稳定变化?”不合理的问题是:“这一层是不是模型的真正思想?”前者有可观测变量和反事实,后者没有可证伪边界。

路线 B:换一个 Verifier 阈值

若 verifier 输出分数 s,决策可以写为 s ≥ t 时通过。提高阈值通常降低通过率,可能减少误放但增加误拒;降低阈值则相反。阈值不是模型属性,而是错误成本、基准率和人工容量共同决定的业务参数。

不要只比较 accuracy。至少列出 precision、recall、coverage/通过率,以及两类错误的数量或成本。若允许拒答,还应单独记录“系统没有自动决定”的比例。小样本只能帮助理解方向,不能支持生产阈值结论。

机制与推导

Activation 路线的最小因果结构是:固定输入对 → 选择单一内部位置 → 干预 → 测量输出差值 → 用对照位置排除普遍扰动。Verifier 路线的最小决策结构是:固定一组带标签样本 → 扫描少量阈值 → 计算混淆矩阵 → 叠加错误成本 → 选择候选区间。

二者的共同方法论是“变量隔离”。如果同时换输入、层位、生成 seed 和指标,结果无法归因;如果同时换 judge、阈值和数据集,也无法知道收益来自哪里。

最小练习或观察步骤

二选一即可,也可不做:

A. Activation 纸上实验

  1. 写出干净输入与受扰输入。
  2. 选择一个层位和一个 token 位置。
  3. 写下预期干预方向与可测指标。
  4. 再选一个无关位置作为负对照。
  5. 仅预先定义观察表,不填写未运行结果。

B. 阈值手算

准备 8 个合成分数与标签,分别用 0.4、0.6、0.8 三个阈值计算 TP、FP、TN、FN。假设误放成本为误拒的五倍,再比较总决策损失。重点是解释阈值变化,不是寻找“完美值”。

常见误区

  • 只展示最符合预期的层或阈值,忽略其他候选和负对照。
  • 用很少样本宣布找到了机制或生产阈值。
  • 把 activation 大小与重要性画等号。
  • 阈值变化后只看准确率,不看覆盖率和错误成本。
  • 周六探索不断扩张,挤占恢复时间。

场景连接

文档字段 verifier 可对金额置信分数设置“自动通过 / 人工复核 / 拒绝”两级阈值;AML 告警阈值应结合漏报与误报成本;链上地址风险分数要把标签时效和证据来源纳入判断。Activation 干预更适合研发诊断,例如检查模型是否依赖文档模板位置,而不适合直接生成客户拒绝理由。

自检问题

  1. 为什么更换 activation 位置与更换 verifier 阈值不能用同一种结论表述?
  2. 什么是负对照位置?
  3. 阈值由哪些成本和约束决定?
  4. 一次探索中为什么要固定其余变量?

专业课程对齐

  • ARENA Mechanistic Interpretability:对应 activation 定位与因果干预;关注位置选择为何要覆盖目标点、邻近点和负对照点,而不是只展示一个“最显著”位置。
  • TransformerLens 官方文档:对应 hooks、cached activations 与 patching 的可复现实现;核对 token 索引、层号、组件名和张量维度是否真的保持一致。
  • Stanford CS329S:对应生产 ML 的指标、测试与决策阈值视角;用于理解 verifier threshold 必须连接误接收、误拒绝、覆盖率、延迟与人工复核成本。

深入学习提示

今天只选择一条路线。若走 activation 路线,先精读 ARENA 导论,再查 TransformerLens API:固定提示词、随机种子、读出指标与下游层,只移动一个 hook 位置;至少保存目标位置、相邻位置、负对照位置和无干预基线,并报告效应方向与幅度。若走 verifier 路线,先选读 CS329S 的评估与部署材料,写出成本函数 $C(t)=c_{FP}FP(t)+c_{FN}FN(t)+c_RR(t)$,然后只扫少量阈值,观察 precision、recall、coverage 和拒答率,而非挑最好看的准确率。两条路线都要按“先声明变量和停止条件 → 再观察 → 最后写有限结论”的顺序;未运行时仅保留实验设计,不填写假想结果。

记录中还应把模型输出变化与 verifier 最终接受动作分成两列,避免阈值变化造成的业务决定被误写成模型内部能力发生改变。

学后填写区

  • 我选择:探索 / 补课 / 休息
  • 若探索,我改变的唯一变量:
  • 预先定义的观察指标:
  • 我没有资格从本次探索推出的结论:
  • 下周是否需要回看:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。