返回 G01~G90 教材库
G18 · 总 Day 198教材已备 ≠ 学习已完成

G18:Verifier 错误、消融与搜索放大

Verifier 决定搜索把计算投向哪里;当它存在系统性假阳性时,更多候选和更深搜索可能不是稀释错误,而是更有效地找到并放大能骗过评分器的错误路径。

2027-03-11falsepositive、process/outcomeverifier、回溯消融与Goodhart风险

内容类型:预习教材(不代表已完成)
日期:2027-03-11
阶段:P3 · AGI Foundations 90
总路线:Day 198 / 360
周次 / 节奏:W3 · 周四争议与反例
状态:教材已备;学习未完成
主题:false positive、process/outcome verifier、回溯消融与 Goodhart 风险

一句话定义

Verifier 决定搜索把计算投向哪里;当它存在系统性假阳性时,更多候选和更深搜索可能不是稀释错误,而是更有效地找到并放大能骗过评分器的错误路径。

学习目标

  1. 能区分 outcome verifier、process verifier 与 deterministic verifier 的信息和盲区。
  2. 能推导候选数量增加时 verifier false positive 的累积风险。
  3. 能设计 verifier removal、backtracking removal 与 corrupted verifier 三类轻量消融。
  4. 能识别“搜索更强但真实正确率更低”的反例,并写清证据边界。

核心知识

Outcome verifier 只看最终答案,易构造且成本较低,但无法定位中间推理何时偏离;process verifier 对步骤评分,可早期剪枝,却需要可靠过程标签,并可能奖励表面形式;deterministic verifier 执行明确规则,在封闭任务中最可靠,但现实开放问题通常没有完整可执行真值。

Verifier 的 precision 关心判为通过的候选中多少真实正确,recall 关心真实正确候选有多少被保留。搜索通常特别怕 false positive:错误路径一旦高分,会获得更多展开预算;也怕 false negative:正确但非典型路径被早期剪除后无法恢复。单独在随机候选上测 verifier,可能低估被优化搜索主动发现的对抗性错误。

过程文本也不是事实机制。一个错误答案可以附带看似规范的步骤,一个正确答案可能用不同但合法的简写。Process verifier 若偏爱长度、关键词或格式,tree search 会优化这些代理特征。

机制与推导

设每个错误候选被 verifier 错判为通过的概率为 f。在独立近似下,N 个错误候选至少一个假阳性的概率是:

[ P_{FP}(N)=1-(1-f)^N ]

即使 f=0.02,N 增大时累计风险也快速上升。实际候选并不独立,且搜索会定向寻找高分区域;若 verifier 缺陷可被利用,风险可能比公式更高。

最终选择可写为 c*=argmax V(c),真实目标是 Y(c)。当 V 只是 Y 的代理,优化强度增加会把候选推向 V-Y 误差较大的区域,这是一种 Goodhart 现象。可用双 verifier 诊断:搜索使用 V_search,最终由独立 deterministic V_true 复核。两者差距随预算扩大,是重要失败信号。

消融一:移除 verifier,随机选或取首个候选,观察选择贡献;消融二:保留 verifier 但禁用回溯,观察搜索控制贡献;消融三:向 verifier 注入特定假阳性,例如把含某字符串的错误表达式加分,观察预算增加是否恶化真实正确率。所有实验只用于无害 toy task。

最小练习或观察步骤

  1. 为 Game of 24 定义真实 deterministic verifier,再构造一个有 5% 随机假阳性的 noisy verifier。
  2. 计算 f=0.01/0.05N=1/8/32 的理想累计假阳性风险。
  3. 设计三种条件:无选择器、正常 verifier、被污染 verifier;固定候选生成预算。
  4. 加入“包含冗长步骤得分更高”的错误特征,思考搜索会怎样适应。
  5. 记录 search score、true correctness、false-positive path 与被剪掉的正确候选,不只记录最终成功。

常见误区与边界

  • 在静态 IID 样本上 verifier 很准,就假设被搜索优化时同样可靠。
  • 只报告 recall,不报告 false positive 与最终 precision。
  • 认为 process verifier 看见步骤就等于看见真实内部推理。
  • 用同一模型生成、评价并最终复核,称为独立验证。
  • Corrupted verifier 实验涉及真实有害任务或外部执行;本日只用封闭无害题。
  • 发现 verifier 风险后断言搜索无用;结论应是收益依赖验证质量和预算控制。

研究/系统场景连接

金融反欺诈中,模型可以优化“被规则引擎判为正常”的代理目标,而真实损失在标签延迟后才显现。若自动 Agent 根据同一代理反复改写方案,可能越来越符合检查格式,却偏离业务意图。独立人工抽查、延迟真值与权限上限提供不同保护,但都不是完美 verifier。

工具 Agent 的参数校验可以是 deterministic,例如金额格式、余额、权限与幂等;“这笔交易是否合理”则不是。系统应区分可执行硬约束与不确定软评价,避免用语言模型高分替代法规或业务真值。W11 会进一步讨论 monitor 与 control;当前只观察 verifier 误差如何被优化放大。

自检问题

  1. Outcome 与 process verifier 的主要盲区各是什么?
  2. 为什么搜索优化后的分布不同于 verifier 的静态测试分布?
  3. P_FP(N) 的独立近似可能低估哪类风险?
  4. 三个消融分别识别什么贡献?
  5. 什么信号表明更多 test-time compute 正在伤害真实目标?

专业课程对齐

深入学习提示

最有价值的扩展不是把 verifier 变得更复杂,而是找到它在哪类候选上失真。为 false positive 建立小型 taxonomy:语法通过但语义错、最终答案碰巧对但过程非法、格式迎合、越权动作。若需要模型 judge,只让它提供一个信号,并保留 deterministic 子检查与人工可读样本。不要把 verifier 分数当作独立真值。

学后填写区

  • 我的三类 verifier:
  • 一个可控假阳性:
  • 三项消融的预期区分:
  • 独立真实复核方式:
  • 预算增加可能变坏的条件:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本