返回 M01~M90 教材库
M59 · 预习教材教材已备 ≠ 学习已完成

M59:推理路线对比:Single Pass、Self-consistency 与 Verifier Cascade

Test-time compute 用更多采样、搜索或验证换取回答质量;single pass、self-consistency 与 verifier cascade 是计算量、延迟和可靠性不同的三种路线。

2026-10-21test-time-compute、self-consistency、verifier-cascade、latency、reasoning

内容类型:预习教材(不代表已完成)
日期:2026-10-21
阶段:P1 · AI Model Engineering 90
周次:W9 · 机制可解释性、推理与 verifier
节奏:周三引导练习
状态:教材已备;学习未完成
标签:test-time-compute、self-consistency、verifier-cascade、latency、reasoning

一句话定义

Test-time compute 用更多采样、搜索或验证换取回答质量;single pass、self-consistency 与 verifier cascade 是计算量、延迟和可靠性不同的三种路线。

学习目标

  1. 能比较三种路线的计算结构与适用条件。
  2. 能把质量、延迟、token 成本和 verifier 错误分开记录。
  3. 理解更多推理计算只在候选多样性和选择信号有效时有价值。

核心知识

Single pass 生成一次回答,成本和延迟最低,适合简单、低风险或强约束任务。它没有内部候选比较,错误无法通过重复采样自动暴露。

Self-consistency 对同一问题采样多个推理/答案,再以多数或聚合结果选择。它依赖错误不完全相关且正确答案能在样本中出现。若模型系统性偏差,采样十次可能只是重复同一错误;开放文本也需要可靠的答案归一化。

Verifier cascade 先由一个策略生成一个或多个候选,再用规则、小模型、强模型或工具分层筛选。便宜 verifier 可过滤格式与明显错误,昂贵 verifier 只处理难例。总体质量受生成召回和 verifier 精度共同限制:正确候选未生成,验证器无法创造它。

Test-time compute 还包括 best-of-N、beam/search、迭代修正和工具调用。本日只比较两种路线即可,避免把所有方法混为“模型想得更久”。

机制/推导

若单次独立正确概率为 p,多数投票在理想独立假设下可提高正确率;但模型样本高度相关,真实增益小于二项式理想值。有效样本数取决于多样性而非纯 N。

Cascade 的预期成本可粗写:

C = C_generate + C_cheap + P(escalate)×C_expensive

延迟还取决于候选能否并行、是否早停和队列。选择阈值越严格,可能提升已回答样例质量,却降低覆盖率或增加升级比例。必须同时报告 quality、coverage 与 cost。

最小练习或观察步骤

  1. 准备 8~15 个可客观核对的合成题,如算术、字段一致性或小逻辑题。
  2. 在 single pass 与 self-consistency(如 3 个候选)中选两条路线;或比较 single pass 与两级 verifier。
  3. 固定模型、prompt 和输出上限,记录每题候选数、总 token、时间与最终答案。
  4. 定义归一化/验证规则,并单独记录无法判定与拒答。
  5. 查看改进来自“生成了正确候选”还是“verifier 选对了候选”。
  6. 分析至少一个所有候选同错、一个 verifier 误拒的案例。
  7. 没有运行条件时,只完成流程与成本表,不填数值。

常见误区

  • 把多次生成视为独立样本,套用理想投票增益。
  • 只报告准确率,不报告 token、延迟与覆盖率。
  • verifier 选错时仍归因于生成模型。
  • 用更强模型既生成又评估,忽略相关偏差。
  • 为开放问题强行多数投票,答案归一化本身引入错误。

金融 / Web3 / 文档场景连接

金额核对、交易哈希格式和字段关系适合便宜确定性 verifier;模糊责任判断可升级到人工。Cascade 可以把算术、schema 和证据存在性放前层,但不能让模型 judge 单独批准高风险金融决定。

自检问题

  1. self-consistency 在什么条件下可能有效?
  2. 为什么正确候选召回是 verifier cascade 的上限之一?
  3. 阈值变严格时 quality、coverage 和 cost 如何互动?
  4. 如何区分生成错误与选择错误?

专业课程对齐

  • 精读 ARENA 中 search、sampling、RLHF/evaluation 相关单元,将 best-of-N、self-consistency 与 verifier 选择拆成候选生成和选择两个独立环节。
  • 精读 HF TRL Quickstart 的 generation/reward function 示例,只映射 candidate count、sampling parameters 与 verifier/reward 接口,不扩展到训练。
  • 选读 Stanford CS224N 的 decoding 与 evaluation 课题,回看 greedy、beam/sampling 和任务指标的匹配。

深入学习提示

先画 single pass、self-consistency、verifier cascade 的数据流,再只选两条路线做同题对照。对 self-consistency 写出独立二项假设为何在高相关样本上失效;对 cascade 计算 C=C_gen+C_cheap+P(escalate)C_expensive。同时记录候选数、总 tokens、TTFT/E2E、quality、coverage、verifier false accept/reject,并区分“未生成正确候选”和“已生成但选错”。行为正确率提升仍不是模型内部机制证据;反例是只报最终准确率,掩盖 10 倍 token 成本和覆盖率下降。

学后填写区

  • 比较的两条路线:
  • 任务与核对规则:
  • 成本字段:
  • 实际观察(未运行可留空):
  • 一个生成失败 / 选择失败边界:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。