M59:推理路线对比:Single Pass、Self-consistency 与 Verifier Cascade
Test-time compute 用更多采样、搜索或验证换取回答质量;single pass、self-consistency 与 verifier cascade 是计算量、延迟和可靠性不同的三种路线。
内容类型:预习教材(不代表已完成)
日期:2026-10-21
阶段:P1 · AI Model Engineering 90
周次:W9 · 机制可解释性、推理与 verifier
节奏:周三引导练习
状态:教材已备;学习未完成
标签:test-time-compute、self-consistency、verifier-cascade、latency、reasoning
一句话定义
Test-time compute 用更多采样、搜索或验证换取回答质量;single pass、self-consistency 与 verifier cascade 是计算量、延迟和可靠性不同的三种路线。
学习目标
- 能比较三种路线的计算结构与适用条件。
- 能把质量、延迟、token 成本和 verifier 错误分开记录。
- 理解更多推理计算只在候选多样性和选择信号有效时有价值。
核心知识
Single pass 生成一次回答,成本和延迟最低,适合简单、低风险或强约束任务。它没有内部候选比较,错误无法通过重复采样自动暴露。
Self-consistency 对同一问题采样多个推理/答案,再以多数或聚合结果选择。它依赖错误不完全相关且正确答案能在样本中出现。若模型系统性偏差,采样十次可能只是重复同一错误;开放文本也需要可靠的答案归一化。
Verifier cascade 先由一个策略生成一个或多个候选,再用规则、小模型、强模型或工具分层筛选。便宜 verifier 可过滤格式与明显错误,昂贵 verifier 只处理难例。总体质量受生成召回和 verifier 精度共同限制:正确候选未生成,验证器无法创造它。
Test-time compute 还包括 best-of-N、beam/search、迭代修正和工具调用。本日只比较两种路线即可,避免把所有方法混为“模型想得更久”。
机制/推导
若单次独立正确概率为 p,多数投票在理想独立假设下可提高正确率;但模型样本高度相关,真实增益小于二项式理想值。有效样本数取决于多样性而非纯 N。
Cascade 的预期成本可粗写:
C = C_generate + C_cheap + P(escalate)×C_expensive
延迟还取决于候选能否并行、是否早停和队列。选择阈值越严格,可能提升已回答样例质量,却降低覆盖率或增加升级比例。必须同时报告 quality、coverage 与 cost。
最小练习或观察步骤
- 准备 8~15 个可客观核对的合成题,如算术、字段一致性或小逻辑题。
- 在 single pass 与 self-consistency(如 3 个候选)中选两条路线;或比较 single pass 与两级 verifier。
- 固定模型、prompt 和输出上限,记录每题候选数、总 token、时间与最终答案。
- 定义归一化/验证规则,并单独记录无法判定与拒答。
- 查看改进来自“生成了正确候选”还是“verifier 选对了候选”。
- 分析至少一个所有候选同错、一个 verifier 误拒的案例。
- 没有运行条件时,只完成流程与成本表,不填数值。
常见误区
- 把多次生成视为独立样本,套用理想投票增益。
- 只报告准确率,不报告 token、延迟与覆盖率。
- verifier 选错时仍归因于生成模型。
- 用更强模型既生成又评估,忽略相关偏差。
- 为开放问题强行多数投票,答案归一化本身引入错误。
金融 / Web3 / 文档场景连接
金额核对、交易哈希格式和字段关系适合便宜确定性 verifier;模糊责任判断可升级到人工。Cascade 可以把算术、schema 和证据存在性放前层,但不能让模型 judge 单独批准高风险金融决定。
自检问题
- self-consistency 在什么条件下可能有效?
- 为什么正确候选召回是 verifier cascade 的上限之一?
- 阈值变严格时 quality、coverage 和 cost 如何互动?
- 如何区分生成错误与选择错误?
专业课程对齐
- 精读 ARENA 中 search、sampling、RLHF/evaluation 相关单元,将 best-of-N、self-consistency 与 verifier 选择拆成候选生成和选择两个独立环节。
- 精读 HF TRL Quickstart 的 generation/reward function 示例,只映射 candidate count、sampling parameters 与 verifier/reward 接口,不扩展到训练。
- 选读 Stanford CS224N 的 decoding 与 evaluation 课题,回看 greedy、beam/sampling 和任务指标的匹配。
深入学习提示
先画 single pass、self-consistency、verifier cascade 的数据流,再只选两条路线做同题对照。对 self-consistency 写出独立二项假设为何在高相关样本上失效;对 cascade 计算 C=C_gen+C_cheap+P(escalate)C_expensive。同时记录候选数、总 tokens、TTFT/E2E、quality、coverage、verifier false accept/reject,并区分“未生成正确候选”和“已生成但选错”。行为正确率提升仍不是模型内部机制证据;反例是只报最终准确率,掩盖 10 倍 token 成本和覆盖率下降。
学后填写区
- 比较的两条路线:
- 任务与核对规则:
- 成本字段:
- 实际观察(未运行可留空):
- 一个生成失败 / 选择失败边界: