返回 G01~G90 教材库
G17 · 总 Day 197教材已备 ≠ 学习已完成

G17:同预算推理策略比较

同预算策略比较是在相近候选生成、节点展开或模型调用成本下,比较直接生成、重复采样、答案聚合和显式搜索,避免把更多计算带来的收益误归因于某个算法名称。

2027-03-10greedy、best-of-N、self-consistency、treesearch与等预算比较

内容类型:预习教材(不代表已完成)
日期:2027-03-10
阶段:P3 · AGI Foundations 90
总路线:Day 197 / 360
周次 / 节奏:W3 · 周三引导实验
状态:教材已备;学习未完成
主题:greedy、best-of-N、self-consistency、tree search 与等预算比较

一句话定义

同预算策略比较是在相近候选生成、节点展开或模型调用成本下,比较直接生成、重复采样、答案聚合和显式搜索,避免把更多计算带来的收益误归因于某个算法名称。

学习目标

  1. 能为 2~3 种推理策略定义统一任务、模型、提示、verifier 与预算。
  2. 能区分 proposal diversity、aggregation 和 search control 各自的贡献。
  3. 能报告成功率之外的有效样本数、节点数、延迟与失败类型。
  4. 能设计预算归一化与 paired task comparison,不追求不必要的大规模实验。

核心知识

Greedy 提供最低成本参照;best-of-N 依赖候选多样性和选择器;self-consistency 多数投票适用于多条路径收敛到同一可验证答案,但若错误模式高度相关,多数票会稳定地产生错误;tree search 利用中间状态反馈调整后续展开,适合部分路径可早期判错的任务。

公平预算并非只固定输出 token。Tree search 多次调用 proposal 和 value/verifier,best-of-N 生成完整答案,self-consistency 还需聚合。可以选择主预算单位 model forward callsgenerated tokens,同时报告节点和 verifier 次数。若某方法利用确定性程序验证而另一方法没有,应把它作为系统组件差异说明。

Paired comparison 让所有策略处理同一题目集合,按题目比较差异,能减少难度构成噪声。题目还应按 difficulty 分桶:简单题 greedy 已接近饱和,额外预算收益小;中等题可能最大;极难题若 base proposal 几乎从不产生正确片段,搜索也无材料可放大。

机制与推导

Self-consistency 假设正确答案路径具有较大总概率质量。对候选答案计数 n_y,选择 argmax_y n_y。如果一个错误答案因共同提示偏差占 60%,增加样本会让错误多数更稳定。Best-of-N 则选择 argmax_i V(c_i),成功依赖候选覆盖和 verifier 排序。

Tree search 将总预算 B 分到宽度和深度。宽 beam 增加多样性,深展开增加单一路径完成度。固定 B≈width×depth 时,两者存在取舍。若任务必须完成三步,depth 低于三再宽也不能成功;若第一步有很多歧义,过窄 beam 会早早丢解。

定义每题成本 c_i 和成功 s_i,可画 cumulative success 随 budget 的曲线。效率不必压成单值;若需要简单指标,可用 success per 100 verifier calls,但同时保留绝对成功和时延。策略 A 在低预算好、B 在高预算好时,不应只选一个预算点宣布赢家。

最小练习或观察步骤

  1. 在 Game of 24 或另一确定性任务上选 greedy/单路径、best-of-N、tree search 三种策略中的两到三种。
  2. 固定同一题目、proposal source、提示和 verifier,定义预算 B={1,4,16}
  3. 为每题记录 candidate count、unique states、verifier calls、latency 和最终结果。
  4. 按简单/中等/困难分桶,提前写下各策略可能获益的区间,但不预填结果。
  5. 检查候选重复率;若 N 增加但 unique candidate 不增,记录相关性而非继续堆预算。

常见误区与边界

  • Tree search 使用更多模型调用,却与一次 greedy 直接比较。
  • Self-consistency 的多数票没有 canonicalize 等价答案。
  • 只报告所有题平均值,掩盖难度依赖和反转条件。
  • 忽略失败调用和超时,只统计成功轨迹成本。
  • 用不同 verifier 或不同提示,仍称为纯算法消融。
  • 把某一预算点的赢家当成所有成本区间的最佳策略。

研究/系统场景连接

金融异常调查可类比为候选假设生成与证据验证。简单案件用直接规则,复杂案件探索多个解释路径;但调查证据有隐私和合规边界,不能无限调用。按风险和不确定性分配预算,比所有案例统一深搜更合理。自动 verifier 只能检查可编码约束,最终业务结论仍可能需要人工判断。

Agent 规划中,best-of-N 可能产生多个完整计划再选,tree search 则在工具模拟反馈后调整。若工具调用昂贵或有副作用,应使用 stub 并计入成本。策略比较的价值是找出条件化选择规则,而不是宣布某种 prompting 技巧普遍优越。

自检问题

  1. Self-consistency 与 best-of-N 的选择信号有何不同?
  2. 为什么极难题增加预算可能仍无收益?
  3. 固定 width×depth 时,搜索会出现什么取舍?
  4. Paired comparison 如何减少任务难度噪声?
  5. 候选重复率高时,N 的名义预算与有效预算有何差异?

专业课程对齐

深入学习提示

优先使用两个策略、三个预算和少量难度分桶,已经足以看到很多反转。若加入第三种策略,确保预算账本仍可比。进一步可以估算 verifier-aware value of computation,但无需把学习变成竞赛。最值得保存的是“何时某策略变差”的反例,因为它帮助未来构建 adaptive controller。

学后填写区

  • 我比较的策略:
  • 主预算单位与辅助成本:
  • 难度分桶方法:
  • 候选相关性的观察方式:
  • 预期的策略反转条件:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本