G17:同预算推理策略比较
同预算策略比较是在相近候选生成、节点展开或模型调用成本下,比较直接生成、重复采样、答案聚合和显式搜索,避免把更多计算带来的收益误归因于某个算法名称。
内容类型:预习教材(不代表已完成)
日期:2027-03-10
阶段:P3 · AGI Foundations 90
总路线:Day 197 / 360
周次 / 节奏:W3 · 周三引导实验
状态:教材已备;学习未完成
主题:greedy、best-of-N、self-consistency、tree search 与等预算比较
一句话定义
同预算策略比较是在相近候选生成、节点展开或模型调用成本下,比较直接生成、重复采样、答案聚合和显式搜索,避免把更多计算带来的收益误归因于某个算法名称。
学习目标
- 能为 2~3 种推理策略定义统一任务、模型、提示、verifier 与预算。
- 能区分 proposal diversity、aggregation 和 search control 各自的贡献。
- 能报告成功率之外的有效样本数、节点数、延迟与失败类型。
- 能设计预算归一化与 paired task comparison,不追求不必要的大规模实验。
核心知识
Greedy 提供最低成本参照;best-of-N 依赖候选多样性和选择器;self-consistency 多数投票适用于多条路径收敛到同一可验证答案,但若错误模式高度相关,多数票会稳定地产生错误;tree search 利用中间状态反馈调整后续展开,适合部分路径可早期判错的任务。
公平预算并非只固定输出 token。Tree search 多次调用 proposal 和 value/verifier,best-of-N 生成完整答案,self-consistency 还需聚合。可以选择主预算单位 model forward calls 或 generated tokens,同时报告节点和 verifier 次数。若某方法利用确定性程序验证而另一方法没有,应把它作为系统组件差异说明。
Paired comparison 让所有策略处理同一题目集合,按题目比较差异,能减少难度构成噪声。题目还应按 difficulty 分桶:简单题 greedy 已接近饱和,额外预算收益小;中等题可能最大;极难题若 base proposal 几乎从不产生正确片段,搜索也无材料可放大。
机制与推导
Self-consistency 假设正确答案路径具有较大总概率质量。对候选答案计数 n_y,选择 argmax_y n_y。如果一个错误答案因共同提示偏差占 60%,增加样本会让错误多数更稳定。Best-of-N 则选择 argmax_i V(c_i),成功依赖候选覆盖和 verifier 排序。
Tree search 将总预算 B 分到宽度和深度。宽 beam 增加多样性,深展开增加单一路径完成度。固定 B≈width×depth 时,两者存在取舍。若任务必须完成三步,depth 低于三再宽也不能成功;若第一步有很多歧义,过窄 beam 会早早丢解。
定义每题成本 c_i 和成功 s_i,可画 cumulative success 随 budget 的曲线。效率不必压成单值;若需要简单指标,可用 success per 100 verifier calls,但同时保留绝对成功和时延。策略 A 在低预算好、B 在高预算好时,不应只选一个预算点宣布赢家。
最小练习或观察步骤
- 在 Game of 24 或另一确定性任务上选 greedy/单路径、best-of-N、tree search 三种策略中的两到三种。
- 固定同一题目、proposal source、提示和 verifier,定义预算
B={1,4,16}。 - 为每题记录 candidate count、unique states、verifier calls、latency 和最终结果。
- 按简单/中等/困难分桶,提前写下各策略可能获益的区间,但不预填结果。
- 检查候选重复率;若 N 增加但 unique candidate 不增,记录相关性而非继续堆预算。
常见误区与边界
- Tree search 使用更多模型调用,却与一次 greedy 直接比较。
- Self-consistency 的多数票没有 canonicalize 等价答案。
- 只报告所有题平均值,掩盖难度依赖和反转条件。
- 忽略失败调用和超时,只统计成功轨迹成本。
- 用不同 verifier 或不同提示,仍称为纯算法消融。
- 把某一预算点的赢家当成所有成本区间的最佳策略。
研究/系统场景连接
金融异常调查可类比为候选假设生成与证据验证。简单案件用直接规则,复杂案件探索多个解释路径;但调查证据有隐私和合规边界,不能无限调用。按风险和不确定性分配预算,比所有案例统一深搜更合理。自动 verifier 只能检查可编码约束,最终业务结论仍可能需要人工判断。
Agent 规划中,best-of-N 可能产生多个完整计划再选,tree search 则在工具模拟反馈后调整。若工具调用昂贵或有副作用,应使用 stub 并计入成本。策略比较的价值是找出条件化选择规则,而不是宣布某种 prompting 技巧普遍优越。
自检问题
- Self-consistency 与 best-of-N 的选择信号有何不同?
- 为什么极难题增加预算可能仍无收益?
- 固定
width×depth时,搜索会出现什么取舍? - Paired comparison 如何减少任务难度噪声?
- 候选重复率高时,N 的名义预算与有效预算有何差异?
专业课程对齐
- 阅读 Self-Consistency Improves Chain of Thought Reasoning,关注路径采样与答案边缘化的假设。
- 阅读 Tree of Thoughts,把 proposal、evaluation 与 search 分别作为可消融组件。
- 阅读 Scaling LLM Test-Time Compute Optimally Can Be More Effective than Scaling Model Parameters,观察不同难度下策略与预算如何条件化选择。
深入学习提示
优先使用两个策略、三个预算和少量难度分桶,已经足以看到很多反转。若加入第三种策略,确保预算账本仍可比。进一步可以估算 verifier-aware value of computation,但无需把学习变成竞赛。最值得保存的是“何时某策略变差”的反例,因为它帮助未来构建 adaptive controller。
学后填写区
- 我比较的策略:
- 主预算单位与辅助成本:
- 难度分桶方法:
- 候选相关性的观察方式:
- 预期的策略反转条件: