返回 G01~G90 教材库
G20 · 总 Day 200教材已备 ≠ 学习已完成

G20:何时搜索胜过直接生成,何时更坏

搜索胜过直接生成的关键不在于“想得更久”,而在于任务能被分解、正确路径能被 proposal 覆盖、中间或最终状态可可靠验证,并且额外计算的收益高于延迟和错误放大成本。

2027-03-13搜索适用条件、verifier-boundedreasoning与策略选择

内容类型:预习教材(不代表已完成)
日期:2027-03-13
阶段:P3 · AGI Foundations 90
总路线:Day 200 / 360
周次 / 节奏:W3 · 周六可选探索
状态:教材已备;学习未完成
主题:搜索适用条件、verifier-bounded reasoning 与策略选择

一句话定义

搜索胜过直接生成的关键不在于“想得更久”,而在于任务能被分解、正确路径能被 proposal 覆盖、中间或最终状态可可靠验证,并且额外计算的收益高于延迟和错误放大成本。

学习目标

  1. 能用任务结构、proposal coverage、verifier quality 和 budget 四轴解释搜索收益。
  2. 能列出至少三种搜索变坏的机制,而不简单归因于“模型不够强”。
  3. 能区分搜索、在线学习、参数更新和自我反思文本。
  4. 能把 W3 内容压缩成一张策略选择表与开放问题清单。

核心知识

搜索适合有明确状态转移、可枚举候选、局部反馈与可验证终点的任务,如组合题、程序测试和棋类。直接生成适合答案短、模型先验强、验证困难或时延极敏感的场景。Best-of-N 位于中间:无需显式状态,却需要候选级选择信号。

Proposal coverage 是先决条件。若生成器从不提出关键动作,再聪明的搜索也找不到解。Verifier resolution 决定剪枝能否区分相近候选;若所有中间状态得分相同,tree search 退化为盲搜。Branching factor 与 horizon 决定组合复杂度,预算不可能覆盖时需要高质量 heuristic。

搜索变坏至少有五种机制:候选高度相关导致无效重复;错误 verifier 被优化放大;启发式早剪掉正确路径;长 horizon 让局部分数与终点目标错位;计算增加带来超时和业务成本。还有 selection bias:只展示搜索成功题,忽略直接生成已足够的简单题。

机制与推导

可把搜索价值粗写为:

[ V_{search}\approx Coverage(B)\times Selectivity(V)-Cost(B)-ErrorAmplification(B,V) ]

这不是估计公式,而是机制清单。Coverage(B) 随预算增加但会饱和;Selectivity 依赖 verifier 区分正确与错误;ErrorAmplification 可能随优化强度增加。只看 coverage 的理想公式会高估收益。

策略选择表可按条件划分:确定性 verifier+中等分支+存在多路径,优先 search;只有终点 verifier+候选可独立生成,考虑 best-of-N;无可靠 verifier+base confidence 高,优先 direct 或人工;高风险有副作用任务,先沙箱与权限控制,不用更多搜索替代安全边界。

搜索不同于在线学习:它不修改参数,只在当前任务上探索状态;外部记忆更新也不一定是参数学习;“反思”文本只有在改变候选或状态转移时才构成算法步骤。把这些概念分开,才能解释 test-time compute 到底做了什么。

最小练习或观察步骤

  1. 选择数学题、开放建议、工具计划三个任务,为四轴条件各打“高/中/低”并解释。
  2. 为每个任务选择 direct、best-of-N、search 或 human review,不追求统一答案。
  3. 构造一个错误 verifier:偏爱更长表达式,推演搜索深度增加后可能发生什么。
  4. 构造一个 coverage failure:正确第一步永不被 proposal 产生,说明增加哪种预算无效。
  5. 把 W3 未解决问题标为 H/C,例如“中间过程评分是否稳定迁移到 OOD”。

常见误区与边界

  • 认为搜索一定优于生成,因为它计算更多。
  • 把重复采样叫 tree search,却没有显式状态、回溯或分支控制。
  • 把模型生成的反思文本当作参数学习或独立验证。
  • 用搜索通过自动 judge 的分数证明真实正确性。
  • 忽略简单题的延迟损失和难题的 coverage 上限。
  • 将封闭可验证任务结论推广到价值判断、法规解释或开放科研问题。

研究/系统场景连接

金融方案生成中,可执行法规、余额与权限适合确定性验证,客户适当性和复杂例外则不一定。系统可以在硬约束内搜索,但不能让代理分数替代人工责任。若搜索发现“符合规则但明显不合理”的方案,恰好说明 specification 不完整。

Agent 工具使用适合 planner 提案、sandbox 模拟、verifier 检查、controller 限额的组合。真实执行前仍需权限和人类检查点。研究场景则可把数学或代码问题放进 verifier-bounded loop,但 novelty 和科学意义没有简单确定性 verifier,后续 AI Scientist 阶段会重新讨论。

自检问题

  1. 搜索收益的四个必要或约束条件是什么?
  2. Coverage failure 为什么不能靠更强 verifier 修复?
  3. 错误 heuristic 与错误 final verifier 的传播路径有何不同?
  4. 搜索和在线学习的核心区别是什么?
  5. 哪类任务应优先人工判断,而不是增加 test-time compute?

专业课程对齐

深入学习提示

用“若……则优先……”写条件化策略,不写“某算法最好”。若某任务没有 verifier,先问能否构造局部可执行检查,而不是立刻引入另一个模型 judge。可以进一步探索 program synthesis、MCTS 或 uncertainty-guided search,但保留同预算 direct baseline。失败路径比最终答案更能帮助理解搜索。

学后填写区

  • 我的四轴策略表:
  • 一个 coverage failure:
  • 一个 verifier amplification 反例:
  • 搜索与学习的边界:
  • 带入 W4 的开放问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本