G19:难度分层与 Adaptive Inference Controller
Adaptive Inference Controller 根据任务难度、当前证据和 verifier 置信度,在明确上限内决定直接回答、继续采样、展开搜索、拒答或转人工,使计算预算服务于边际收益而非统一堆叠。
内容类型:预习教材(不代表已完成)
日期:2027-03-12
阶段:P3 · AGI Foundations 90
总路线:Day 199 / 360
周次 / 节奏:W3 · 周五知识整合
状态:教材已备;学习未完成
主题:difficulty bin、accuracy–compute–latency 曲线与有上限的预算路由
一句话定义
Adaptive Inference Controller 根据任务难度、当前证据和 verifier 置信度,在明确上限内决定直接回答、继续采样、展开搜索、拒答或转人工,使计算预算服务于边际收益而非统一堆叠。
学习目标
- 能构造与答案不可泄漏的 difficulty bins,并按难度观察策略收益。
- 能画 accuracy–compute–latency 曲线,识别收益递减和策略反转。
- 能设计一个透明、有限状态的预算控制器,不依赖隐藏思维链。
- 能加入 abstain、fallback 与 hard budget,避免 controller 无限循环。
核心知识
难度可以来自任务生成器参数,如表达式搜索空间、最短解深度、干扰项数量;也可来自廉价预估信号,如 greedy confidence、候选分歧或 verifier 未通过次数。不能用最终是否答对倒推难度再在线路由,否则产生标签泄漏。最好用生成器已知属性建立分析分桶,再研究线上可用代理。
边际价值随难度常呈倒 U:简单题直接策略已成功,额外计算浪费;中等题存在正确候选且验证可区分,收益最大;极难题 base proposal 几乎没有正确路径,更多搜索只放大噪声。这个形状不是定律,必须用数据观察。
Controller 的动作可设为 FAST_ANSWER / SAMPLE_MORE / SEARCH / ABSTAIN / HUMAN_REVIEW。状态只保存结构化字段:已用预算、候选数、unique state、verifier 结果、置信区间和失败原因。不需要记录或公开隐藏思维链。
机制与推导
设当前状态 z 下再分配一单位计算的期望成功提升为 Δp(z),成功价值为 u,成本为 c,则继续条件可写成:
[ u\cdot \mathbb{E}[\Delta p(z)] > c ]
真实系统难以准确估计 Δp,可用离线 difficulty-bin 曲线近似。规则 controller 示例:若 deterministic verifier 通过则停止;若预算到 B_max 则 abstain;若候选分歧高且难度中等则增加 N;若连续两轮 unique states 不增则停止;高风险任务即使置信高也转人工。
曲线按每题累计成本画 A(B)。边际收益 ΔA/ΔB 下降时可停止。Latency 要看 p50/p95,而不是只有平均;adaptive 路由会让少数难题占据长尾。还要观察资源公平:某类输入是否系统获得更少预算并导致性能差异。
反例:confidence 在 OOD 上过度自信,controller 将难题误分为简单而快速答错;另一反例是 verifier 反复给模糊分,controller 无限增算。Hard cap、OOD signal 和 stagnation stop 是必要边界。
最小练习或观察步骤
- 为 Game of 24 按最短解是否存在、分支数或搜索深度建立三个分析分桶。
- 选择
B={1,4,16,64},为每桶预留 success、nodes、verifier calls 和 latency 字段。 - 写一个不超过十条规则的 controller,必须包含 success stop、hard cap、stagnation stop 和 abstain。
- 构造过度自信 OOD 输入,检查 controller 是否错误走 fast path。
- 画一张待填写流程图:输入→难度估计→策略→验证→停止/升级,不写任何预期成绩。
常见误区与边界
- 用最终正确性定义线上难度,造成后验信息泄漏。
- 只优化平均计算,忽略 p95 延迟和极端循环。
- 将模型 confidence 直接当校准概率。
- 没有 hard cap,期待模型自己决定何时停止。
- 所有失败都增加计算,忽略 base policy 无覆盖时的无效搜索。
- 把 controller 当安全保证;它只是预算和路由机制,依赖 verifier 与权限边界。
研究/系统场景连接
金融零售可以用风险×不确定性做路由:低损失且确定的案例走快速规则,高损失或 OOD 案例进入额外检索与人工审核。预算不应由模型自信单独决定,因为历史上少见客群可能过度自信。需要在分析中检查不同客群的升级率和错误率,但本日只设计字段,不预造结果。
Agent 系统可把 controller 放在 planner 外层,限制调用次数、工具类型和总时长。若状态停滞或 verifier 冲突,系统应暂停而非继续自我反思。对真实有副作用动作,human checkpoint 与 sandbox 比更多 token 更重要。
自检问题
- 为什么难度与额外预算收益可能呈倒 U?
- 什么难度信号可以在线获得,什么只能事后分析?
- Stagnation stop 解决哪类循环?
- 为什么必须报告 p95 latency 与 abstain?
- Confidence shift 会怎样破坏 controller?
专业课程对齐
- 阅读 Scaling LLM Test-Time Compute Optimally Can Be More Effective than Scaling Model Parameters,提取按难度选择策略和预算的经验依据。
- 参考 Berkeley CS188 教材 的 Search 章节中 heuristic 与 graph search,理解 controller 仍依赖状态、评价和终止条件。
- 阅读 Let’s Verify Step by Step,思考过程信号能否帮助早停,以及其标签与分布边界。
深入学习提示
先用人工规则 controller,因为它可读、可反例测试。之后若训练路由模型,也保留规则 hard cap 与 fallback。可进一步研究 value of computation、conformal abstention 或 cost-sensitive routing,但不要把它们堆成重 Gate。一张按难度分桶的曲线和两个失败案例,已经能支持深入理解。
学后填写区
- 我的 difficulty 定义:
- Controller 的五类动作:
- 三条停止规则:
- 一个 OOD 过度自信反例:
- 需要保留的长尾指标: