返回 G01~G90 教材库
G19 · 总 Day 199教材已备 ≠ 学习已完成

G19:难度分层与 Adaptive Inference Controller

Adaptive Inference Controller 根据任务难度、当前证据和 verifier 置信度,在明确上限内决定直接回答、继续采样、展开搜索、拒答或转人工,使计算预算服务于边际收益而非统一堆叠。

2027-03-12difficultybin、accuracy–compute–latency曲线与有上限的预算路由

内容类型:预习教材(不代表已完成)
日期:2027-03-12
阶段:P3 · AGI Foundations 90
总路线:Day 199 / 360
周次 / 节奏:W3 · 周五知识整合
状态:教材已备;学习未完成
主题:difficulty bin、accuracy–compute–latency 曲线与有上限的预算路由

一句话定义

Adaptive Inference Controller 根据任务难度、当前证据和 verifier 置信度,在明确上限内决定直接回答、继续采样、展开搜索、拒答或转人工,使计算预算服务于边际收益而非统一堆叠。

学习目标

  1. 能构造与答案不可泄漏的 difficulty bins,并按难度观察策略收益。
  2. 能画 accuracy–compute–latency 曲线,识别收益递减和策略反转。
  3. 能设计一个透明、有限状态的预算控制器,不依赖隐藏思维链。
  4. 能加入 abstain、fallback 与 hard budget,避免 controller 无限循环。

核心知识

难度可以来自任务生成器参数,如表达式搜索空间、最短解深度、干扰项数量;也可来自廉价预估信号,如 greedy confidence、候选分歧或 verifier 未通过次数。不能用最终是否答对倒推难度再在线路由,否则产生标签泄漏。最好用生成器已知属性建立分析分桶,再研究线上可用代理。

边际价值随难度常呈倒 U:简单题直接策略已成功,额外计算浪费;中等题存在正确候选且验证可区分,收益最大;极难题 base proposal 几乎没有正确路径,更多搜索只放大噪声。这个形状不是定律,必须用数据观察。

Controller 的动作可设为 FAST_ANSWER / SAMPLE_MORE / SEARCH / ABSTAIN / HUMAN_REVIEW。状态只保存结构化字段:已用预算、候选数、unique state、verifier 结果、置信区间和失败原因。不需要记录或公开隐藏思维链。

机制与推导

设当前状态 z 下再分配一单位计算的期望成功提升为 Δp(z),成功价值为 u,成本为 c,则继续条件可写成:

[ u\cdot \mathbb{E}[\Delta p(z)] > c ]

真实系统难以准确估计 Δp,可用离线 difficulty-bin 曲线近似。规则 controller 示例:若 deterministic verifier 通过则停止;若预算到 B_max 则 abstain;若候选分歧高且难度中等则增加 N;若连续两轮 unique states 不增则停止;高风险任务即使置信高也转人工。

曲线按每题累计成本画 A(B)。边际收益 ΔA/ΔB 下降时可停止。Latency 要看 p50/p95,而不是只有平均;adaptive 路由会让少数难题占据长尾。还要观察资源公平:某类输入是否系统获得更少预算并导致性能差异。

反例:confidence 在 OOD 上过度自信,controller 将难题误分为简单而快速答错;另一反例是 verifier 反复给模糊分,controller 无限增算。Hard cap、OOD signal 和 stagnation stop 是必要边界。

最小练习或观察步骤

  1. 为 Game of 24 按最短解是否存在、分支数或搜索深度建立三个分析分桶。
  2. 选择 B={1,4,16,64},为每桶预留 success、nodes、verifier calls 和 latency 字段。
  3. 写一个不超过十条规则的 controller,必须包含 success stop、hard cap、stagnation stop 和 abstain。
  4. 构造过度自信 OOD 输入,检查 controller 是否错误走 fast path。
  5. 画一张待填写流程图:输入→难度估计→策略→验证→停止/升级,不写任何预期成绩。

常见误区与边界

  • 用最终正确性定义线上难度,造成后验信息泄漏。
  • 只优化平均计算,忽略 p95 延迟和极端循环。
  • 将模型 confidence 直接当校准概率。
  • 没有 hard cap,期待模型自己决定何时停止。
  • 所有失败都增加计算,忽略 base policy 无覆盖时的无效搜索。
  • 把 controller 当安全保证;它只是预算和路由机制,依赖 verifier 与权限边界。

研究/系统场景连接

金融零售可以用风险×不确定性做路由:低损失且确定的案例走快速规则,高损失或 OOD 案例进入额外检索与人工审核。预算不应由模型自信单独决定,因为历史上少见客群可能过度自信。需要在分析中检查不同客群的升级率和错误率,但本日只设计字段,不预造结果。

Agent 系统可把 controller 放在 planner 外层,限制调用次数、工具类型和总时长。若状态停滞或 verifier 冲突,系统应暂停而非继续自我反思。对真实有副作用动作,human checkpoint 与 sandbox 比更多 token 更重要。

自检问题

  1. 为什么难度与额外预算收益可能呈倒 U?
  2. 什么难度信号可以在线获得,什么只能事后分析?
  3. Stagnation stop 解决哪类循环?
  4. 为什么必须报告 p95 latency 与 abstain?
  5. Confidence shift 会怎样破坏 controller?

专业课程对齐

深入学习提示

先用人工规则 controller,因为它可读、可反例测试。之后若训练路由模型,也保留规则 hard cap 与 fallback。可进一步研究 value of computation、conformal abstention 或 cost-sensitive routing,但不要把它们堆成重 Gate。一张按难度分桶的曲线和两个失败案例,已经能支持深入理解。

学后填写区

  • 我的 difficulty 定义:
  • Controller 的五类动作:
  • 三条停止规则:
  • 一个 OOD 过度自信反例:
  • 需要保留的长尾指标:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本