返回 AICAP-180
B4 · Day 40reasoning/planning/multi-agent + 何时不用 agent

何时不用 agent gate

B4(Day31-40)从「单 agent 推理形态」一路走到「多 agent 编排 + 三维度量 + 脆弱性证据」。今天是 B4 的收口日:把前面所有数字合并成一张决策 gate——

阶段: B4 · reasoning/planning/multi-agent + 何时不用 agent(Day 31-40) 标签: #decision-gate #build-vs-buy #simplicity-first #aisa-selection

今日导引(由浅入深)

B4(Day31-40)从「单 agent 推理形态」一路走到「多 agent 编排 + 三维度量 + 脆弱性证据」。今天是 B4 的收口日:把前面所有数字合并成一张决策 gate——

  • Day38 的 3×3 矩阵(cost / p95 / variance)
  • Day39 的 pass^5 脆弱证据
  • Day35 的 bootstrap CI(accuracy Δ 显著性)

对同 8 任务的每一条输出「用 / 不用 agent」的判定。这是 AISA 选型论证的骨架:能简单就别复杂,且每个判定都有 CI 背书而非拍脑袋。明天起 B5 转入 tool/context engineering,今天的 gate 是「先证明该不该上 agent,再优化怎么上」的逻辑前提。最小可判定产出:Δaccuracy 的 95% CI(明确是否跨 0)+ ≥1 个 pass^5 < pass@5 的脆弱任务证据。

1. 机理精读

gate 的判据:三个条件同时成立 ⇒ 不用 agent

  1. accuracy(带 CI)不输:workflow 的 accuracy 与 agent 的 Δ,其 95% CI 跨 0(差异不显著,Day35 的 pairedBootstrap 判定)——即「agent 没证明更准」。
  2. 成本 / p95 / variance 更优:workflow 在单位成本、p95 延迟、variance 三列上不差于 agent(Day38 的 3×3 矩阵)。
  3. 任务非脆弱:该任务 pass^5 高(Day39,可复现),不需要 agent 的动态重试 / 多路径来兜底。

三条都满足 ⇒ 选更便宜、更确定、更可测的 workflow。

把原则算法化。这把 Anthropic《Building Effective Agents》(2024-12)的「能简单就别复杂(don't add complexity unless it demonstrably improves outcomes)」原则算法化了:

  • 复杂度(agent)只有在「可证明地改善结果」时才允许引入;
  • 而「可证明」= 带 CI 的数字,不是直觉。

阈值必须显式。gate 不能是模糊的「感觉差不多就用 workflow」。关键阈值要写死:

  • Δaccuracy 的 95% CI 跨 0 ⇒ 选更便宜的 workflow。这条是评审强制项——无 CI 的 build-vs-buy 论证会被当场否决。
  • 若 CI 不跨 0(agent 显著更准)但 token 倍数 >2× 且任务可被 workflow + 偶发 HITL 覆盖,仍可判 workflow,把 trade-off 显式化。

为什么是 AISA 的核心论证

  • AI Solutions Architect 面试的高频四问之一就是「为什么这里用 agent / 不用 agent」。
  • 能拿出「同 8 任务、五列指标、CI 跨 0、pass^5 证据」的决策表,就是把选型从信仰变成工程——这正是 B4 整条线为之服务的「最小可判定产出」。

与 build-vs-buy 的延续

  • 今天 gate 判的是「agent vs workflow」;
  • 同一套带 CI 的多维论证方法,到 P4 会扩展成「自建 vs 托管平台」(mini-AgentCore vs AgentCore / Foundry)的 TCO 论证。
  • 方法一致:用数字而非拍脑袋。

2. 推导 / 手算 / 代码走读

今天的 gate 是确定性逻辑(阈值规则可离线定稿),数字依赖前几天的真实跑。

决策表结构(五列)

taskaccuracy + bootstrap 95%CIp95 延迟单位 token 成本variancepass@5, pass^5判定

gate 伪逻辑(确定性,可单测):

useAgent(task):
  ci = pairedBootstrap(agentAcc, workflowAcc).ci95   # stats.ts
  if ci 跨 0 and workflow.cost ≤ agent.cost
       and workflow.p95 ≤ agent.p95
       and task.pass^5 高(非脆弱):
     return 'workflow'   # 不用 agent
  else:
     return 'agent'      # 需 agent 兜底/动态决策

代码侧全部复用已绿的纯函数

  • pairedBootstrapsrc/agent/eval/stats.ts:36):算 Δaccuracy 的 95% CI(返回 ci95: [lo, hi]),判是否跨 0。已测试绿
  • cohensKappasrc/agent/eval/cohensKappa.ts)的 bootstrap CI:judge 校准背书,gate 的 accuracy 列不靠未校准的裁判。已测试绿
  • summarizeLatency / sdstats.ts:76 / :10):p95 与 variance 列。
  • pass@5 / pass^5:Day39 的 n-run 计算逻辑(离线单测绿)。

注:本仓亦有 src/agent/__tests__/eval/gate.test.ts,对应 gate 决策逻辑的离线测试落点(确定性可测,无 key)。

手算一例(占位):

  • 某任务 Δaccuracy CI=[-0.05, +0.12](跨 0)、workflow 成本更低、p95 更低、pass^5=1.0(非脆弱);
  • 四条全满足 ⇒ 判 workflow(不用 agent)

反例

  • 某任务 Δaccuracy CI=[+0.08, +0.22](不跨 0,agent 显著更准)、且 pass^5 低(脆弱);
  • ⇒ 判 agent(且建议配 self-consistency / HITL 兜底脆弱性)。

3. 今日实战

  1. 合并 Day38 的 3×3 指标矩阵 + Day39 的可靠性(pass@5 / pass^5)。
  2. 对同 8 任务输出 workflow / 单 agent / supervisor-worker 五列(accuracy + bootstrap 95%CI / p95 / 单位 token 成本 / variance / pass@5,pass^5)。
  3. 按显式阈值(Δaccuracy CI 跨 0 ⇒ 选便宜的 workflow)给每任务「用 / 不用 agent」判定。
  4. 提交 docs/aipa/day40-when-not-to-agent.md + 决策表。

4. 今日实测 / 产出

  • 决策表骨架 + 阈值规则已可定稿(确定性逻辑)。
  • 五列里依赖真实 model 的数字「待跑(需 key)」。
  • bootstrap CI 管线(stats.ts / cohensKappa.ts已测试绿
  • block 里程碑产出:Δaccuracy 的 95% CI 区间(明确是否跨 0)+ ≥1 个 pass^5 < pass@5 脆弱任务证据

5. 常见误区 / 陷阱

  • 无 CI 的拍脑袋选型:评审强制项——build-vs-buy 必须带 95% CI,否则不成立。
  • 阈值不显式:gate 里「跨 0 ⇒ 选 workflow」这类阈值必须写死,不能口头「差不多」。
  • 只用一维判:accuracy 不输不够,还要成本 / p95 / variance / 脆弱性全过才判 workflow。
  • judge 未校准就信 accuracy:accuracy 列须配 Cohen's κ 校准(κ≥0.6),否则裁判可能高估自己。

6. 学习资源(每条带 YYYY-MM)

  • Anthropic《Building Effective Agents》(2024-12)——「能简单就别复杂」原则(gate 的哲学根)。
  • Anthropic《Demystifying evals》(2026-01)——多维度量(gate 的指标来源)。
  • 本仓 src/agent/eval/stats.tspairedBootstrap 算 Δaccuracy 95% CI)。
  • 本仓 src/agent/eval/cohensKappa.ts(judge↔human κ 校准 + bootstrap CI)。
  • 本仓 src/agent/__tests__/eval/gate.test.ts(gate 决策逻辑离线测试)。

SOTA检查 (2026-06 更新)

「能简单就别复杂」+ 多维 gate 是 2026 AISA 选型共识,《Building Effective Agents》(2024-12) + 《Demystifying evals》(2026-01) 双引用现行有效。

  • 避免:无 CI 的拍脑袋 build-vs-buy 论证;judge 未经 κ 校准就当最终分数。
  • 下次复查点:同一带 CI 的论证方法在 P4 扩展到「自建 vs 托管平台 TCO」时是否需补充私有化 / 合规维度;Anthropic 是否在 2026 出 agent-vs-workflow 决策的新版指南。

衔接

  • 昨天:Day 39 — pass@k + pass^k 实测(找出 pass^5 < pass@5 的脆弱任务)。
  • 今天:把三维矩阵 + 脆弱证据 + bootstrap CI 收敛成一张「用 / 不用 agent」决策 gate,收口 B4。
  • 明天:Day 41 — context engineering 范式(B5 开篇:把模型输入当有限 token 预算经营,从「该不该上 agent」转到「上了 agent 怎么省 token、设计工具」)。