何时不用 agent gate
B4(Day31-40)从「单 agent 推理形态」一路走到「多 agent 编排 + 三维度量 + 脆弱性证据」。今天是 B4 的收口日:把前面所有数字合并成一张决策 gate——
阶段: B4 · reasoning/planning/multi-agent + 何时不用 agent(Day 31-40) 标签: #decision-gate #build-vs-buy #simplicity-first #aisa-selection
今日导引(由浅入深)
B4(Day31-40)从「单 agent 推理形态」一路走到「多 agent 编排 + 三维度量 + 脆弱性证据」。今天是 B4 的收口日:把前面所有数字合并成一张决策 gate——
- Day38 的 3×3 矩阵(cost / p95 / variance)
- Day39 的 pass^5 脆弱证据
- Day35 的 bootstrap CI(accuracy Δ 显著性)
对同 8 任务的每一条输出「用 / 不用 agent」的判定。这是 AISA 选型论证的骨架:能简单就别复杂,且每个判定都有 CI 背书而非拍脑袋。明天起 B5 转入 tool/context engineering,今天的 gate 是「先证明该不该上 agent,再优化怎么上」的逻辑前提。最小可判定产出:Δaccuracy 的 95% CI(明确是否跨 0)+ ≥1 个 pass^5 < pass@5 的脆弱任务证据。
1. 机理精读
gate 的判据:三个条件同时成立 ⇒ 不用 agent。
- accuracy(带 CI)不输:workflow 的 accuracy 与 agent 的 Δ,其 95% CI 跨 0(差异不显著,Day35 的
pairedBootstrap判定)——即「agent 没证明更准」。 - 成本 / p95 / variance 更优:workflow 在单位成本、p95 延迟、variance 三列上不差于 agent(Day38 的 3×3 矩阵)。
- 任务非脆弱:该任务 pass^5 高(Day39,可复现),不需要 agent 的动态重试 / 多路径来兜底。
三条都满足 ⇒ 选更便宜、更确定、更可测的 workflow。
把原则算法化。这把 Anthropic《Building Effective Agents》(2024-12)的「能简单就别复杂(don't add complexity unless it demonstrably improves outcomes)」原则算法化了:
- 复杂度(agent)只有在「可证明地改善结果」时才允许引入;
- 而「可证明」= 带 CI 的数字,不是直觉。
阈值必须显式。gate 不能是模糊的「感觉差不多就用 workflow」。关键阈值要写死:
- Δaccuracy 的 95% CI 跨 0 ⇒ 选更便宜的 workflow。这条是评审强制项——无 CI 的 build-vs-buy 论证会被当场否决。
- 若 CI 不跨 0(agent 显著更准)但 token 倍数 >2× 且任务可被 workflow + 偶发 HITL 覆盖,仍可判 workflow,把 trade-off 显式化。
为什么是 AISA 的核心论证。
- AI Solutions Architect 面试的高频四问之一就是「为什么这里用 agent / 不用 agent」。
- 能拿出「同 8 任务、五列指标、CI 跨 0、pass^5 证据」的决策表,就是把选型从信仰变成工程——这正是 B4 整条线为之服务的「最小可判定产出」。
与 build-vs-buy 的延续。
- 今天 gate 判的是「agent vs workflow」;
- 同一套带 CI 的多维论证方法,到 P4 会扩展成「自建 vs 托管平台」(mini-AgentCore vs AgentCore / Foundry)的 TCO 论证。
- 方法一致:用数字而非拍脑袋。
2. 推导 / 手算 / 代码走读
今天的 gate 是确定性逻辑(阈值规则可离线定稿),数字依赖前几天的真实跑。
决策表结构(五列):
| task | accuracy + bootstrap 95%CI | p95 延迟 | 单位 token 成本 | variance | pass@5, pass^5 | 判定 |
|---|
gate 伪逻辑(确定性,可单测):
useAgent(task):
ci = pairedBootstrap(agentAcc, workflowAcc).ci95 # stats.ts
if ci 跨 0 and workflow.cost ≤ agent.cost
and workflow.p95 ≤ agent.p95
and task.pass^5 高(非脆弱):
return 'workflow' # 不用 agent
else:
return 'agent' # 需 agent 兜底/动态决策
代码侧全部复用已绿的纯函数:
pairedBootstrap(src/agent/eval/stats.ts:36):算 Δaccuracy 的 95% CI(返回ci95: [lo, hi]),判是否跨 0。已测试绿。cohensKappa(src/agent/eval/cohensKappa.ts)的 bootstrap CI:judge 校准背书,gate 的 accuracy 列不靠未校准的裁判。已测试绿。summarizeLatency/sd(stats.ts:76/:10):p95 与 variance 列。- pass@5 / pass^5:Day39 的 n-run 计算逻辑(离线单测绿)。
注:本仓亦有
src/agent/__tests__/eval/gate.test.ts,对应 gate 决策逻辑的离线测试落点(确定性可测,无 key)。
手算一例(占位):
- 某任务 Δaccuracy CI=[-0.05, +0.12](跨 0)、workflow 成本更低、p95 更低、pass^5=1.0(非脆弱);
- 四条全满足 ⇒ 判 workflow(不用 agent)。
反例:
- 某任务 Δaccuracy CI=[+0.08, +0.22](不跨 0,agent 显著更准)、且 pass^5 低(脆弱);
- ⇒ 判 agent(且建议配 self-consistency / HITL 兜底脆弱性)。
3. 今日实战
- 合并 Day38 的 3×3 指标矩阵 + Day39 的可靠性(pass@5 / pass^5)。
- 对同 8 任务输出 workflow / 单 agent / supervisor-worker 五列(accuracy + bootstrap 95%CI / p95 / 单位 token 成本 / variance / pass@5,pass^5)。
- 按显式阈值(Δaccuracy CI 跨 0 ⇒ 选便宜的 workflow)给每任务「用 / 不用 agent」判定。
- 提交
docs/aipa/day40-when-not-to-agent.md+ 决策表。
4. 今日实测 / 产出
- 决策表骨架 + 阈值规则已可定稿(确定性逻辑)。
- 五列里依赖真实 model 的数字「待跑(需 key)」。
- bootstrap CI 管线(
stats.ts/cohensKappa.ts)已测试绿。 - block 里程碑产出:Δaccuracy 的 95% CI 区间(明确是否跨 0)+ ≥1 个 pass^5 < pass@5 脆弱任务证据。
5. 常见误区 / 陷阱
- 无 CI 的拍脑袋选型:评审强制项——build-vs-buy 必须带 95% CI,否则不成立。
- 阈值不显式:gate 里「跨 0 ⇒ 选 workflow」这类阈值必须写死,不能口头「差不多」。
- 只用一维判:accuracy 不输不够,还要成本 / p95 / variance / 脆弱性全过才判 workflow。
- judge 未校准就信 accuracy:accuracy 列须配 Cohen's κ 校准(κ≥0.6),否则裁判可能高估自己。
6. 学习资源(每条带 YYYY-MM)
- Anthropic《Building Effective Agents》(2024-12)——「能简单就别复杂」原则(gate 的哲学根)。
- Anthropic《Demystifying evals》(2026-01)——多维度量(gate 的指标来源)。
- 本仓
src/agent/eval/stats.ts(pairedBootstrap算 Δaccuracy 95% CI)。 - 本仓
src/agent/eval/cohensKappa.ts(judge↔human κ 校准 + bootstrap CI)。 - 本仓
src/agent/__tests__/eval/gate.test.ts(gate 决策逻辑离线测试)。
SOTA检查 (2026-06 更新)
「能简单就别复杂」+ 多维 gate 是 2026 AISA 选型共识,《Building Effective Agents》(2024-12) + 《Demystifying evals》(2026-01) 双引用现行有效。
- 避免:无 CI 的拍脑袋 build-vs-buy 论证;judge 未经 κ 校准就当最终分数。
- 下次复查点:同一带 CI 的论证方法在 P4 扩展到「自建 vs 托管平台 TCO」时是否需补充私有化 / 合规维度;Anthropic 是否在 2026 出 agent-vs-workflow 决策的新版指南。
衔接
- 昨天:Day 39 — pass@k + pass^k 实测(找出 pass^5 < pass@5 的脆弱任务)。
- 今天:把三维矩阵 + 脆弱证据 + bootstrap CI 收敛成一张「用 / 不用 agent」决策 gate,收口 B4。
- 明天:Day 41 — context engineering 范式(B5 开篇:把模型输入当有限 token 预算经营,从「该不该上 agent」转到「上了 agent 怎么省 token、设计工具」)。