返回 AICAP-180
B10 · Day 100p95/cost 测量 + 成本级联 + tau2-bench

Block 复盘 + SOTA 检查

B10 走到收口。

阶段: B10 · p95/cost 测量 + 成本级联 + tau2-bench(Day 91-100) 标签: #block-review #milestones #sota-check #baseline

今日导引(由浅入深)

B10 走到收口。 这一程从 Day 91 的延迟/吞吐拆解(p95/p99)出发,经 Day 93 的 $/query、Day 94-95 的成本级联、Day 96-98 的 tau2 双控制 + pass^k,到 Day 99 把三组数据拼成一张能力-成本报告骨架。 B1→B18 曲线上,每个 block 的收口动作固定为三件事:锁里程碑数 + SOTA 复查 + 定下一步。 今天的内核不是新机理,而是把 B10 的产出收敛成「可链接、可量化、状态诚实」的一份东西,并把笔记上架 /learn/aipa。 最小可判定产出:README + dayN-*.md 笔记落地 + git commit(内容侧可立即完成),三里程碑实测值则如实标注待跑(需 key)。

1. 机理精读

Block 收尾的三段式。 (1) 锁里程碑三数——B10 预定三个可链接数字:①压测 p95(N=50 / c=8);②cascade 省 $%;③tau2 retail pass^k。 (2) SOTA 复查——把本 block 引用的主线(vLLM / SGLang / tau2-bench)按当周状态重验,确认没用过时叙事。 (3) 定下一步——明确 B11 起点:用真实 baseline 替换 evalBaseline 的循环自评,对接 B7 gate.tsbaseline.json

为什么是「三数」而不是「三十篇笔记」。 AIPA/AICAP 的 KPI 是「可链接资产 + eval 数字 + 单位成本」,不是笔记数量。 所以 block 收口的硬产出是三个能被 hiring manager 点开复算的数字,而非又一摞文字。 笔记是过程纪律(每天一篇带 YYYY-MM 引用 + SOTA 检查),里程碑数字才是对外的能力凭证。 这也解释了为什么本 block 即使三数仍 gated,也要诚实标注待跑——一个虚标的数字会让整份报告失去可信度,得不偿失。

为什么要把 block 拉通成「能力-成本报告」。 B10 的价值主张是把 LLM/agent 当可测量系统:延迟(p95)、成本($/query、省 $%)、稳定性(pass^k)三维一起报。 这正好回答 AISA hiring manager 四问里的「成本」与「评测」两问。 单独任何一维都没有选型说服力——这份报告的意义是它可链接、可复算、口径一致(Day 99 已建一致性校验)。

为什么下一步是替换循环自评。 B10 的 tau2 用确定性验证函数(Day 97)已经避开了 LLM-judge 单点。 但项目里更老的 evalBaseline 仍有循环弱点:同一规则引擎既预测又被同一作者的合成生成器评分。 B11 起要用固定 baseline.json(B7 gate.ts 消费)+ ground-truth(B14 groundTruthEval.ts 的 prediction-source-agnostic 范式)替换它。 这是从「自己跟自己比」走向「跟外部真值比」的关键一步,也是把 eval gate 真正立起来的前提。

诚实状态是这份复盘的硬约束。 B10 的三里程碑数全部依赖能跑 key 的实测(压测/级联/tau2 scaffold 全 gated)。 所以今天锁的是「数字的位置和口径」,不是「数字本身」。 代码侧(stats.ts / cascade.ts)已 built+tested,内容侧(README + 笔记 + commit)可立即完成;三个实测值如实标注待跑。 这与已有的 REAL 旁证并列呈现,但绝不混淆二者。

2. 推导 / 手算 / 代码走读

收口涉及的真实代码与已落地事实:

  • src/agent/eval/stats.ts(已 built+tested)summarizeLatency(stats.ts:76)给里程碑①的 p95 口径。
  • 显著性算法pairedBootstrap(stats.ts:36)/ requiredNForDelta(stats.ts:59)支撑显著性判断——后者正是 B17「Δ+10.3pp 在 N=29 下不显著、需 ~70 任务」结论的算法来源。
  • src/agent/runtime/cascade.ts(已 built+tested)cascadeStats(cascade.ts:39)的 savedFraction(cascade.ts:52)给里程碑②的省 $% 口径。
  • src/agent/eval/gate.ts(B7,已 built+tested)checkGate(current, baseline, thresholds)(gate.ts:31)是 B11 下一步要对接的目标。
  • fail closed:gate 在 baseline 存在而 current 缺失/非有限时即记 violation(gate.ts:36-44),所以替换循环自评后,真实 baseline.json 一旦缺数就会挡住合并,而不是静默放绿。
  • src/aml/groundTruthEval.ts(B14)binaryEval 的 prediction-source-agnostic 设计(groundTruthEval.ts:1-9, 38)是「外部真值」替换循环自评的范式蓝本。
  • REAL 旁证(已实测,逐字保留):V4-Flash $0.0139/run;Flash 79.3% / Pro 89.7%(judge=pass);A/B Δ+10.3pp CI[0,20.7] not-sig@N=29
  • 严格区分:上述是真数字,与下面三个 gated 里程碑严格区分,绝不互相冒充。
  • 笔记上架:dayN-*.md 走 /learn/aipa 浏览路径(与 DSDB 体例一致),内容侧今天即可 commit。

里程碑三数的「位置/口径」锁定(值待 key 跑出):

#里程碑口径来源(已 built+tested)实测值状态
压测 p95(N=50/c=8)summarizeLatency(stats.ts:76)待跑(需 key)
cascade 省 $%cascadeStats.savedFraction(cascade.ts:52)待跑(需 key)
tau2 retail pass^kDay 98 passK 聚合待跑(需 key, scaffold gated)

3. 今日实战

  1. 锁定三里程碑数的位置与口径:①压测 p95(N=50/c=8,源 summarizeLatency);②cascade 省 $%(源 cascadeStats.savedFraction);③tau2 retail pass^k(源 Day 98 passK)。真实值待 key 跑后回填。
  2. 补 README:写清 B10 报告骨架、三里程碑占位、REAL 旁证与 gated 项的区分。
  3. 把 day91-100 笔记发 /learn/aipa(与 DSDB 体例同构)。
  4. git commit(内容侧;不动 gated 数字的真值)。
  5. 记下 B11 起点:用固定 baseline.json(B7 gate.ts 消费)+ ground-truth 替换 evalBaseline 循环自评。

B11 替换循环自评的落地草图(下一步预演,不在今天执行):

  1. 选外部标注源:B14 已点名 IBM AMLworld / Elliptic / PaySim 作为可下载的 labeled set(仍需 download,network-gated)。
  2. 用真实模型(deepseek-v4-pro / -flash)跑预测,得 {label, predicted} 对喂 groundTruthEval.binaryEval
  3. 把得到的 recall/precision/FPR + bootstrap CI 写进 baseline.json
  4. gate.tscheckGate 以此 baseline 守门:completionRate 跌幅 > maxCompletionDrop、或 kappa < minKappa、或 unknownRate 超限,即 fail closed。
  5. 至此 eval gate 从「自己跟自己比」升级为「跟外部真值比」,B7 的门才真正有牙。

4. 今日实测 / 产出

  • 三里程碑数字 (1)(2)(3) 的实测值 = 待跑(需 key 跑) — 压测 / 级联 / tau2 scaffold 全 gated。
  • stats.ts / cascade.ts 代码侧 = 已 built+tested
  • README + 笔记落地 + commit = 可立即完成(内容侧)
  • 已有 REAL 旁证(逐字保留):V4-Flash $0.0139/run;Flash 79.3% / Pro 89.7%;A/B Δ+10.3pp CI[0,20.7] not-sig@N=29。

状态如实:里程碑三数的真值仍 gated,只锁位置/口径;REAL 旁证与 gated 项分开呈现,绝不互相冒充。

5. 常见误区 / 陷阱

  • 把「锁里程碑」误读为「数字已出」:B10 锁的是口径与位置,三个实测值仍待 key;混淆即失诚信底线。
  • 把 REAL 旁证当成里程碑三数:$0.0139/run、79.3%/89.7% 是已有实测,不等于压测 p95 / 省 $% / pass^k——后者另跑。
  • eval baseline 继续用循环自评:B11 必须改用固定 baseline.json + ground-truth(B7 gate.ts + B14 groundTruthEval)。
  • 引用 legacy 模型/价格:deepseek-chat/-reasoner 2026-07-24 退役;价格与平台 GA 当周重验。
  • gate 配了阈值却没喂指标checkGate fail-closed,缺指标即 violation;B11 接 baseline.json 时务必把 completionRate/kappa/unknownRate 都填齐,否则合并会被正确地挡住。
  • 把「笔记发了」当成 block 完成:内容侧上架只是过程,里程碑三数跑出来才算 B10 真正闭环;不要用内容产出掩盖 gated 的实测缺口。

6. 学习资源(每条带 YYYY-MM)

  • vLLM V1 引擎 / PagedAttention(serving 主线,当周重验),2026-06。
  • SGLang RadixAttention(前缀 KV 复用,当周重验),2026-06。
  • tau2-bench 论文(dual-control + pass^k 多轮 agent 评测),2026-03。
  • Anthropic "Demystifying evals"(评测方法论 / baseline / HITL),2026-01。
  • 本仓 src/agent/eval/gate.ts(B7 fail-closed eval gate,B11 对接目标),2026-06。
  • 本仓 src/aml/groundTruthEval.ts(B14 prediction-source-agnostic 外部真值评测),2026-06。
  • GRPO 原论文(arXiv:2402.03300,B11 起点后训练机理预读),2024-02。

SOTA检查 (2026-06 更新)

  • 当前主流:vLLM(V1 引擎)/ SGLang(RadixAttention)/ tau2-bench(2026-03)均当周仍 SOTA;价格与平台 GA 状态执行当周重验。
  • 是否仍 SOTA:是。三者分别是 serving 吞吐、前缀 KV 复用、多轮 agent 评测的当周主线,无更主流替代。
  • 过时黑名单:避免 agent eval baseline 用循环自评(改用固定 baseline.json + ground-truth);避免引用 legacy deepseek-chat/-reasoner(2026-07-24 退役)。
  • 下次复查点:B11 起跑前重验 vLLM/SGLang 版本与 DeepSeek 单价;baseline.json 落地后复核 gate.ts 阈值(maxCompletionDrop / minKappa / maxUnknownRate)。

衔接

  • 昨天:Day 99 — 三表整合(M4+M6+M2),口径一致性校验 + p95-vs-$ 散点骨架。
  • 今天:B10 收口——锁里程碑三数(位置/口径)+ SOTA 复查 + README/笔记/commit,三实测值待 key。
  • 明天:Day 101 — 后训练地图(M5),SFT→RM→PPO→DPO→GRPO 谱系,开启 B11 GRPO/后训练机理。