Block 复盘 + SOTA 检查
B10 走到收口。
阶段: B10 · p95/cost 测量 + 成本级联 + tau2-bench(Day 91-100) 标签: #block-review #milestones #sota-check #baseline
今日导引(由浅入深)
B10 走到收口。
这一程从 Day 91 的延迟/吞吐拆解(p95/p99)出发,经 Day 93 的 $/query、Day 94-95 的成本级联、Day 96-98 的 tau2 双控制 + pass^k,到 Day 99 把三组数据拼成一张能力-成本报告骨架。
B1→B18 曲线上,每个 block 的收口动作固定为三件事:锁里程碑数 + SOTA 复查 + 定下一步。
今天的内核不是新机理,而是把 B10 的产出收敛成「可链接、可量化、状态诚实」的一份东西,并把笔记上架 /learn/aipa。
最小可判定产出:README + dayN-*.md 笔记落地 + git commit(内容侧可立即完成),三里程碑实测值则如实标注待跑(需 key)。
1. 机理精读
Block 收尾的三段式。
(1) 锁里程碑三数——B10 预定三个可链接数字:①压测 p95(N=50 / c=8);②cascade 省 $%;③tau2 retail pass^k。
(2) SOTA 复查——把本 block 引用的主线(vLLM / SGLang / tau2-bench)按当周状态重验,确认没用过时叙事。
(3) 定下一步——明确 B11 起点:用真实 baseline 替换 evalBaseline 的循环自评,对接 B7 gate.ts 的 baseline.json。
为什么是「三数」而不是「三十篇笔记」。 AIPA/AICAP 的 KPI 是「可链接资产 + eval 数字 + 单位成本」,不是笔记数量。 所以 block 收口的硬产出是三个能被 hiring manager 点开复算的数字,而非又一摞文字。 笔记是过程纪律(每天一篇带 YYYY-MM 引用 + SOTA 检查),里程碑数字才是对外的能力凭证。 这也解释了为什么本 block 即使三数仍 gated,也要诚实标注待跑——一个虚标的数字会让整份报告失去可信度,得不偿失。
为什么要把 block 拉通成「能力-成本报告」。 B10 的价值主张是把 LLM/agent 当可测量系统:延迟(p95)、成本($/query、省 $%)、稳定性(pass^k)三维一起报。 这正好回答 AISA hiring manager 四问里的「成本」与「评测」两问。 单独任何一维都没有选型说服力——这份报告的意义是它可链接、可复算、口径一致(Day 99 已建一致性校验)。
为什么下一步是替换循环自评。
B10 的 tau2 用确定性验证函数(Day 97)已经避开了 LLM-judge 单点。
但项目里更老的 evalBaseline 仍有循环弱点:同一规则引擎既预测又被同一作者的合成生成器评分。
B11 起要用固定 baseline.json(B7 gate.ts 消费)+ ground-truth(B14 groundTruthEval.ts 的 prediction-source-agnostic 范式)替换它。
这是从「自己跟自己比」走向「跟外部真值比」的关键一步,也是把 eval gate 真正立起来的前提。
诚实状态是这份复盘的硬约束。
B10 的三里程碑数全部依赖能跑 key 的实测(压测/级联/tau2 scaffold 全 gated)。
所以今天锁的是「数字的位置和口径」,不是「数字本身」。
代码侧(stats.ts / cascade.ts)已 built+tested,内容侧(README + 笔记 + commit)可立即完成;三个实测值如实标注待跑。
这与已有的 REAL 旁证并列呈现,但绝不混淆二者。
2. 推导 / 手算 / 代码走读
收口涉及的真实代码与已落地事实:
src/agent/eval/stats.ts(已 built+tested):summarizeLatency(stats.ts:76)给里程碑①的 p95 口径。- 显著性算法:
pairedBootstrap(stats.ts:36)/requiredNForDelta(stats.ts:59)支撑显著性判断——后者正是 B17「Δ+10.3pp 在 N=29 下不显著、需 ~70 任务」结论的算法来源。 src/agent/runtime/cascade.ts(已 built+tested):cascadeStats(cascade.ts:39)的savedFraction(cascade.ts:52)给里程碑②的省 $% 口径。src/agent/eval/gate.ts(B7,已 built+tested):checkGate(current, baseline, thresholds)(gate.ts:31)是 B11 下一步要对接的目标。- fail closed:gate 在 baseline 存在而 current 缺失/非有限时即记 violation(gate.ts:36-44),所以替换循环自评后,真实
baseline.json一旦缺数就会挡住合并,而不是静默放绿。 src/aml/groundTruthEval.ts(B14):binaryEval的 prediction-source-agnostic 设计(groundTruthEval.ts:1-9, 38)是「外部真值」替换循环自评的范式蓝本。- REAL 旁证(已实测,逐字保留):V4-Flash $0.0139/run;Flash 79.3% / Pro 89.7%(judge=pass);A/B Δ+10.3pp CI[0,20.7] not-sig@N=29。
- 严格区分:上述是真数字,与下面三个 gated 里程碑严格区分,绝不互相冒充。
- 笔记上架:dayN-*.md 走
/learn/aipa浏览路径(与 DSDB 体例一致),内容侧今天即可 commit。
里程碑三数的「位置/口径」锁定(值待 key 跑出):
| # | 里程碑 | 口径来源(已 built+tested) | 实测值状态 |
|---|---|---|---|
| ① | 压测 p95(N=50/c=8) | summarizeLatency(stats.ts:76) | 待跑(需 key) |
| ② | cascade 省 $% | cascadeStats.savedFraction(cascade.ts:52) | 待跑(需 key) |
| ③ | tau2 retail pass^k | Day 98 passK 聚合 | 待跑(需 key, scaffold gated) |
3. 今日实战
- 锁定三里程碑数的位置与口径:①压测 p95(N=50/c=8,源
summarizeLatency);②cascade 省 $%(源cascadeStats.savedFraction);③tau2 retail pass^k(源 Day 98passK)。真实值待 key 跑后回填。 - 补 README:写清 B10 报告骨架、三里程碑占位、REAL 旁证与 gated 项的区分。
- 把 day91-100 笔记发
/learn/aipa(与 DSDB 体例同构)。 git commit(内容侧;不动 gated 数字的真值)。- 记下 B11 起点:用固定
baseline.json(B7gate.ts消费)+ ground-truth 替换evalBaseline循环自评。
B11 替换循环自评的落地草图(下一步预演,不在今天执行):
- 选外部标注源:B14 已点名 IBM AMLworld / Elliptic / PaySim 作为可下载的 labeled set(仍需 download,network-gated)。
- 用真实模型(
deepseek-v4-pro/-flash)跑预测,得{label, predicted}对喂groundTruthEval.binaryEval。 - 把得到的 recall/precision/FPR + bootstrap CI 写进
baseline.json。 gate.ts的checkGate以此 baseline 守门:completionRate 跌幅 > maxCompletionDrop、或 kappa < minKappa、或 unknownRate 超限,即 fail closed。- 至此 eval gate 从「自己跟自己比」升级为「跟外部真值比」,B7 的门才真正有牙。
4. 今日实测 / 产出
- 三里程碑数字 (1)(2)(3) 的实测值 = 待跑(需 key 跑) — 压测 / 级联 / tau2 scaffold 全 gated。
stats.ts/cascade.ts代码侧 = 已 built+tested。- README + 笔记落地 + commit = 可立即完成(内容侧)。
- 已有 REAL 旁证(逐字保留):V4-Flash $0.0139/run;Flash 79.3% / Pro 89.7%;A/B Δ+10.3pp CI[0,20.7] not-sig@N=29。
状态如实:里程碑三数的真值仍 gated,只锁位置/口径;REAL 旁证与 gated 项分开呈现,绝不互相冒充。
5. 常见误区 / 陷阱
- 把「锁里程碑」误读为「数字已出」:B10 锁的是口径与位置,三个实测值仍待 key;混淆即失诚信底线。
- 把 REAL 旁证当成里程碑三数:$0.0139/run、79.3%/89.7% 是已有实测,不等于压测 p95 / 省 $% / pass^k——后者另跑。
- eval baseline 继续用循环自评:B11 必须改用固定
baseline.json+ ground-truth(B7 gate.ts + B14 groundTruthEval)。 - 引用 legacy 模型/价格:deepseek-chat/-reasoner 2026-07-24 退役;价格与平台 GA 当周重验。
- gate 配了阈值却没喂指标:
checkGatefail-closed,缺指标即 violation;B11 接 baseline.json 时务必把 completionRate/kappa/unknownRate 都填齐,否则合并会被正确地挡住。 - 把「笔记发了」当成 block 完成:内容侧上架只是过程,里程碑三数跑出来才算 B10 真正闭环;不要用内容产出掩盖 gated 的实测缺口。
6. 学习资源(每条带 YYYY-MM)
- vLLM V1 引擎 / PagedAttention(serving 主线,当周重验),2026-06。
- SGLang RadixAttention(前缀 KV 复用,当周重验),2026-06。
- tau2-bench 论文(dual-control + pass^k 多轮 agent 评测),2026-03。
- Anthropic "Demystifying evals"(评测方法论 / baseline / HITL),2026-01。
- 本仓
src/agent/eval/gate.ts(B7 fail-closed eval gate,B11 对接目标),2026-06。 - 本仓
src/aml/groundTruthEval.ts(B14 prediction-source-agnostic 外部真值评测),2026-06。 - GRPO 原论文(arXiv:2402.03300,B11 起点后训练机理预读),2024-02。
SOTA检查 (2026-06 更新)
- 当前主流:vLLM(V1 引擎)/ SGLang(RadixAttention)/ tau2-bench(2026-03)均当周仍 SOTA;价格与平台 GA 状态执行当周重验。
- 是否仍 SOTA:是。三者分别是 serving 吞吐、前缀 KV 复用、多轮 agent 评测的当周主线,无更主流替代。
- 过时黑名单:避免 agent eval baseline 用循环自评(改用固定
baseline.json+ ground-truth);避免引用 legacy deepseek-chat/-reasoner(2026-07-24 退役)。 - 下次复查点:B11 起跑前重验 vLLM/SGLang 版本与 DeepSeek 单价;
baseline.json落地后复核gate.ts阈值(maxCompletionDrop / minKappa / maxUnknownRate)。
衔接
- 昨天:Day 99 — 三表整合(M4+M6+M2),口径一致性校验 + p95-vs-$ 散点骨架。
- 今天:B10 收口——锁里程碑三数(位置/口径)+ SOTA 复查 + README/笔记/commit,三实测值待 key。
- 明天:Day 101 — 后训练地图(M5),SFT→RM→PPO→DPO→GRPO 谱系,开启 B11 GRPO/后训练机理。