模型策略 memo
在 B1→B18 能力曲线上,今天是 B12 这十天的收口,也是把整段「RLVR 机理 → 对照实验 → Δ±CI → 显著性裁决 → gap→数据」凝成一件作品级交付物的一天。前面九天每天产出一块拼图(base 基线、tuned 对照、Δ±CI、verdict、gap-to-data);今天把它们串成一页可执行决策 memo,回答 hiring manager 会问的三件事:现在该不该换模型?该
阶段: B12 · RLVR + 模型策略 memo(Day 111-120) 标签: #decision-memo #model-strategy #aisa-portfolio #eval-rigor
今日导引(由浅入深)
在 B1→B18 能力曲线上,今天是 B12 这十天的收口,也是把整段「RLVR 机理 → 对照实验 → Δ±CI → 显著性裁决 → gap→数据」凝成一件作品级交付物的一天。前面九天每天产出一块拼图(base 基线、tuned 对照、Δ±CI、verdict、gap-to-data);今天把它们串成一页可执行决策 memo,回答 hiring manager 会问的三件事:现在该不该换模型?该补什么数据?用什么指标验收?这正是 AISA 面试「为什么这样选模型」的标准答卷。今天的最小可判定产出是 model-strategy-memo.md(1 页 + Δ chart)。明天(Day 121)跨入 B13,从通用 eval 转向 FATF 五大洗钱类型学——把这套实验严谨性搬到金融合规场景。
1. 机理精读
memo 的本质:把一串评测产物压成一个决策。 一页模型策略 memo 不是报告堆叠,而是「证据 → 判断 → 行动」的最短路径。 它必须把 Day 117 的 Δ±CI、Day 118 的显著性裁决、Day 119 的 gap→数据→指标三列表,整合成对三个问题的直接回答: (1) 该不该换模型——看 Δ 的方向与 CI 是否跨 0; (2) 该补什么数据——来自 gap-to-data 的 top-3; (3) 用什么指标验收——每个 gap 绑的 eval 指标。 一页的约束是刻意的:逼你只留决策相关信息,砍掉过程噪声。读者(hiring manager 或老板)应在 60 秒内读完并知道下一步该做什么。
一页 memo 骨架(落盘 model-strategy-memo.md 的章节模板):
# 模型策略 memo — base vs tuned(DeepSeek-V3 vs Qwen3 代理)
## 1 结论(一句话) 方向性更优但不显著 / 显著 → 行动
## 2 证据 Δ±95% CI 图(dashboard 渲染)+ wins/losses/ties + 成本/partial
## 3 裁决 significant? Y/N + κ;不显著则写「需 ~N 任务」
## 4 数据计划 top-3 gap × 构造方案 × 验收指标(来自 Day 119)
## 5 待跑/风险 标注哪些数字待 GPU/key;版本号执行当周复查
为什么 memo 是 AISA 作品的核心件而非附属。 AI Solutions Architect 的差异化不在「会调模型」,而在「能讲清为什么这样选」。 一页带 Δ±CI 图、带诚实裁决、带数据补救路径的 memo,恰好证明候选人具备四项能力:实验设计(控变量)、统计素养(CI 而非点估)、工程闭环(eval→data)、以及最稀缺的——在数据不支持时敢写「不显著」的诚实。 这比一句「我把准确率提了 10 个点」有说服力得多,因为后者在 N=29、CI 触 0 的现实里其实站不住,懂行的面试官一追问就破。
诚实裁决是这页 memo 的最高约束。 已落地 A/B 给出的真实数字是 V4-Pro 89.7% vs V4-Flash 79.3%、Δ+10.3pp、95% CI [0.0, 20.7]、not-sig @ N=29。 在不显著的 Δ 上写「换模型」是 eval-rigor 的红线违规——CI 下界压在 0,意味着「无差异」没被排除。 诚实的 memo 写法是:「方向性更优(V4-Pro 领先),但 N=29 下不显著,扩到 ~70 任务再裁;在此之前,模型选型应结合成本($0.0139/run)与 partial-credit(0.900)综合权衡,而非仅凭这个未显著的 Δ。」 这一句把统计、成本、诚实三者一并交代——也顺带说明:当 Δ 不显著时,成本反而成了选型的主要依据。
与相邻概念的边界。 今天 ≠ 重跑实验(前九天的产物已就位,今天只整合); 今天 ≠ 真的换模型/真的训练(block 里程碑的 base-vs-tuned 即 DeepSeek-V3 vs Qwen3 的具体 Δ 仍待 GPU/key); 今天 ≠ B13 的合规场景(明天才把这套严谨性搬到 FATF 类型学)。 今天交付的是「一页决策 + 一张 Δ chart」,是 B12 的句号。
2. 代码走读:dashboard 渲染 Δ chart
Read 了 src/agent/eval/dashboard.ts(metric-tree 看板脚手架,纯函数,无 key),它负责把 eval 报告聚成一张可嵌进 memo 的 metric 快照:
buildDashboard(reports)— 入参是一组EvalReportLike(各含n/completionRate/partialCreditMean/unknownRate/codePassRate/totalCostUsd/judgeHumanKappa/model)。流程:- 空数组时返回
note: 'no eval reports yet — run pnpm eval:agent (needs an API key) to populate live data'——诚实的空态,不伪造数字。这正好对应 b12 真跑结果未到位时看板的样子。 nsm(North Star Metric)= task autonomous completion,取各报告completionRate的均值(unit='rate')。leaves(叶子指标)= partial-credit mean、code-check pass、unknown rate、cost (USD/run)、judge-human kappa——逐项取均值。totalTasks= 各报告n求和;runs= 报告数。
- 空数组时返回
- 设计要点:纯函数、takes reports in——fs 读取放在
scripts/build-dashboard.ts,dashboard.ts 保持 bundler-safe、可单测、无网络。这让 memo 里的 Δ chart 数据来源是「真实跑出的 report」而非硬编码。 - 与 memo 的对接:把 base 与 tuned 两份 report 喂进去得到两个 completionRate,配合 Day 117 的
abCompare输出的ci95,即可渲染 base/tuned 双柱 + Δ 误差棒的 chart。
走读结论:abCompare(Δ+CI)/ dashboard(指标快照)管线已绿(built+tested);memo 的 Δ chart 可用真实 A/B 数字即时渲染,b12 自训 tuned 的具体 Δ 则待跑。
3. 今日实战
- 写
model-strategy-memo.md(严格 1 页),三段结构:① 实验结论(Δ±CI + 显著性裁决);② 模型选型建议(结合成本/partial);③ 数据补救计划(Day 119 的 gap→数据→指标三列表)。 - 嵌入 Day 117 的 Δ±CI 图——用
src/agent/eval/dashboard.ts的buildDashboard取 base/tuned 的 completionRate,配abCompare的 ci95 渲染双柱 + 误差棒。 - 整合 Day 118 的裁决(significant? Y/N + κ)与 Day 119 的 gap→数据→指标表。
- 用真实 A/B 数字打底(见下),未跑出的 b12 自训 Δ 明确标「待跑(需 key)」,绝不写成已完成。
4. 今日实测 / 产出
- 产出物:
model-strategy-memo.md(1 页 + Δ chart)。 - 可写入的真实数字(逐字保留):V4-Pro 89.7% vs V4-Flash 79.3%、Δ+10.3pp、CI[0, 20.7]、not-sig @ N=29、$0.0139/run、partial 0.900。
- 状态:block 里程碑的 base-vs-tuned(DeepSeek-V3 vs Qwen3)具体 Δ = 待跑(需 key 跑);
abCompare/dashboard管线已绿。
5. 常见误区 / 陷阱
- 在不显著 Δ 上写「换模型」结论:CI 触 0 还下结论是红线。诚实写「方向性更优,扩到 ~70 任务再裁」。
- memo 超过一页:堆过程细节稀释决策。一页约束就是逼你只留「证据→判断→行动」。
- Δ chart 用硬编码数字:dashboard.ts 设计成 takes-reports-in 就是为了让 chart 源于真实 report;硬编码即作弊。空态要诚实显示「no eval reports yet」。
- 把待跑的自训 Δ 写成已完成:b12 自训 tuned 的 Δ 需 GPU/key,未跑出前只能标待跑——这是这套笔记的诚信底线。
- 不显著时忽略成本维度:Δ 不显著意味着「能力上分不出高下」,此时 $/run、延迟、partial 反而是选型主依据;只盯 Δ 会漏掉真正能拍板的信息。
6.5 B12 十天回望(这条能力链的闭合)
B12 把 Day 111-120 串成一条完整的「测得准、说得清」链路: RLVR 原理(D111)→ reward hacking 谱系(D112)→ GRPO 奖励信号(D113)→ 实验设计基础(D114)→ base 基线(D115)→ tuned 对照(D116)→ Δ±CI(D117)→ 显著性裁决(D118)→ gap→数据(D119)→ 一页 memo(D120)。 前半段(111-113)是「奖励/训练机理」,后半段(114-120)是「把训练结果当因果实验来评判并决策」。 B12 交付的不是某个高分,而是一套可复用、可追问、敢写不显著的模型选型方法论——这正是 B13 起把同样严谨性搬进 AML 合规场景时要带过去的东西。
6. 学习资源(每条带 YYYY-MM)
- Anthropic — Demystifying evals(2026-01):Δ 必带 CI、不显著不上结论、eval 驱动的决策叙事。
- Statsig — Sequential Testing / always-valid p-values(2026-01):何时可裁、扩样本的功效逻辑。
- DeepSeek V4 模型卡 / 定价页(2026,执行当周复查
deepseek-v4-pro/-flashid;legacydeepseek-chat/-reasoner2026-07-24 退役)。 - 本仓代码:
src/agent/eval/dashboard.ts、src/agent/eval/abCompare.ts(已 built+tested)。
7. 面试视角 / 关键要点
这页 memo 本身就是 AISA 面试「为什么这样选模型」的作品级答案,面试官的追问与答法:
- 「你最后换模型了吗?」 → 没有定论:Δ+10.3pp 但 CI[0,20.7] 不显著 @N=29;当能力分不出高下时,按成本($0.0139/run)与 partial(0.900)权衡,并把「扩到 ~70 任务再裁」写进计划。
- 「这页 memo 凭什么可信?」 → 每个数字可溯源:Δ±CI 来自
abCompare的配对 bootstrap,chart 由dashboard.buildDashboard取真实 report 渲染(非硬编码),待跑项全部诚实标注。 - 「如果 CI 不跨 0 你会怎么写?」 → 那才写「显著、建议切换」,并附迁移成本与回滚条件;显著性是换模型结论的前置条件。
- 「下一步具体做什么?」 → 执行 Day 119 的 top-3 gap 数据计划,补完用 per-gap 指标验收,再扩样本重跑显著性裁决——闭环回到 eval。
一句话总结:一页 memo 把十天的实验压成「证据→判断→行动」,最难也最值钱的是敢在不显著时写「再等等」——这就是 B12 的收口。
SOTA检查 (2026-06 更新)
- 现役主线:一页决策 memo + Δ±CI 图是 2026 AISA 作品规范——证据→判断→行动,带统计 CI、带成本、带数据补救路径。
- 避免/禁用:避免在不显著 Δ 上写「换模型」结论(诚实写「方向性更优,扩到 ~70 任务再裁」);避免 Δ chart 硬编码数字。禁用退役 legacy 模型 id 当锚点(
deepseek-chat/-reasoner2026-07-24 退役)。 - 下次复查点:复查 DeepSeek V4(
deepseek-v4-pro/-flash)id 是否变更(执行当周,legacy 2026-07-24 退役);b12 自训 base-vs-tuned 的 Δ 待 GPU/key 跑出后回填,并重跑显著性裁决。
8. 产出状态速查
| 项 | 状态 | 备注 |
|---|---|---|
model-strategy-memo.md(1 页 + Δ chart) | 可写真实数字打底 | 嵌 Δ±CI 图、裁决、gap 计划 |
abCompare / dashboard 管线 | 已绿(built+tested) | chart 取真实 report,非硬编码 |
| b12 自训 base-vs-tuned(DeepSeek-V3 vs Qwen3)具体 Δ | 待跑(需 key 跑) | 未跑出前标待跑,不得升级 |
| 真实数字 | 已落地 | V4-Pro 89.7% / V4-Flash 79.3% / Δ+10.3pp CI[0,20.7] not-sig@N=29 / $0.0139/run / partial 0.900 |
衔接
- 昨天:Day 119 — Gap→数据构造(从失败样本聚类 top-3 gap,每个绑构造方案 + eval 指标,
gap-to-data.md)。 - 今天:把 Δ±CI、裁决、gap→数据→指标串成一页
model-strategy-memo.md(+ Δ chart),B12 收口。 - 明天:Day 121 — FATF 五大类型学签名(B13 起点:structuring/layering/integration/TBML/money mule 的可观测签名 + AMLworld 合成集,把实验严谨性搬进金融合规)。