claude-cookbooks + 全局 SOTA 复核
Day 171-172 读的是两个具体框架(smolagents 的 agent 主循环、DeepEval/Inspect 的评测口径)。今天把视角一次性拉到全局:执行 AICAP 硬纪律——agent 领域半衰期约 6 个月,必须逐项确认整条主线资料是否还活着、还是不是 SOTA。
阶段: B18 · OSS 收口 + 英文 + 全局 SOTA 复核(Day 171-180) 标签: #sota-recheck #claude-cookbooks #grpo #mcp
今日导引(由浅入深)
Day 171-172 读的是两个具体框架(smolagents 的 agent 主循环、DeepEval/Inspect 的评测口径)。今天把视角一次性拉到全局:执行 AICAP 硬纪律——agent 领域半衰期约 6 个月,必须逐项确认整条主线资料是否还活着、还是不是 SOTA。
手法是先扫 Anthropic claude-cookbooks 的 evals/agents 章节取最新模式,再用 WebSearch 逐项复核 GRPO、MCP、模型 id 等是否仍为主线,并至少标出 1 个已过时叙事。
在 B1→B18 曲线上,这一天是「把前 172 天用过的所有外部资料做一次过期体检」的位置——上承 Day 172 的评测框架(DeepEval/Inspect 进复核表),下接 Day 174 起的 OSS 实操(贡献前必须确认目标 repo/技术未冻结)。
最小可判定产出:一张 8 行 sota-recheck.md 表(框架/技术 → 当前版本 → 是否仍主线 → 替代/风险),含至少 1 个已过时叙事。
一句话锚点:今天不是学新技术,而是给前 172 天用过的每条资料盖一个「保质期」章——这是把顶层时效性硬规则从口号变成可重跑周循环的一天。
1. 机理精读
为什么要做全局 SOTA 复核:半衰期纪律。 AICAP 顶层时效性硬规则要求所有学习输出以近 6-12 个月资料为主线。
agent 领域尤其快——平台 GA 状态、版本号、规范定稿日期会在数周内翻篇。半衰期约 6 个月意味着:半年前还对的主线,今天可能已被替代。复核不是走形式,是把「引用过的每一条资料」当成会腐烂的依赖,定期跑一次过期扫描。依据:AICAP 顶层硬规则 + agent 领域迭代节奏(2026)。
claude-cookbooks 的作用:取最新模式而非旧记忆。 Anthropic 维护的 claude-cookbooks 是「官方第一方、随模型更新」的实战样例库。
扫它的 evals/agents 章节,是为了用第一方最新模式覆盖训练记忆里的旧做法(比如 RAG-centric 旧叙事 vs context-engineering 新叙事)。这正是「用搜索结果优先于训练记忆」硬规则的具体执行。依据:Anthropic claude-cookbooks (2026)。
为什么半衰期偏偏是「约 6 个月」(用本表佐证)。 看上表第 5/7 行就懂:MCP 从 RC(2026-05-21)到最终规范(2026-07-28)只隔两个多月;DeepSeek 模型 id 从 chat/reasoner 到 v4 的退役窗口(2026-07-24)也在半年内。
agent 栈的三个快变量——模型 id、平台 GA 状态、协议规范定稿日——任意一个翻篇都能让半年前的主线叙事过期。这就是「半衰期约 6 个月」不是拍脑袋,而是对这三个变量翻篇频率的经验估计。
逐项复核的技术锚点。
- GRPO(arXiv:2402.03300):Group Relative Policy Optimization,no-critic(去 critic 网络)的 RL 路线,用组内相对优势替代价值网络。R1(arXiv:2501.12948)验证了它在推理模型训练上的有效性。复核结论:仍是 no-critic RL 主线。
- MCP(2026-07-28 最终规范):stateless core 方向已锁(RC 2026-05-21)。复核结论:规范定稿日尚未到,因此任何「真 MCP server 构建」必须排在 2026-07-28 之后——这是硬日期约束。
- 模型 id:legacy
deepseek-chat/deepseek-reasoner2026-07-24 退役,须迁到deepseek-v4-pro/deepseek-v4-flash。 - 叙事过时:「RAG-centric」被 context-engineering 取代;「AI Act 高风险 2026-08 生效」旧时间线已推迟到 2027-12-02(须从所有合规叙事里改掉)。
从 claude-cookbooks 取什么模式(具体到三类)。 扫 cookbooks 不是泛读,而是带着三个问题去对照本仓:
- judge 设计:cookbooks 的 eval 样例如何写 judge prompt(grade outcome / 允许 unknown / partial credit)——对照本仓
agentEval.ts的JUDGE_SYSTEM,确认我们的口径没落后。 - agent loop:cookbooks 的 agent 样例如何组织工具调用与停机条件——对照本仓
toolRegistry.ts的 tools/list + tools/call 契约。 - 安全/HITL:cookbooks 对「危险动作需人审」的处理——对照本仓 AML 侧的 auto-file 禁止(HITL 闸门)。
每一项的结论只有两种:「本仓口径与第一方最新一致」或「本仓需更新」。这就是复核的可执行落点。
边界:复核 ≠ 全盘推翻。 复核要分清「过时叙事」与「长青方法」。GRPO/MCP/bootstrap CI/Cohen's κ 这类是长青或仍 SOTA,不能因为「要复核」就误删。复核的产物是一张表——明确标「仍主线 / 有替代 / 已过时」三态,而非一刀切。
2. 推导 / 手算 / 代码走读
今天是表格 + 文档日(非本仓代码改动),核心产出是 8 行复核表。把 seed 列出的复核维度排成表(含至少 1 个已过时项):
| # | 框架/技术 | 当前版本/状态 | 是否仍主线 | 替代 / 风险 |
|---|---|---|---|---|
| 1 | smolagents | v1.26.0(当周 PyPI 复验) | 是(轻量 agent 框架) | 替代旧 transformers-agents |
| 2 | DeepEval(GEval) | 当周版本复验 | 是 | 不能当唯一信号,需 judge-human κ |
| 3 | Inspect AI(UK AISI) | 当周版本复验 | 是 | 强调可复现日志 |
| 4 | GRPO(arXiv:2402.03300) | R1 arXiv:2501.12948 验证 | 是(no-critic RL 主线) | PPO 仍可用但带 critic 成本 |
| 5 | MCP 规范 | 最终规范 2026-07-28(RC 2026-05-21) | 是(stateless core) | server 构建须排其后(风险:抢跑) |
| 6 | OTel GenAI 语义约定 | 2026 演进中 | 是 | 字段语义可能漂移,需对齐 |
| 7 | DeepSeek 模型 id | v4-pro / v4-flash | 是 | 过时:legacy chat/reasoner 2026-07-24 退役 |
| 8 | RAG-centric 叙事 | — | 否(已过时) | 被 context-engineering 取代 |
已可定的过时项(seed 逐字保留,写进表/正文):
- legacy
deepseek-chat/deepseek-reasoner2026-07-24 退役(→deepseek-v4-pro/-flash); - RAG-centric 叙事被 context-engineering 取代;
- 「AI Act 高风险 2026-08 生效」旧时间线已推迟 2027-12-02。
交叉引用本仓去循环证据: 复核第 2/7 行涉及评测可信度,可引本仓 src/aml/groundTruthEval.ts 的 binaryEval / binaryEvalWithCI(prediction-source-agnostic 设计:label 来自外部公开集、predicted 来自外部模型,去掉 evalBaseline.ts 同源循环)——这是「我们的评测叙事没用过时同源做法」的代码佐证。
复核与本仓「时效性纪律」的闭环: 这张表不是一次性产物,而是一条可重跑的检查清单。每周一全量 WebSearch 复刷一遍,把「当周版本/状态」列回填;任何一行从「是」翻成「否」时,去对应笔记/作品里把过时叙事换掉。这把顶层「全局时效性硬规则」从口号落成了可执行的周循环。
3. 今日实战
按 seed 落地:
- 扫 Anthropic claude-cookbooks 的 evals / agents 章节,记下与本仓相关的最新模式(judge 设计、agent loop、安全)。
- 用 WebSearch 逐项复核上表 8 行(smolagents / DeepEval / Inspect AI / GRPO / MCP / OTel GenAI / DeepSeek 模型 id / RAG 叙事),确认版本号与「是否仍主线」。
- 写成 8 行
sota-recheck.md表,committed;正文标出至少 1 个已过时叙事(本日已标 3 个)。
4. 今日实测 / 产出
sota-recheck.md表(8 rows)committed(文档产物,可立即落地)。- 已可定的过时项(逐字保留):legacy
deepseek-chat/deepseek-reasoner2026-07-24 退役(→deepseek-v4-pro/-flash);RAG-centric 叙事被 context-engineering 取代;「AI Act 高风险 2026-08 生效」旧时间线(已推迟 2027-12-02)。 - 不臆造新版本号——版本号当周以 WebSearch / PyPI 为准。
5. 常见误区 / 陷阱
- 用训练记忆当 SOTA:训练截止日之后的事必须以搜索为准;本日所有「仍主线」结论都需当周 WebSearch 背书。
- 复核变成全盘推翻:GRPO/MCP/κ/bootstrap CI 是长青或仍 SOTA,别误删;只删确证过时项。
- 拿单点来源就下结论:一条博客说某框架「最好」不算复核;至少交叉两个第一方来源(官方 docs + release notes)才落「仍主线」。
- 漏掉硬日期:MCP 2026-07-28、模型 id 2026-07-24 退役、AI Act 推迟 2027-12-02 这些日期一旦写错,会让整条叙事过期。
- 只标过时不给替代:每个过时项必须配替代(chat/reasoner → v4;RAG → context-engineering),否则复核无可执行性。
- 复核做一次就完事:SOTA 复核是周循环,不是一次性盘点;表里「当周版本」列须每周一回填,否则下个月又过期。
6. 学习资源(每条带 YYYY-MM)
- Anthropic, claude-cookbooks — evals / agents 章节— 2026
- DeepSeekMath, GRPO(arXiv:2402.03300)— 2024-02
- DeepSeek-R1(arXiv:2501.12948,验证 GRPO 于推理模型)— 2025-01
- Anthropic, Model Context Protocol — 最终规范(2026-07-28,RC 2026-05-21)— 2026-05
- AICAP 顶层时效性硬规则(近 6-12 个月主线 + SOTA 检查纪律)— 2026-06
- EU AI Act Article 50(透明度义务,复查点 2026-08-02;高风险条款已推迟 2027-12-02)— 2026
- 本仓
src/aml/groundTruthEval.ts(prediction-source-agnostic 去循环评测,复核佐证)— 2026 - OpenTelemetry, GenAI 语义约定(agent span 字段,2026 演进中,需对齐避免语义漂移)— 2026
SOTA检查 (2026-06 更新)
- 当前主流:上表 8 行即本日复核结论。MCP 2026-07-28 最终规范尚未到日,server 构建须排其后。GRPO(arXiv:2402.03300)仍是 no-critic RL 主线(R1 arXiv:2501.12948 验证)。
- 是否仍 SOTA:smolagents / DeepEval / Inspect AI / GRPO / MCP 均仍主线;RAG-centric 叙事已过时(→ context-engineering)。
- 过时黑名单:legacy
deepseek-chat/deepseek-reasoner(2026-07-24 退役);RAG-centric 叙事;「AI Act 高风险 2026-08 生效」旧时间线(已推迟 2027-12-02);避免 AutoGen/SK 作主线(维护模式)。 - 长青项不可误删:GRPO(arXiv:2402.03300)/ MCP stateless core / bootstrap CI / Cohen's κ 复核后仍主线或长青,不在过时黑名单内——复核是分三态,不是一刀切。
- 下次复查点:2026-07-28 MCP 定稿日;2026-07-24 模型 id 退役日;2026-08-02 EU AI Act Art.50;每周一全量 WebSearch 复刷上表版本号。
衔接
- 昨天:Day 172 — DeepEval + Inspect AI 评测框架(读单个评测框架)
- 今天:扫 claude-cookbooks + 全局 SOTA 复核,产出 8 行复核表,标出 3 个已过时叙事
- 明天:Day 174 — OSS PR 选题与 good-first-issue 定位(复核确认目标 repo 未冻结后,进入真实贡献流程)