返回 AICAP-180
B18 · Day 173OSS 收口 + 英文 + 全局 SOTA 复核

claude-cookbooks + 全局 SOTA 复核

Day 171-172 读的是两个具体框架(smolagents 的 agent 主循环、DeepEval/Inspect 的评测口径)。今天把视角一次性拉到全局:执行 AICAP 硬纪律——agent 领域半衰期约 6 个月,必须逐项确认整条主线资料是否还活着、还是不是 SOTA。

阶段: B18 · OSS 收口 + 英文 + 全局 SOTA 复核(Day 171-180) 标签: #sota-recheck #claude-cookbooks #grpo #mcp

今日导引(由浅入深)

Day 171-172 读的是两个具体框架(smolagents 的 agent 主循环、DeepEval/Inspect 的评测口径)。今天把视角一次性拉到全局:执行 AICAP 硬纪律——agent 领域半衰期约 6 个月,必须逐项确认整条主线资料是否还活着、还是不是 SOTA。

手法是先扫 Anthropic claude-cookbooks 的 evals/agents 章节取最新模式,再用 WebSearch 逐项复核 GRPO、MCP、模型 id 等是否仍为主线,并至少标出 1 个已过时叙事

在 B1→B18 曲线上,这一天是「把前 172 天用过的所有外部资料做一次过期体检」的位置——上承 Day 172 的评测框架(DeepEval/Inspect 进复核表),下接 Day 174 起的 OSS 实操(贡献前必须确认目标 repo/技术未冻结)。

最小可判定产出:一张 8 行 sota-recheck.md 表(框架/技术 → 当前版本 → 是否仍主线 → 替代/风险),含至少 1 个已过时叙事。

一句话锚点:今天不是学新技术,而是给前 172 天用过的每条资料盖一个「保质期」章——这是把顶层时效性硬规则从口号变成可重跑周循环的一天。

1. 机理精读

为什么要做全局 SOTA 复核:半衰期纪律。 AICAP 顶层时效性硬规则要求所有学习输出以近 6-12 个月资料为主线。

agent 领域尤其快——平台 GA 状态、版本号、规范定稿日期会在数周内翻篇。半衰期约 6 个月意味着:半年前还对的主线,今天可能已被替代。复核不是走形式,是把「引用过的每一条资料」当成会腐烂的依赖,定期跑一次过期扫描。依据:AICAP 顶层硬规则 + agent 领域迭代节奏(2026)。

claude-cookbooks 的作用:取最新模式而非旧记忆。 Anthropic 维护的 claude-cookbooks 是「官方第一方、随模型更新」的实战样例库。

扫它的 evals/agents 章节,是为了用第一方最新模式覆盖训练记忆里的旧做法(比如 RAG-centric 旧叙事 vs context-engineering 新叙事)。这正是「用搜索结果优先于训练记忆」硬规则的具体执行。依据:Anthropic claude-cookbooks (2026)。

为什么半衰期偏偏是「约 6 个月」(用本表佐证)。 看上表第 5/7 行就懂:MCP 从 RC(2026-05-21)到最终规范(2026-07-28)只隔两个多月;DeepSeek 模型 id 从 chat/reasoner 到 v4 的退役窗口(2026-07-24)也在半年内。

agent 栈的三个快变量——模型 id、平台 GA 状态、协议规范定稿日——任意一个翻篇都能让半年前的主线叙事过期。这就是「半衰期约 6 个月」不是拍脑袋,而是对这三个变量翻篇频率的经验估计。

逐项复核的技术锚点。

  • GRPO(arXiv:2402.03300):Group Relative Policy Optimization,no-critic(去 critic 网络)的 RL 路线,用组内相对优势替代价值网络。R1(arXiv:2501.12948)验证了它在推理模型训练上的有效性。复核结论:仍是 no-critic RL 主线
  • MCP(2026-07-28 最终规范):stateless core 方向已锁(RC 2026-05-21)。复核结论:规范定稿日尚未到,因此任何「真 MCP server 构建」必须排在 2026-07-28 之后——这是硬日期约束。
  • 模型 id:legacy deepseek-chat / deepseek-reasoner 2026-07-24 退役,须迁到 deepseek-v4-pro / deepseek-v4-flash
  • 叙事过时:「RAG-centric」被 context-engineering 取代;「AI Act 高风险 2026-08 生效」旧时间线已推迟到 2027-12-02(须从所有合规叙事里改掉)。

从 claude-cookbooks 取什么模式(具体到三类)。 扫 cookbooks 不是泛读,而是带着三个问题去对照本仓:

  • judge 设计:cookbooks 的 eval 样例如何写 judge prompt(grade outcome / 允许 unknown / partial credit)——对照本仓 agentEval.tsJUDGE_SYSTEM,确认我们的口径没落后。
  • agent loop:cookbooks 的 agent 样例如何组织工具调用与停机条件——对照本仓 toolRegistry.ts 的 tools/list + tools/call 契约。
  • 安全/HITL:cookbooks 对「危险动作需人审」的处理——对照本仓 AML 侧的 auto-file 禁止(HITL 闸门)。

每一项的结论只有两种:「本仓口径与第一方最新一致」或「本仓需更新」。这就是复核的可执行落点。

边界:复核 ≠ 全盘推翻。 复核要分清「过时叙事」与「长青方法」。GRPO/MCP/bootstrap CI/Cohen's κ 这类是长青或仍 SOTA,不能因为「要复核」就误删。复核的产物是一张表——明确标「仍主线 / 有替代 / 已过时」三态,而非一刀切。

2. 推导 / 手算 / 代码走读

今天是表格 + 文档日(非本仓代码改动),核心产出是 8 行复核表。把 seed 列出的复核维度排成表(含至少 1 个已过时项):

#框架/技术当前版本/状态是否仍主线替代 / 风险
1smolagentsv1.26.0(当周 PyPI 复验)是(轻量 agent 框架)替代旧 transformers-agents
2DeepEval(GEval)当周版本复验不能当唯一信号,需 judge-human κ
3Inspect AI(UK AISI)当周版本复验强调可复现日志
4GRPO(arXiv:2402.03300)R1 arXiv:2501.12948 验证是(no-critic RL 主线)PPO 仍可用但带 critic 成本
5MCP 规范最终规范 2026-07-28(RC 2026-05-21)是(stateless core)server 构建须排其后(风险:抢跑)
6OTel GenAI 语义约定2026 演进中字段语义可能漂移,需对齐
7DeepSeek 模型 idv4-pro / v4-flash过时:legacy chat/reasoner 2026-07-24 退役
8RAG-centric 叙事否(已过时)被 context-engineering 取代

已可定的过时项(seed 逐字保留,写进表/正文):

  • legacy deepseek-chat / deepseek-reasoner 2026-07-24 退役(→ deepseek-v4-pro / -flash);
  • RAG-centric 叙事被 context-engineering 取代
  • 「AI Act 高风险 2026-08 生效」旧时间线已推迟 2027-12-02

交叉引用本仓去循环证据: 复核第 2/7 行涉及评测可信度,可引本仓 src/aml/groundTruthEval.tsbinaryEval / binaryEvalWithCI(prediction-source-agnostic 设计:label 来自外部公开集、predicted 来自外部模型,去掉 evalBaseline.ts 同源循环)——这是「我们的评测叙事没用过时同源做法」的代码佐证。

复核与本仓「时效性纪律」的闭环: 这张表不是一次性产物,而是一条可重跑的检查清单。每周一全量 WebSearch 复刷一遍,把「当周版本/状态」列回填;任何一行从「是」翻成「否」时,去对应笔记/作品里把过时叙事换掉。这把顶层「全局时效性硬规则」从口号落成了可执行的周循环。

3. 今日实战

按 seed 落地:

  1. 扫 Anthropic claude-cookbooks 的 evals / agents 章节,记下与本仓相关的最新模式(judge 设计、agent loop、安全)。
  2. 用 WebSearch 逐项复核上表 8 行(smolagents / DeepEval / Inspect AI / GRPO / MCP / OTel GenAI / DeepSeek 模型 id / RAG 叙事),确认版本号与「是否仍主线」。
  3. 写成 8 行 sota-recheck.md 表,committed;正文标出至少 1 个已过时叙事(本日已标 3 个)。

4. 今日实测 / 产出

  • sota-recheck.md 表(8 rows)committed(文档产物,可立即落地)。
  • 已可定的过时项(逐字保留):legacy deepseek-chat/deepseek-reasoner 2026-07-24 退役(→ deepseek-v4-pro/-flash);RAG-centric 叙事被 context-engineering 取代「AI Act 高风险 2026-08 生效」旧时间线(已推迟 2027-12-02)
  • 不臆造新版本号——版本号当周以 WebSearch / PyPI 为准。

5. 常见误区 / 陷阱

  1. 用训练记忆当 SOTA:训练截止日之后的事必须以搜索为准;本日所有「仍主线」结论都需当周 WebSearch 背书。
  2. 复核变成全盘推翻:GRPO/MCP/κ/bootstrap CI 是长青或仍 SOTA,别误删;只删确证过时项。
  3. 拿单点来源就下结论:一条博客说某框架「最好」不算复核;至少交叉两个第一方来源(官方 docs + release notes)才落「仍主线」。
  4. 漏掉硬日期:MCP 2026-07-28、模型 id 2026-07-24 退役、AI Act 推迟 2027-12-02 这些日期一旦写错,会让整条叙事过期。
  5. 只标过时不给替代:每个过时项必须配替代(chat/reasoner → v4;RAG → context-engineering),否则复核无可执行性。
  6. 复核做一次就完事:SOTA 复核是周循环,不是一次性盘点;表里「当周版本」列须每周一回填,否则下个月又过期。

6. 学习资源(每条带 YYYY-MM)

  • Anthropic, claude-cookbooks — evals / agents 章节— 2026
  • DeepSeekMath, GRPO(arXiv:2402.03300)— 2024-02
  • DeepSeek-R1(arXiv:2501.12948,验证 GRPO 于推理模型)— 2025-01
  • Anthropic, Model Context Protocol — 最终规范(2026-07-28,RC 2026-05-21)— 2026-05
  • AICAP 顶层时效性硬规则(近 6-12 个月主线 + SOTA 检查纪律)— 2026-06
  • EU AI Act Article 50(透明度义务,复查点 2026-08-02;高风险条款已推迟 2027-12-02)— 2026
  • 本仓 src/aml/groundTruthEval.ts(prediction-source-agnostic 去循环评测,复核佐证)— 2026
  • OpenTelemetry, GenAI 语义约定(agent span 字段,2026 演进中,需对齐避免语义漂移)— 2026

SOTA检查 (2026-06 更新)

  • 当前主流:上表 8 行即本日复核结论。MCP 2026-07-28 最终规范尚未到日,server 构建须排其后。GRPO(arXiv:2402.03300)仍是 no-critic RL 主线(R1 arXiv:2501.12948 验证)。
  • 是否仍 SOTA:smolagents / DeepEval / Inspect AI / GRPO / MCP 均仍主线;RAG-centric 叙事已过时(→ context-engineering)。
  • 过时黑名单:legacy deepseek-chat/deepseek-reasoner(2026-07-24 退役);RAG-centric 叙事;「AI Act 高风险 2026-08 生效」旧时间线(已推迟 2027-12-02);避免 AutoGen/SK 作主线(维护模式)
  • 长青项不可误删:GRPO(arXiv:2402.03300)/ MCP stateless core / bootstrap CI / Cohen's κ 复核后仍主线或长青,不在过时黑名单内——复核是分三态,不是一刀切。
  • 下次复查点:2026-07-28 MCP 定稿日;2026-07-24 模型 id 退役日;2026-08-02 EU AI Act Art.50;每周一全量 WebSearch 复刷上表版本号。

衔接

  • 昨天:Day 172 — DeepEval + Inspect AI 评测框架(读单个评测框架)
  • 今天:扫 claude-cookbooks + 全局 SOTA 复核,产出 8 行复核表,标出 3 个已过时叙事
  • 明天:Day 174 — OSS PR 选题与 good-first-issue 定位(复核确认目标 repo 未冻结后,进入真实贡献流程)