返回 G01~G90 教材库
G80 · 总 Day 260教材已备 ≠ 学习已完成

G80:Baseline、Multi-seed 与 Human Checkpoint:给自动研究加独立约束

Baseline selector、multi-seed runner 与 human checkpoint 分别约束比较对象、随机不确定性和最终责任,使自动实验不能靠弱基线、最佳 seed 或自我审阅制造进步。

2027-05-12

内容类型:预习教材(不代表已完成)
日期:2027-05-12
阶段:P3 · AGI Foundations 90
总路线:Day 260
周次节奏:W12 · 周三引导实验
状态:教材已备;学习未完成

一句话定义

Baseline selector、multi-seed runner 与 human checkpoint 分别约束比较对象、随机不确定性和最终责任,使自动实验不能靠弱基线、最佳 seed 或自我审阅制造进步。

学习目标

  1. 建立 baseline ladder:trivial、standard、ablated、oracle-bound 与 resource-matched。
  2. 设计预先固定 seed 的运行协议,报告分布、效应量和失败,而不是只报最好值。
  3. 定义人类 checkpoint 的输入证据、可选决定和不可委托责任。

核心知识

弱 baseline 是自动研究最容易利用的漏洞。只与随机策略比较,任何有结构方法都像突破。Baseline ladder 可包括:常数/随机下限,简单启发式,当前标准方法,候选方法的关键组件消融,以及仅用于理解上界的 oracle。比较必须 resource-matched:相同数据、搜索候选数、模型调用、训练步数或 wall-clock,否则增益可能只是预算。

Baseline selector 可以依据任务类型从已批准 registry 提议比较项,但不能删除强 baseline;新增候选时保存选择理由。若 generator 既设计方法又挑对手,会倾向选择容易赢的比较。人类可在执行前检查是否遗漏明显基线,但这不是考试 Gate,而是避免无意义算力的轻量研究决定。

Multi-seed 处理初始化、数据顺序和环境随机性。Seed 数不是越多越科学;先用小型 pilot 估方差,再在预算内规定数量。报告每个 seed、均值/中位数、标准差或 bootstrap 区间、paired effect,并保留崩溃 run。选择最佳 seed 进入下一轮会让搜索逐步过拟合随机噪声。

Human checkpoint 的职责包括批准范围与预算、确认高风险执行仍在沙箱、审视结果是否值得独立复现、决定是否接受结论。系统应呈现原始证据、失败、基线与 unknowns,而非只给 narrative。人类也可能有确认偏差,因此 checkpoint 要显示盲化标签、对称指标或 skeptic review,不把“有人点了确认”当正确性证明。

机制与推导

对候选 C 与 baseline B,若在相同 seed (s_i) 上运行,可用 paired differences:

d_i = metric(C,s_i)-metric(B,s_i)

报告 mean(d)、区间与方向一致率,比比较两个独立最好 seed 更有信息。若自动搜索评估 (K) 个候选并挑最大 observed mean,选择偏差约随 K 和噪声增长;最终候选应在未用于选择的新 seed/holdout 上确认。

Resource matching 可建预算向量 R=[train_compute, inference_calls, search_width, data, human_minutes]。若不能完全相同,绘制 performance–resource 曲线而不是单点。Oracle 只给理论/环境上界,不是可部署 baseline,必须明确标注。

Checkpoint 状态机可写:proposal → scope accepted/revise/reject → sandbox run → evidence review → reproduce/hold/reject。任何“accept”只接受下一步或有限主张,不授权外部发布、硬件操作或无限搜索。

最小练习或观察步骤

  1. 选择 G79 排序问题,列 random、内置排序启发、当前 candidate、candidate ablation 和 oracle lower bound。
  2. 写预算向量并决定配对 seed 列表;计划保存每个失败 run,不丢弃异常。
  3. 构造一组明确标为示例的 paired differences,练习计算 mean、median 与方向一致率。
  4. 设计一个新 holdout seed 集,仅在候选选择结束后打开。
  5. 为 human checkpoint 写一页输入:问题、基线、预算、原始表、失败、风险、未知和三种可选决定。

常见误区与边界

  • 自动 selector 删除强 baseline,使候选轻易获胜。
  • 候选使用更多搜索/调用,却只声明同模型比较。
  • 运行许多 seed 后挑最优一个,没有报告选择过程。
  • 人类只看自动摘要和“显著”标签,未见原始失败。
  • Checkpoint 接受一个 toy 结果便被解释为部署或现实研究授权。

研究/系统场景连接

金融预测研究必须与现有规则、简单统计模型和资源匹配系统比较;复杂 Agent 赢过空白 baseline 没有业务意义。Human checkpoint 应包含数据用途、受影响群体和回滚路径。P4 中 baseline ladder 可包括停机、手工控制、经典控制器和学习策略;安全控制器不是要被“打败”的弱基线,而是不可越过的约束。

自检问题

  1. 为什么 ablation baseline 与标准 baseline 都需要?
  2. Paired seed 比各取最佳 seed 好在哪里?
  3. 搜索候选数增加为何需要新 holdout?
  4. Human checkpoint 接受的到底是什么?

专业课程对齐

  • AlphaEvolve:观察候选生成、自动 evaluator 与人类/领域验证的组合,关注已验证性质而非宣传性外推。
  • FunSearch:分析强 baseline、候选池和 evaluator 如何共同决定发现证据。
  • The AI Scientist:从自动实验、review 与成本报告中提炼 multi-run、baseline 和人类审阅的薄弱点。

深入学习提示

先寻找“最令人尴尬但合理的简单 baseline”。如果候选不能稳定超过它,研究依然有价值:它说明复杂性没有带来增益。负结果比换掉 baseline 更能更新知识。

学后填写区

  • Baseline ladder:
  • Resource vector:
  • Seed / holdout 协议:
  • Human checkpoint 输入:
  • 可能的选择偏差:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本