G03:基线、适应曲线与多维指标
基线不是“故意做差的参照”,而是把可能贡献性能的记忆、固定算法、搜索、示例适应与计算预算逐项显式化,从而判断一个系统的成绩究竟来自哪种机制。
内容类型:预习教材(不代表已完成)
日期:2027-02-24
阶段:P3 · AGI Foundations 90
总路线:Day 183 / 360
周次 / 节奏:W1 · 周三引导实验
状态:教材已备;学习未完成
主题:memorization、固定规则、search/adaptation baseline 与测量轮廓
一句话定义
基线不是“故意做差的参照”,而是把可能贡献性能的记忆、固定算法、搜索、示例适应与计算预算逐项显式化,从而判断一个系统的成绩究竟来自哪种机制。
学习目标
- 能为程序化任务建立 memorization、固定规则和 search/adaptation 三类最小基线。
- 能画出随示例数或计算预算变化的适应曲线,而不是只记录一个最终准确率。
- 能同时观察 accuracy、sample efficiency、compute、latency 与 calibration。
- 能理解一个强而简单的 baseline 为什么比复杂模型的无对照演示更有研究价值。
核心知识
Memorization baseline 保存训练实例与答案,对精确重复有效;最近邻版本还能利用表面相似性。它测的是测试集是否允许检索捷径。固定规则 baseline 由研究者写死已知原语与组合方法,它提供任务上限或算法参照,但不具有从示例学习新规则的能力。Search/adaptation baseline 则在候选规则空间中根据 demonstrations 选择解释,再应用于 query;它可以没有神经网络,却真正展示“用新证据缩小假设空间”的过程。
适应不能只用第 k 个示例后的最终分数表示。设 A(k) 为观察 k 个 demonstration 后在独立 query 上的准确率,学习效率可用达到阈值 τ 所需的最少样本 k_τ,或曲线下面积 AUC_adapt = Σ_k A(k) 描述。阈值可能导致不连续,因此应保留整条曲线。
校准回答“信心能否反映正确概率”。将预测按 confidence 分桶,期望校准误差可粗写为 ECE = Σ_b |B_b|/n · |acc(B_b)-conf(B_b)|。在规则 OOD 上,系统可能准确率下降却仍高置信;这比单纯答错更危险,因为后续控制器无法据此分配人工复核或搜索预算。
机制与推导
把候选规则集合记为 H={h_1,...,h_m}。适应 baseline 收到 demonstrations D_k={(x_i,y_i)}_{i=1}^k 后,对每个假设计算一致性:
[ s(h;D_k)=\sum_{i=1}^{k}\mathbb{1}[h(x_i)=y_i]-\lambda C(h) ]
其中 C(h) 是复杂度惩罚。选择 h* = argmax_h s(h;D_k),若多个假设同分,则保留不确定性或主动请求最有区分力的示例,而不是任意选择。这个过程展示了示例数为何影响性能:每个新例子都可能排除一组假设。
公平比较需要预算账本。Memorization 的存储与查找、固定规则的手工先验、搜索的候选展开数、模型的 token 与前向次数都属于资源。可以记录 cost=(examples, candidate_evals, tokens, wall_time, human_rules),不要把不同资源压成未经解释的单价。
构造反例:训练任务只含三种单原语,memorization 在 IID 测试可因模板重复获得高分;组合 OOD 时掉落。固定规则若已被人工编码组合运算会保持高分,却不说明系统自行学会;搜索 baseline 若候选空间缺少真实规则,无论示例多少都不可能成功。三种失败分别揭示污染、人工先验和假设空间不足。
最小练习或观察步骤
- 使用 G02 的任务规格,写下三个 baseline 的输入、可访问先验、输出与成本字段,不急于实现复杂模型。
- 为 memorization baseline 加入“测试实例精确重复率”统计,确认高分是否由重复驱动。
- 为 adaptation baseline 设置
k=0,1,2,4,8的 demonstration 预算,预先定义 query 集与停止规则。 - 记录每个
k的 accuracy、abstain rate、候选规则剩余数和置信度;若能运行,再保留原始逐题结果。 - 构造一个歧义 demonstration:两个规则都一致,但在新 query 上答案不同,观察系统是否诚实表达不确定性。
常见误区与边界
- 选择明显过弱的随机 baseline,让复杂方法看似有效。
- 固定规则 baseline 使用了测试规则,却将差异解释为学习能力。
- 只比较最终准确率,不披露适应示例数、搜索节点和人工规则。
- 在测试 query 上反复调阈值,造成隐性测试集训练。
- 用模型自报 confidence 直接代表概率,不检查经验校准。
- 把一个 toy task 上 sample-efficient adaptation 外推为开放世界快速学习。
研究/系统场景连接
在信用审批或反欺诈规则变更时,最有价值的问题往往不是“旧模型历史准确率多高”,而是新政策只有少量已审核案例时,系统需要多少例子才达到可用性能、何时应该拒答。最近邻案例库、固定业务规则和可适应模型正对应三类机制。它们应共享相同的时间切分与审计样本,否则复杂方法可能只是看到了更多未来信息。
Agent 系统也需要基线:无记忆直接生成、固定状态机、有限搜索和带适应的策略。若 Agent 成功,只有和这些基线及相近预算比较,才能判断收益来自模型推理、外部搜索、缓存还是人为脚手架。研究阶段不需要把这些比较变成重 Gate;一张诚实的适应曲线已经比单个 demo 更深入。
自检问题
- Memorization 在 IID 上高分能反驳什么数据问题?
- 固定规则 baseline 为什么既可能是强参照,又不能证明学习?
k_τ与适应曲线面积分别保留了什么信息?- 搜索 baseline 的候选空间缺失真实规则时会发生什么?
- 为什么应同时报告 abstention 与 calibration?
专业课程对齐
- 阅读 On the Measure of Intelligence,把经验、先验和任务难度映射到适应曲线,而不是只摘录抽象定义。
- 浏览 HELM 的多指标报告思想,观察 accuracy、calibration、robustness 与 efficiency 为什么需要并列。
- 阅读 Evaluating Cognitive Maps and Planning in Large Language Models with CogEval,关注任务构造与 baseline 如何把“会规划”的说法拆成可观察行为。
深入学习提示
尝试把 baseline 视为一组竞争解释:若最近邻已经足够,复杂模型的高分未显示规则归纳;若固定解释器最好,任务可能主要考执行;若适应搜索随示例稳定改善,才有理由研究它的归纳偏置。进一步可用 bootstrap 观察曲线差异的不确定性,但本日无需追求正式统计检验。最重要的是保留逐题证据和资源账本,让未来的自己可以重新解释。
学后填写区
- 我定义的三个 baseline:
- 适应预算序列:
- 最需要记录的成本字段:
- 一个歧义示例:
- 当前证据不能支持的外推: