G04:测量有效性、污染与脚手架反例
测量有效性不是“分数计算正确”这么简单,而是检查任务、数据、指标和脚手架是否真的测到了所声称的能力,以及替代解释能否产生同样的高分。
内容类型:预习教材(不代表已完成)
日期:2027-02-25
阶段:P3 · AGI Foundations 90
总路线:Day 184 / 360
周次 / 节奏:W1 · 周四争议与反例
状态:教材已备;学习未完成
主题:construct validity、contamination、metric threshold 与 scaffolding
一句话定义
测量有效性不是“分数计算正确”这么简单,而是检查任务、数据、指标和脚手架是否真的测到了所声称的能力,以及替代解释能否产生同样的高分。
学习目标
- 能区分 construct validity、internal validity 与 ecological validity,并知道它们分别防什么错误。
- 能识别测试污染、示例泄漏、阈值效应和人工脚手架四类常见混杂。
- 能通过改变一个先验或测量函数,构造“训练高分但陌生适应差”的反例。
- 能把测量审计写成支持、反对、尚未知三栏,而不是急于判定系统是否“通用”。
核心知识
Construct validity 询问操作指标是否代表目标概念。例如 exact match 适合答案唯一的算术题,却可能把语义等价表达判错;反之,宽松的语言模型 judge 可能把事实错误判对。Internal validity 询问观察差异是否由目标机制造成,还是由数据量、提示、工具、缓存或人工筛选造成。Ecological validity 询问实验环境与现实任务在反馈、时间、风险和分布变化上是否足够相似。
污染不只指训练语料出现完整测试题。近重复题、解题模板、答案解析、排行榜调参、人工根据测试反馈选择提示,都可能让测试不再独立。脚手架包括 few-shot 示例、检索、外部搜索、代码执行器、反思循环和人工挑选。脚手架不是作弊;问题在于必须把成绩归因于完整系统,并报告它的资源与失败模式。
指标阈值会制造表观跃迁。若底层能力 q 连续改善,而任务只在 q>τ 时计 1 分,小幅变化可导致 exact-match 大跳。反过来,一个饱和指标会掩盖能力差异。应同时保留连续 partial credit、错误类型和阈值指标。
机制与推导
将观测分数写成:
[ Y=f(C,D,M,S,H)+\epsilon ]
其中 C 是目标能力,D 是数据与污染,M 是指标,S 是系统脚手架,H 是人类帮助。若实验只改变模型,却没有固定 S/H,就无法把 ΔY 全部归因于 ΔC。反例测试的核心是保持大部分变量不变,只扰动一种替代解释。
可以构造比例为 ρ 的污染:训练字典直接包含部分测试规则。Memorization baseline 的期望分数近似随 ρ 上升,而真正规则适应在未污染子集也应改善。因此报告 A_all 还不够,要计算 A_clean 与 A_contaminated。若总分高但 clean split 低,高分主要支持记忆解释。
阈值敏感性可令 score_τ = mean(1[q_i≥τ]),扫描多个 τ 并与 mean(q_i) 对照。若“能力突然出现”的位置随阈值任意移动,证据更接近测量现象。类似地,增加示例数 k 后性能提升,可能来自任务说明变清楚,也可能是答案模式泄漏;需要加入同信息量但不含标签的对照。
最小练习或观察步骤
- 从 G02/G03 选一个 baseline,写出目标构念和至少三个替代解释。
- 构造
ρ=0%、20%、50%的模板污染条件,预先写下 memorization 与 adaptation baseline 各自可能的变化方向。 - 让同一组连续质量分数分别经过两个 exact-match 阈值,观察跃迁位置是否变化。
- 比较无示例、有效示例、标签随机示例三种条件,区分信息帮助与格式熟悉。
- 为每项观察写“若出现 X,支持什么;若不出现,仍不能排除什么”,不预填结果。
常见误区与边界
- 认为公开 benchmark 有固定答案就天然有效;固定答案只保证可评分。
- 把所有性能提升都归于模型规模,忽略提示、工具和人工选择同时变化。
- 发现污染后否定整个研究;更好的做法是隔离 clean subset 并缩小结论。
- 扫描许多阈值后只报告最戏剧化的一个。
- 把现实任务复杂等同于 ecological validity 高;若反馈和风险被简化,仍只是代理环境。
- 用一个反例宣称所有 AGI 研究无效;反例只反驳对应范围的强主张。
研究/系统场景连接
金融零售模型常在历史时间随机切分上表现良好,却在政策更新或渠道迁移后退化。随机切分可能让同一客户、设备或商户模式同时进入训练和测试;这与 benchmark 模板污染结构相似。人工审核员若在评测时看到模型建议,也会产生自动化偏差,使“人工真值”不再独立。因而需要时间切分、实体隔离与盲审等设计,但这些是帮助理解证据的工具,不必变成繁重 Gate。
Agent demo 中,研究者可能手工选择成功轨迹、在失败时重试或提供隐含线索。系统仍可能有价值,但主张应改为“在此脚手架下可完成”,并保留尝试次数、人工介入和失败样本。对未来具身系统,ecological gap 更大:仿真碰撞可重置,真实碰撞可能不可逆。
自检问题
- Construct validity 与 internal validity 分别询问什么?
- 为什么 few-shot、检索和工具不是天然作弊,却必须报告?
- 连续指标与阈值指标不一致时,哪一种更“真实”?
- 如何设计一个条件只测试污染解释,而不同时改变任务难度?
- 一个反例能把结论缩小到哪里,不能推出什么?
专业课程对齐
- 阅读 HELM 的 scenario 与 metric 设计,理解透明配置为何是解释系统成绩的前提。
- 阅读 Are Emergent Abilities of Large Language Models a Mirage?,重点观察指标选择怎样改变“突现”叙事。
- 阅读 Beyond the Imitation Game: BIG-bench,区分大范围任务集合的探索价值与把总分解释为通用智能的边界。
深入学习提示
把每个高分都当成待比较的因果解释:能力提高、污染增加、脚手架更强、指标变宽松都可能生成相似观测。最有信息量的实验通常不是再跑一个更大模型,而是寻找能让这些解释产生不同预测的干预。可进一步学习 measurement invariance、selection bias 与 multiple comparisons,但本日只需掌握“替代解释—区分实验—证据边界”三步。
学后填写区
- 我选择审计的主张:
- 三个替代解释:
- 最小区分实验:
- 指标阈值改变后的疑问:
- 当前仍无法判断之处: