返回 G01~G90 教材库
G81 · 总 Day 261教材已备 ≠ 学习已完成

G81:自动研究失败测试:P-hacking、Judge Bias 与重复发现

自动研究失败测试故意构造无效假设、可被利用的 evaluator 和重复候选,检查系统是否会把搜索噪声、judge 偏好或文献重述包装成发现。

2027-05-13

内容类型:预习教材(不代表已完成)
日期:2027-05-13
阶段:P3 · AGI Foundations 90
总路线:Day 261
周次节奏:W12 · 周四争议与失败案例
状态:教材已备;学习未完成

一句话定义

自动研究失败测试故意构造无效假设、可被利用的 evaluator 和重复候选,检查系统是否会把搜索噪声、judge 偏好或文献重述包装成发现。

学习目标

  1. 识别自动搜索如何放大多重比较、指标挑选、提前停止和选择性报告。
  2. 为 LLM judge 设计位置、长度、风格、自偏好和共享偏差对照。
  3. 区分词面新颖、语义差异、方法差异与真正未被已有工作覆盖的 novelty。

核心知识

P-hacking 不一定是有意造假。自动系统可尝试许多 prompt、seed、指标、子群和停止点,再只报告显著组合;即使所有尝试都按代码执行,最终 p 值也不再有原含义。研究 registry 必须记录候选数、分析分支和失败,confirmatory run 使用冻结分析计划。

LLM-as-judge 能快速筛选文本,但常受位置、长度、格式、语气和自身生成风格影响。交换 A/B 顺序、隐藏方法名、控制长度、加入语义相同风格不同对照,可发现部分偏差。多个同一模型或相似训练来源的 judge 不是独立评审;高一致率也可能是共同偏好。

Novelty 不能只由 embedding 距离决定。改名、重新叙述或组合已知步骤可能在词面远,却没有方法新意;真正不同的方法也可能文字相近。一个轻量 novelty 流程是:检索候选最相近工作,提取 problem/assumption/mechanism/evidence 四元组,逐项对照,再由人类决定“已知、增量、可能新、无法判断”。

重复发现还有价值:独立复现已知结果可以增加可靠性,但必须标为 replication,而非 novelty。负结果档案同样重要;若系统每次重新生成已失败假设,会浪费预算并产生发表偏差。Dedup registry 应保存失败原因和适用范围,而不是禁止相似问题再研究。

机制与推导

若在 null 下独立检验 (m) 个假设,每个阈值 α,则至少一个假阳性概率:

FWER=1-(1-α)^m

当 m=20、α=0.05 时已明显高于 0.05。实际搜索分支相关,简单公式不是精确修正,却揭示“只看最终一次”的错误。可用 holdout、预注册 primary metric、报告全体候选和适当多重比较控制降低风险。

Judge 偏差可用交换实验:bias_position = P(A wins | A first)-P(A wins | A second);长度偏差可在语义等价的短/长版本上比较。若 generator 与 judge 相同,可加入来源盲化和异构 deterministic checks。Judge score 不作为唯一真值,只是 noisy measurement。

Novelty 四元组距离:D = [problem_diff, assumption_diff, mechanism_diff, evidence_diff]。至少要能指出哪一维不同及其证据;“标题不同”不进入 D。

最小练习或观察步骤

  1. 构造 20 个纯噪声 toy 假设,计划让自动流程挑最好一个;先计算出现偶然优胜的风险。
  2. 为两段语义相同文本创建顺序交换、长度匹配、风格交换和来源盲化四个 judge 对照。
  3. 写一条明显重复的“新方法”,用 problem/assumption/mechanism/evidence 四元组与原方法对照。
  4. 定义失败测试的成功标准:系统应标记证据不足、重复或需要 holdout,而不是必须找到显著结果。
  5. 设计 negative-result record:假设、尝试范围、失败原因、可重试条件和禁止过度外推。

常见误区与边界

  • 只报告自动搜索最终 p 值,不披露尝试次数和指标分支。
  • 两个同源 judge 一致就当独立同行评审。
  • 用长、流畅、引用多的文本替代正确性。
  • Embedding 距离大就称 novelty,未对照方法与假设。
  • 把 replication 贬为无价值,诱使系统错误宣称新颖。

研究/系统场景连接

金融分析 Agent 可能尝试大量客户切片后挑显著差异,必须记录探索与确认的分界,避免制造伪风险规则。自动审阅不能决定真实政策改变。系统层需保存所有 analysis branch、judge 顺序与 prompt/version。P4 自动机器人研究更要防止反复挑选仿真 seed;最佳视频不代表策略稳定,应保存失败轨迹与全部安全干预。

自检问题

  1. 自动化为什么可能让无意 p-hacking 更严重?
  2. Judge 一致率高仍可能有什么共同偏差?
  3. Novelty 四元组中哪一维最难自动判断?
  4. 一个失败测试怎样算“系统表现好”?

专业课程对齐

深入学习提示

最好的失败测试不是让系统崩溃,而是给它一个“很容易写成漂亮成功”的无效问题,看它能否选择保留未知。把“拒绝制造结论”视为研究系统能力,而非缺乏产出。

学后填写区

  • 搜索分支与 primary metric:
  • Judge 偏差对照:
  • Novelty 四元组:
  • Negative-result record:
  • 当前仍需人类判断:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本