G81:自动研究失败测试:P-hacking、Judge Bias 与重复发现
自动研究失败测试故意构造无效假设、可被利用的 evaluator 和重复候选,检查系统是否会把搜索噪声、judge 偏好或文献重述包装成发现。
内容类型:预习教材(不代表已完成)
日期:2027-05-13
阶段:P3 · AGI Foundations 90
总路线:Day 261
周次节奏:W12 · 周四争议与失败案例
状态:教材已备;学习未完成
一句话定义
自动研究失败测试故意构造无效假设、可被利用的 evaluator 和重复候选,检查系统是否会把搜索噪声、judge 偏好或文献重述包装成发现。
学习目标
- 识别自动搜索如何放大多重比较、指标挑选、提前停止和选择性报告。
- 为 LLM judge 设计位置、长度、风格、自偏好和共享偏差对照。
- 区分词面新颖、语义差异、方法差异与真正未被已有工作覆盖的 novelty。
核心知识
P-hacking 不一定是有意造假。自动系统可尝试许多 prompt、seed、指标、子群和停止点,再只报告显著组合;即使所有尝试都按代码执行,最终 p 值也不再有原含义。研究 registry 必须记录候选数、分析分支和失败,confirmatory run 使用冻结分析计划。
LLM-as-judge 能快速筛选文本,但常受位置、长度、格式、语气和自身生成风格影响。交换 A/B 顺序、隐藏方法名、控制长度、加入语义相同风格不同对照,可发现部分偏差。多个同一模型或相似训练来源的 judge 不是独立评审;高一致率也可能是共同偏好。
Novelty 不能只由 embedding 距离决定。改名、重新叙述或组合已知步骤可能在词面远,却没有方法新意;真正不同的方法也可能文字相近。一个轻量 novelty 流程是:检索候选最相近工作,提取 problem/assumption/mechanism/evidence 四元组,逐项对照,再由人类决定“已知、增量、可能新、无法判断”。
重复发现还有价值:独立复现已知结果可以增加可靠性,但必须标为 replication,而非 novelty。负结果档案同样重要;若系统每次重新生成已失败假设,会浪费预算并产生发表偏差。Dedup registry 应保存失败原因和适用范围,而不是禁止相似问题再研究。
机制与推导
若在 null 下独立检验 (m) 个假设,每个阈值 α,则至少一个假阳性概率:
FWER=1-(1-α)^m
当 m=20、α=0.05 时已明显高于 0.05。实际搜索分支相关,简单公式不是精确修正,却揭示“只看最终一次”的错误。可用 holdout、预注册 primary metric、报告全体候选和适当多重比较控制降低风险。
Judge 偏差可用交换实验:bias_position = P(A wins | A first)-P(A wins | A second);长度偏差可在语义等价的短/长版本上比较。若 generator 与 judge 相同,可加入来源盲化和异构 deterministic checks。Judge score 不作为唯一真值,只是 noisy measurement。
Novelty 四元组距离:D = [problem_diff, assumption_diff, mechanism_diff, evidence_diff]。至少要能指出哪一维不同及其证据;“标题不同”不进入 D。
最小练习或观察步骤
- 构造 20 个纯噪声 toy 假设,计划让自动流程挑最好一个;先计算出现偶然优胜的风险。
- 为两段语义相同文本创建顺序交换、长度匹配、风格交换和来源盲化四个 judge 对照。
- 写一条明显重复的“新方法”,用 problem/assumption/mechanism/evidence 四元组与原方法对照。
- 定义失败测试的成功标准:系统应标记证据不足、重复或需要 holdout,而不是必须找到显著结果。
- 设计 negative-result record:假设、尝试范围、失败原因、可重试条件和禁止过度外推。
常见误区与边界
- 只报告自动搜索最终 p 值,不披露尝试次数和指标分支。
- 两个同源 judge 一致就当独立同行评审。
- 用长、流畅、引用多的文本替代正确性。
- Embedding 距离大就称 novelty,未对照方法与假设。
- 把 replication 贬为无价值,诱使系统错误宣称新颖。
研究/系统场景连接
金融分析 Agent 可能尝试大量客户切片后挑显著差异,必须记录探索与确认的分界,避免制造伪风险规则。自动审阅不能决定真实政策改变。系统层需保存所有 analysis branch、judge 顺序与 prompt/version。P4 自动机器人研究更要防止反复挑选仿真 seed;最佳视频不代表策略稳定,应保存失败轨迹与全部安全干预。
自检问题
- 自动化为什么可能让无意 p-hacking 更严重?
- Judge 一致率高仍可能有什么共同偏差?
- Novelty 四元组中哪一维最难自动判断?
- 一个失败测试怎样算“系统表现好”?
专业课程对齐
- The AI Scientist:重点查看自动 review、实验选择与错误案例,识别作者披露的限制。
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena:学习位置、风格等偏差与人类一致性评估,避免把 judge score 当独立真值。
- AI Co-Scientist:观察 hypothesis ranking 与专家验证的分工,将官方案例保留为外部证据而非本地完成声明。
深入学习提示
最好的失败测试不是让系统崩溃,而是给它一个“很容易写成漂亮成功”的无效问题,看它能否选择保留未知。把“拒绝制造结论”视为研究系统能力,而非缺乏产出。
学后填写区
- 搜索分支与 primary metric:
- Judge 偏差对照:
- Novelty 四元组:
- Negative-result record:
- 当前仍需人类判断: