G60:Judge Bias、False Positive 与递归错误放大
递归错误放大指生成器反复学习被偏置 judge 接受的错误、重复或低覆盖模式,使内部评分改善而独立真值、尾部与校准退化。
内容类型:预习教材(不代表已完成)
日期:2027-04-22
阶段:P3 · AGI Foundations 90
总路线:Day 240 / 360
周次:W9 · 自改进、合成数据与递归风险
节奏:周四争议与失败案例
状态:教材已备;学习未完成
标签:judge-bias、false-positive、model-collapse、error-amplification、provenance
一句话定义
递归错误放大指生成器反复学习被偏置 judge 接受的错误、重复或低覆盖模式,使内部评分改善而独立真值、尾部与校准退化。
学习目标
- 区分 judge bias、verifier FPR、preference drift、duplicate amplification 与 coverage loss。
- 构造可控偏置并观察它跨轮如何改变训练分布。
- 识别同源生成器—judge 的相关错误与 Goodhart 现象。
- 设计停止、隔离、人工抽样和独立 verifier 等边界,不追求无限循环。
核心知识
- Judge bias 可以偏好长度、格式、自信语气、主流类别或与自身输出相似的答案。内部 score 上升可能只是生成器学会了这些表面特征。
- False positive 是错误样本被接受;false negative 是正确样本被拒绝。递归训练中 FPR 会注入错误,FNR 会缩小覆盖,两者都重要。
- Duplicate amplification 使少数模板获得过高权重,降低有效样本量。字符串不同的 paraphrase 也可能是语义近重复。
- 同一模型或同系列模型充当 generator/judge 时错误相关,不能把多次打分视为独立投票。
- Model collapse 不是所有递归合成训练的必然结果。是否发生依赖真实数据保留、采样、模型、任务、轮数和评价;研究应允许“未观察到”。
机制与推导
令真实质量 (y\in{0,1}),judge 分数受表面特征 (l) 影响:
[ j(x)=\alpha y+\beta l+\epsilon ]
当选择阈值作用于 (j),且 (\beta) 较大,生成器可通过增加 (l) 提高接受率而不改善 (y)。下一轮 (P(l)) 上升,形成 Goodhart feedback。
错误率递推可做简化:若第 k 轮生成错误率为 (e_k),错误接受率 (f_k),正确接受率 (t_k),则接受集错误比例:
[ \tilde e_k=\frac{e_kf_k}{e_kf_k+(1-e_k)t_k} ]
训练后 (e_{k+1}=g(\tilde e_k,\beta,anchor,optimization))。函数 (g) 未知,不能由公式断言必然发散;toy 实验正用于观察特定设置。
有效样本量在权重不均时可近似:
[ N_{eff}=\frac{(\sum_iw_i)^2}{\sum_iw_i^2} ]
大量重复让 (N_{eff}\ll N)。因此样本数量增长不等于信息增长。
安全循环把外部 evaluator 与 selection judge 分开,并在每轮检查 anchor、tail、calibration、coverage、duplicate 和 judge disagreement;任何单维异常均可触发暂停,而非由 Agent 自行放宽阈值。
最小练习或观察步骤
- 在 G58 toy 数据中给 judge 加一种偏置:偏好主群、偏好高置信或偏好某无关 feature;先只选一种。
- 分别注入 5%/15% verifier false positive,或手工设置两档;保持生成候选数量相同。
- 构造 duplicate amplification:复制高分主群模板,并同时计算 raw N 与 (N_{eff})。
- 跑或手推最多三轮,记录内部 judge score、oracle accuracy、tail recall、ECE、coverage、duplicate 和 subgroup weight。
- 加入一项缓解:20% clean anchor、独立 rule verifier 或 diversity filter;只比较机制,不调到漂亮结果。
- 若未见错误累积,检查轮数和强度后如实写“该范围未出现”;不得夸大或伪造 collapse。
常见误区与边界
- Judge score 提升被写成能力提升,忽略 judge 正是训练目标。
- 多个同源 judge 投票被当作独立验证。
- 只看错误被接受,忽略正确长尾被拒绝造成覆盖收缩。
- 数据条数增长就认为多样性增加,没有 effective sample size 或近重复检查。
- 看到一次退化就宣称所有合成数据必然坍缩;看到未退化就宣称递归安全。
- toy 偏置只演示机制,不预测 frontier 模型、自我改进速度或 AGI 风险概率。
研究/系统场景连接
金融文本 judge 可能偏好格式完整、术语专业的建议,却漏掉事实错误或客户伤害。若这类评分用于筛选再训练,系统会生产更像模板而不更正确的答案。必须保留权威业务规则、人工抽样、稀有 case 和版本化 lineage。研究 Agent 也可能偏好与自身观点一致的论文摘要,逐轮削弱反方证据;独立来源和明确 claim–evidence 映射比自动互评更重要。
自检问题
- Judge bias 如何让 score 上升而真实质量不变?
- FPR 与 FNR 在递归循环中分别损害什么?
- 为什么错误递推式不能单独证明必然发散?
- (N_{eff}) 如何揭示重复样本的虚假规模?
- “未出现 collapse”应怎样限定实验范围?
专业课程对齐
- 阅读 Self-Rewarding Language Models 原始论文,定位 self-judge、迭代偏好学习和评价设计,并列出相关错误问题。
- 阅读 递归生成数据导致模型坍缩的 Nature 论文,核对其代际设置、数据条件与结论范围,避免口号化。
- 阅读 Large Language Models Can Self-Improve 原始论文,比较其选择信号与本日注入偏置的 toy judge。
深入学习提示
可进一步研究 reward hacking、Goodhart taxonomy、judge calibration、adversarial validation 与 data attribution。优先保留每轮 lineage 和独立评价,而不是堆叠更多 judge。真正的研究问题是:选择压力把分布推向哪里,哪些真实信号仍在闭环之外提供纠偏。
学后填写区
- 实际注入的偏置/FPR:
- 每轮内部与独立指标:
- duplicate 与有效样本量:
- 缓解或未缓解现象:
- 未出现现象的范围:
- 尚未理解的问题: