G59:真实锚点、规则过滤与 Diversity Filtering 对照
真实锚点、规则过滤和多样性过滤分别约束递归训练的参考分布、标签错误与支持集收缩,它们可能互补,也可能因筛选偏差牺牲难例和尾部。
内容类型:预习教材(不代表已完成)
日期:2027-04-21
阶段:P3 · AGI Foundations 90
总路线:Day 239 / 360
周次:W9 · 自改进、合成数据与递归风险
节奏:周三引导实验
状态:教材已备;学习未完成
标签:anchor-data、rule-filter、diversity-filter、synthetic-mixture、evaluation
一句话定义
真实锚点、规则过滤和多样性过滤分别约束递归训练的参考分布、标签错误与支持集收缩,它们可能互补,也可能因筛选偏差牺牲难例和尾部。
学习目标
- 比较 pure synthetic、real-anchor mix、rule filtering 与 diversity filtering 的作用点。
- 控制合成比例、样本数和训练预算,避免不公平结论。
- 理解 quality–diversity–coverage 的多目标关系。
- 设计独立 anchor evaluation,不让测试信息进入选择器。
核心知识
- Real anchor mix 在每轮保留固定真实数据,可减少分布漂移;若 anchor 本身偏、过时或泄漏到测试,仍不能提供可靠真值。
- Rule filter 对可验证任务很强,例如程序执行或算术答案;对开放文本,规则覆盖有限,容易奖励格式而非语义。
- Diversity filter 通过聚类、距离、去重或分层采样减少模式重复。它保证“不同”不保证“正确”,还可能保留奇异噪声。
- 质量、覆盖和多样性不能压成单一分数。严格 quality filter 会降低 coverage,强 diversity 选择可能降低平均质量。
- Filter 应在固定 hidden anchor 外调试。若每轮看 anchor 结果再修改阈值,anchor 也会成为训练反馈的一部分。
机制与推导
定义混合数据:
[ D_k=D_{real}^{(\beta)}\cup Filter(D_{syn,k})^{(1-\beta)} ]
(\beta) 是真实锚点比例。比较方法时固定 (|D_k|) 与训练步,否则 anchor 方法可能只是看到更多样本。
Rule filter 的 precision/recall 应相对 oracle label 计算。接受样本的期望错误率:
[ P(wrong\mid accept)=\frac{FPR\cdot P(wrong)}{P(accept)} ]
即便 FPR 固定,生成器错误 base rate 上升也会提高接受集错误比例。
Diversity 可用覆盖 bins:将可控二维分布划成 (B) 个格,
[ Coverage=\frac{|{b:count(b)>0}|}{B} ]
或按子群 entropy:(H(G)=-\sum_gp_g\log p_g)。这些指标依赖分箱和 group 定义。更稳妥的是同时报告 exact/near duplicate、group coverage 与 pairwise distance。
形成 Pareto 观察:每种筛选输出向量 ((quality,tail\ recall,coverage,diversity,calibration,cost)),不要挑一个权重宣称绝对最佳。
最小练习或观察步骤
- 从 G58 toy 数据准备四种候选:100% synthetic、20% real anchor mix、rule filter、rule+diversity;精力有限时选三种。
- 固定最终训练样本数、epoch 或总 optimizer steps,并记录真实/合成比例。
- Diversity filter 可用分层抽样或 k-means 每簇限额;先检查它是否错误删除稀有群近邻。
- 在固定 hidden anchor、tail set 上评价;筛选阈值不得读取 test label 调优。
- 记录质量、总体/tail recall、Brier/ECE、group coverage、duplicate 与计算成本。
- 画 Pareto 表并描述取舍;没有一种支配其他方法时,不强行选冠军。
常见误区与边界
- Anchor 数据固定就认为客观,忽略采样偏差、过时和测试污染。
- Rule verifier 能执行就认为覆盖任务语义,可能只验证格式或局部约束。
- 多样性越高越好,保留大量离群噪声。
- 用 hidden anchor 反复挑 filter,最终失去独立性。
- Pure synthetic 样本更多或训练更久,比较不公平。
- toy Pareto 关系不能直接决定真实模型合成数据配方,只提供机制假设。
研究/系统场景连接
金融合成数据可减少直接暴露真实记录,但稀有事件、群体差异和业务规则非常敏感。匿名化、合成和规则验证也不能替代法务与隐私评估。本地 toy 只训练如何联合看 quality 与 coverage。研究 Agent 生成题目时,可用可执行 verifier 检查部分答案、用真实论文问题作 anchor、用去重保留问题类型,但最终仍需独立评价。
自检问题
- 真实锚点能降低什么风险,不能保证什么?
- Filter FPR 不变时,为什么接受集错误率仍会变化?
- Diversity 与 correctness 为什么正交?
- Hidden anchor 怎样被反复调参污染?
- 哪些变量必须固定才能公平比较四种数据策略?
专业课程对齐
- 阅读 Self-Instruct 原始论文,分析其启发式过滤和去重分别针对什么问题。
- 阅读 递归生成数据导致模型坍缩的 Nature 论文,关注真实数据保留、代际采样与分布尾部的关系。
- 阅读 STaR 原始论文,比较可验证答案筛选与开放式质量过滤,避免把 rationale 流畅度当成正确性。
深入学习提示
进一步可研究 DPP、quality-diversity optimization、active learning 与 coreset。先在可视化二维分布上画“筛选前后哪些点消失”,它往往比综合分更能揭示偏差。若 filter 规则依赖当前模型表示,还要记录表示版本,因为所谓多样性会随模型变化。
学后填写区
- 实际比较的数据策略:
- 公平预算设置:
- quality/coverage/diversity 取舍:
- anchor 独立性:
- 一个未被任何方法解决的问题:
- 尚未理解的问题: