返回 G01~G90 教材库
G59 · 总 Day 239教材已备 ≠ 学习已完成

G59:真实锚点、规则过滤与 Diversity Filtering 对照

真实锚点、规则过滤和多样性过滤分别约束递归训练的参考分布、标签错误与支持集收缩,它们可能互补,也可能因筛选偏差牺牲难例和尾部。

2027-04-21anchor-data、rule-filter、diversity-filter、synthetic-mixture、evaluation

内容类型:预习教材(不代表已完成)
日期:2027-04-21
阶段:P3 · AGI Foundations 90
总路线:Day 239 / 360
周次:W9 · 自改进、合成数据与递归风险
节奏:周三引导实验
状态:教材已备;学习未完成
标签:anchor-data、rule-filter、diversity-filter、synthetic-mixture、evaluation

一句话定义

真实锚点、规则过滤和多样性过滤分别约束递归训练的参考分布、标签错误与支持集收缩,它们可能互补,也可能因筛选偏差牺牲难例和尾部。

学习目标

  1. 比较 pure synthetic、real-anchor mix、rule filtering 与 diversity filtering 的作用点。
  2. 控制合成比例、样本数和训练预算,避免不公平结论。
  3. 理解 quality–diversity–coverage 的多目标关系。
  4. 设计独立 anchor evaluation,不让测试信息进入选择器。

核心知识

  • Real anchor mix 在每轮保留固定真实数据,可减少分布漂移;若 anchor 本身偏、过时或泄漏到测试,仍不能提供可靠真值。
  • Rule filter 对可验证任务很强,例如程序执行或算术答案;对开放文本,规则覆盖有限,容易奖励格式而非语义。
  • Diversity filter 通过聚类、距离、去重或分层采样减少模式重复。它保证“不同”不保证“正确”,还可能保留奇异噪声。
  • 质量、覆盖和多样性不能压成单一分数。严格 quality filter 会降低 coverage,强 diversity 选择可能降低平均质量。
  • Filter 应在固定 hidden anchor 外调试。若每轮看 anchor 结果再修改阈值,anchor 也会成为训练反馈的一部分。

机制与推导

定义混合数据:

[ D_k=D_{real}^{(\beta)}\cup Filter(D_{syn,k})^{(1-\beta)} ]

(\beta) 是真实锚点比例。比较方法时固定 (|D_k|) 与训练步,否则 anchor 方法可能只是看到更多样本。

Rule filter 的 precision/recall 应相对 oracle label 计算。接受样本的期望错误率:

[ P(wrong\mid accept)=\frac{FPR\cdot P(wrong)}{P(accept)} ]

即便 FPR 固定,生成器错误 base rate 上升也会提高接受集错误比例。

Diversity 可用覆盖 bins:将可控二维分布划成 (B) 个格,

[ Coverage=\frac{|{b:count(b)>0}|}{B} ]

或按子群 entropy:(H(G)=-\sum_gp_g\log p_g)。这些指标依赖分箱和 group 定义。更稳妥的是同时报告 exact/near duplicate、group coverage 与 pairwise distance。

形成 Pareto 观察:每种筛选输出向量 ((quality,tail\ recall,coverage,diversity,calibration,cost)),不要挑一个权重宣称绝对最佳。

最小练习或观察步骤

  1. 从 G58 toy 数据准备四种候选:100% synthetic、20% real anchor mix、rule filter、rule+diversity;精力有限时选三种。
  2. 固定最终训练样本数、epoch 或总 optimizer steps,并记录真实/合成比例。
  3. Diversity filter 可用分层抽样或 k-means 每簇限额;先检查它是否错误删除稀有群近邻。
  4. 在固定 hidden anchor、tail set 上评价;筛选阈值不得读取 test label 调优。
  5. 记录质量、总体/tail recall、Brier/ECE、group coverage、duplicate 与计算成本。
  6. 画 Pareto 表并描述取舍;没有一种支配其他方法时,不强行选冠军。

常见误区与边界

  • Anchor 数据固定就认为客观,忽略采样偏差、过时和测试污染。
  • Rule verifier 能执行就认为覆盖任务语义,可能只验证格式或局部约束。
  • 多样性越高越好,保留大量离群噪声。
  • 用 hidden anchor 反复挑 filter,最终失去独立性。
  • Pure synthetic 样本更多或训练更久,比较不公平。
  • toy Pareto 关系不能直接决定真实模型合成数据配方,只提供机制假设。

研究/系统场景连接

金融合成数据可减少直接暴露真实记录,但稀有事件、群体差异和业务规则非常敏感。匿名化、合成和规则验证也不能替代法务与隐私评估。本地 toy 只训练如何联合看 quality 与 coverage。研究 Agent 生成题目时,可用可执行 verifier 检查部分答案、用真实论文问题作 anchor、用去重保留问题类型,但最终仍需独立评价。

自检问题

  1. 真实锚点能降低什么风险,不能保证什么?
  2. Filter FPR 不变时,为什么接受集错误率仍会变化?
  3. Diversity 与 correctness 为什么正交?
  4. Hidden anchor 怎样被反复调参污染?
  5. 哪些变量必须固定才能公平比较四种数据策略?

专业课程对齐

深入学习提示

进一步可研究 DPP、quality-diversity optimization、active learning 与 coreset。先在可视化二维分布上画“筛选前后哪些点消失”,它往往比综合分更能揭示偏差。若 filter 规则依赖当前模型表示,还要记录表示版本,因为所谓多样性会随模型变化。

学后填写区

  • 实际比较的数据策略:
  • 公平预算设置:
  • quality/coverage/diversity 取舍:
  • anchor 独立性:
  • 一个未被任何方法解决的问题:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本