返回 G01~G90 教材库
G58 · 总 Day 238教材已备 ≠ 学习已完成

G58:稀有子群上的一轮 Generate–Filter–Retrain

稀有子群 toy loop 用可控真实分布观察生成器覆盖、过滤器偏差与再训练如何重新分配数据质量,从而把平均改善和尾部退化同时暴露出来。

2027-04-20synthetic-data、rare-subgroup、lineage、tail-recall、retraining

内容类型:预习教材(不代表已完成)
日期:2027-04-20
阶段:P3 · AGI Foundations 90
总路线:Day 238 / 360
周次:W9 · 自改进、合成数据与递归风险
节奏:周二最小机制
状态:教材已备;学习未完成
标签:synthetic-data、rare-subgroup、lineage、tail-recall、retraining

一句话定义

稀有子群 toy loop 用可控真实分布观察生成器覆盖、过滤器偏差与再训练如何重新分配数据质量,从而把平均改善和尾部退化同时暴露出来。

学习目标

  1. 从零构造带稀有子群和可计算真值的数据分布。
  2. 实现一轮生成、规则/置信过滤、混合与再训练的最小流程。
  3. 记录样本 lineage、子群覆盖、tail recall、校准和重复率。
  4. 用对照判断变化来自更多数据、标签质量还是分布重加权。

核心知识

  • 可控 synthetic distribution 的优势是每个样本真值已知,能精确计算 verifier FPR/FNR;缺点是规律简单,不能代表自然语言长尾。
  • Rare subgroup 不应只靠样本少定义,还应说明其错误代价、特征和与主群的机制关系。少数但容易识别的子群不一定最难。
  • 生成器可能通过对已有数据 bootstrap、拟合分布后采样或规则扰动产生样本。每种生成方式的支持集不同。
  • Filtering 同时改变标签噪声和样本分布。高置信过滤往往偏向容易样本,导致边界与稀有样本更少。
  • Data lineage 至少记录 source_round, generator_version, parent_id, filter_reason, predicted_label, oracle_label;它支持错误追踪,而非形式化负担。

机制与推导

构造 (x=(x_1,x_2,g)),其中 (g\in{0,1}),(P(g=1)=0.1)。主群标签:

[ y=\mathbb 1[x_1+x_2>0],\quad g=0 ]

稀有群使用稍不同规则:

[ y=\mathbb 1[x_1-x_2>0],\quad g=1 ]

若模型不见 (g) 或训练样本不足,它可能在总体上表现良好、在稀有群系统性失败。总体 accuracy:

[ Acc=0.9Acc_0+0.1Acc_1 ]

即使 (Acc_1) 大幅下降,总体变化也小。

生成器从模型置信分布采样候选,filter 接受 (c(x)>\tau) 的 pseudo-label。接受后的子群比例:

[ P(g=1\mid accept)=\frac{P(accept\mid g=1)P(g=1)}{P(accept)} ]

若稀有群置信低,该比例进一步下降。重复率可按 exact duplicate 或距离阈值计算;多样性可以报告网格覆盖、feature covariance 或 pairwise distance,避免只用一个 embedding 分数。

最小练习或观察步骤

  1. 用固定 seed 生成 train、clean anchor test 与不参与筛选的 tail test;保存 (g) 仅用于评价,也可做一个模型可见/不可见版本。
  2. 训练一个小 logistic/MLP baseline,记录总体与分组 accuracy、recall、Brier score 或 ECE。
  3. 从已有数据 bootstrap 加噪生成候选,或从拟合 Gaussian 采样;为每个候选保留 parent/source。
  4. 比较无过滤、置信过滤、oracle rule filtering 三种中的两种即可;每种新增样本数保持一致。
  5. 再训练一轮,与“增加同数量真实样本”和“重复原样本”对照,以区分数据量与质量。
  6. 报告总体、tail、coverage、duplicate、calibration 与 lineage;未运行时保留空表,不填写预期数字。

常见误区与边界

  • 总体准确率上升就称合成数据有效,稀有群可能退化。
  • Oracle filter 被当成现实可用方法;它只是提供真值上界。
  • 合成样本更多却没有相同训练步或样本数对照。
  • 置信度等同于正确率,没有校准检查。
  • 删除重复只按字符串 exact match,忽略近重复与模式坍缩。
  • 二维 toy 分布只能演示支持集和过滤机制,不能直接代表语言、视觉或金融真实长尾。

研究/系统场景连接

欺诈、申诉和少见合规例外往往是低频高影响子群。用主流案例合成训练数据可能进一步稀释它们;因此生产更新需要真实锚点、分组评价和人工确认。toy 环境可帮助产品/架构背景学习者看清 base rate,不应拿来自动判断真实客户。研究 Agent 生成更多“典型论文问题”也可能降低异质性,lineage 能提示哪些问题只是在改写自己。

自检问题

  1. 为什么总体 accuracy 对 10% 子群退化不敏感?
  2. 高置信过滤为何会改变接受后的子群比例?
  3. “增加真实样本”对照回答什么问题?
  4. Oracle filter 的研究作用与现实边界是什么?
  5. Lineage 中哪几个字段支持错误回溯?

专业课程对齐

深入学习提示

可扩展到多轮、不同 base rate、label noise 与 conditional generator,但先确保一轮能清楚归因。深入时画每轮支持集,而不是只画 loss。若某轮没有退化,不要人为提高噪声直到得到想要叙事;写明未出现范围同样重要。

学后填写区

  • 实际数据规则与 base rate:
  • 实际生成/过滤条件:
  • 总体与 tail 观察:
  • coverage/duplicate/calibration:
  • lineage 或未运行说明:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本