G58:稀有子群上的一轮 Generate–Filter–Retrain
稀有子群 toy loop 用可控真实分布观察生成器覆盖、过滤器偏差与再训练如何重新分配数据质量,从而把平均改善和尾部退化同时暴露出来。
内容类型:预习教材(不代表已完成)
日期:2027-04-20
阶段:P3 · AGI Foundations 90
总路线:Day 238 / 360
周次:W9 · 自改进、合成数据与递归风险
节奏:周二最小机制
状态:教材已备;学习未完成
标签:synthetic-data、rare-subgroup、lineage、tail-recall、retraining
一句话定义
稀有子群 toy loop 用可控真实分布观察生成器覆盖、过滤器偏差与再训练如何重新分配数据质量,从而把平均改善和尾部退化同时暴露出来。
学习目标
- 从零构造带稀有子群和可计算真值的数据分布。
- 实现一轮生成、规则/置信过滤、混合与再训练的最小流程。
- 记录样本 lineage、子群覆盖、tail recall、校准和重复率。
- 用对照判断变化来自更多数据、标签质量还是分布重加权。
核心知识
- 可控 synthetic distribution 的优势是每个样本真值已知,能精确计算 verifier FPR/FNR;缺点是规律简单,不能代表自然语言长尾。
- Rare subgroup 不应只靠样本少定义,还应说明其错误代价、特征和与主群的机制关系。少数但容易识别的子群不一定最难。
- 生成器可能通过对已有数据 bootstrap、拟合分布后采样或规则扰动产生样本。每种生成方式的支持集不同。
- Filtering 同时改变标签噪声和样本分布。高置信过滤往往偏向容易样本,导致边界与稀有样本更少。
- Data lineage 至少记录
source_round, generator_version, parent_id, filter_reason, predicted_label, oracle_label;它支持错误追踪,而非形式化负担。
机制与推导
构造 (x=(x_1,x_2,g)),其中 (g\in{0,1}),(P(g=1)=0.1)。主群标签:
[ y=\mathbb 1[x_1+x_2>0],\quad g=0 ]
稀有群使用稍不同规则:
[ y=\mathbb 1[x_1-x_2>0],\quad g=1 ]
若模型不见 (g) 或训练样本不足,它可能在总体上表现良好、在稀有群系统性失败。总体 accuracy:
[ Acc=0.9Acc_0+0.1Acc_1 ]
即使 (Acc_1) 大幅下降,总体变化也小。
生成器从模型置信分布采样候选,filter 接受 (c(x)>\tau) 的 pseudo-label。接受后的子群比例:
[ P(g=1\mid accept)=\frac{P(accept\mid g=1)P(g=1)}{P(accept)} ]
若稀有群置信低,该比例进一步下降。重复率可按 exact duplicate 或距离阈值计算;多样性可以报告网格覆盖、feature covariance 或 pairwise distance,避免只用一个 embedding 分数。
最小练习或观察步骤
- 用固定 seed 生成 train、clean anchor test 与不参与筛选的 tail test;保存 (g) 仅用于评价,也可做一个模型可见/不可见版本。
- 训练一个小 logistic/MLP baseline,记录总体与分组 accuracy、recall、Brier score 或 ECE。
- 从已有数据 bootstrap 加噪生成候选,或从拟合 Gaussian 采样;为每个候选保留 parent/source。
- 比较无过滤、置信过滤、oracle rule filtering 三种中的两种即可;每种新增样本数保持一致。
- 再训练一轮,与“增加同数量真实样本”和“重复原样本”对照,以区分数据量与质量。
- 报告总体、tail、coverage、duplicate、calibration 与 lineage;未运行时保留空表,不填写预期数字。
常见误区与边界
- 总体准确率上升就称合成数据有效,稀有群可能退化。
- Oracle filter 被当成现实可用方法;它只是提供真值上界。
- 合成样本更多却没有相同训练步或样本数对照。
- 置信度等同于正确率,没有校准检查。
- 删除重复只按字符串 exact match,忽略近重复与模式坍缩。
- 二维 toy 分布只能演示支持集和过滤机制,不能直接代表语言、视觉或金融真实长尾。
研究/系统场景连接
欺诈、申诉和少见合规例外往往是低频高影响子群。用主流案例合成训练数据可能进一步稀释它们;因此生产更新需要真实锚点、分组评价和人工确认。toy 环境可帮助产品/架构背景学习者看清 base rate,不应拿来自动判断真实客户。研究 Agent 生成更多“典型论文问题”也可能降低异质性,lineage 能提示哪些问题只是在改写自己。
自检问题
- 为什么总体 accuracy 对 10% 子群退化不敏感?
- 高置信过滤为何会改变接受后的子群比例?
- “增加真实样本”对照回答什么问题?
- Oracle filter 的研究作用与现实边界是什么?
- Lineage 中哪几个字段支持错误回溯?
专业课程对齐
- 阅读 Self-Instruct 原始论文,对照其生成和过滤步骤,为本地 toy lineage 找到对应环节。
- 阅读 递归生成数据导致模型坍缩的 Nature 论文,关注分布尾部和代际训练设置,不把其结果无条件推广到所有合成数据。
- 阅读 Large Language Models Can Self-Improve 原始论文,辨认 pseudo-label、选择和评价流程,并与可计算 oracle toy 真值比较。
深入学习提示
可扩展到多轮、不同 base rate、label noise 与 conditional generator,但先确保一轮能清楚归因。深入时画每轮支持集,而不是只画 loss。若某轮没有退化,不要人为提高噪声直到得到想要叙事;写明未出现范围同样重要。
学后填写区
- 实际数据规则与 base rate:
- 实际生成/过滤条件:
- 总体与 tail 观察:
- coverage/duplicate/calibration:
- lineage 或未运行说明:
- 尚未理解的问题: