G62:合成数据谱系与长尾回看:让每一轮变化可追溯
合成数据谱系是把候选的生成条件、过滤理由、父数据、迭代轮次与训练去向连成证据链,使长尾退化能够定位而不只是被最终分数发现。
内容类型:预习教材(不代表已完成)
日期:2027-04-24
阶段:P3 · AGI Foundations 90
总路线:Day 242
周次节奏:W9 · 周六可选探索
状态:教材已备;学习未完成
一句话定义
合成数据谱系是把候选的生成条件、过滤理由、父数据、迭代轮次与训练去向连成证据链,使长尾退化能够定位而不只是被最终分数发现。
学习目标
- 设计足以重建一条 synthetic sample 生命周期的最小 lineage schema。
- 理解覆盖率、密度、重复率与语义多样性为何不能由一个 embedding 距离替代。
- 能用 lineage 做回溯、分层抽样和反事实删除,而不是把 provenance 当作装饰性元数据。
核心知识
一条合成样本至少有 sample_id、parent_ids、generator/version、prompt_or_rule_hash、seed、round、raw_output_hash、filter/version、accept_reason、group_tags、train_split 与 artifact_consumers。其中 parent 不一定是单条数据,也可能是任务模板、检索文档或程序化规则。只保存最终文本会丢失选择过程,之后无法判断重复来自生成器、过滤器还是采样权重。
长尾可以按频率、难度、风险严重度、组合结构或时间新鲜度定义。频率低不一定重要,业务影响高也不一定频率低,因此需要显式 group schema。tail recall 只回答某一标签集合是否被识别;support coverage 关心输入模式是否仍被生成;calibration 关心置信是否可信;diversity 则可能包括词面、结构、语义与解题路径。把它们压成一个“质量分”会重新制造不可诊断性。
谱系的价值来自操作:按 generator 版本切片、按接受理由对照、删除一批父节点后重建训练集合、查看某次模型错误由哪些训练样本邻域贡献。它不能证明因果,但可以构造干预。若删除 lineage 分支后 tail recall 恢复,才形成比相关性更强的证据;仍需排除样本量和训练随机性的混杂。
机制与推导
把 lineage 表示成有向无环图 G=(V,E):原始锚点、模板、候选、过滤后样本和模型 artifact 都是节点,边表示 generated-from、filtered-by、trained-on 或 evaluated-by。对某一模型 (m_t),训练暴露量可写为:
Exposure(g,m_t)=Σ_i 1[group_i=g]·weight_i·1[i→m_t]
再比较 Performance(g,m_t) 与 Exposure 的变化,但相关关系不能直接解释为因果。一个小型干预协议是:固定训练预算,从集合中移除某个高重复父分支,使用相同 seed 列表重训,与随机移除同样数量样本的对照比较。效应量写为:
Δ_tail = (tail_intervention - tail_base) - (tail_random_drop - tail_base)
若差异不稳定,就保留“谱系帮助定位但当前没有因果证据”的结论。谱系自身也有完整性风险:漏记拒绝样本会让过滤偏差不可见,版本可变但 hash 不变会破坏可复现。
最小练习或观察步骤
- 为 G61 的 toy 分布画五类节点:anchor、template、candidate、accepted sample、model artifact。
- 手写 8 条候选记录,其中至少两条来自同一 parent、两条被拒绝、一条属于稀有子群。
- 写三个查询:某模型用了哪些轮次;某稀有样本为何被拒;某 generator 版本贡献了多少重复。
- 设计“删除高重复分支”和“随机删除等量样本”的对照,先写预期与否定条件,不必运行。
- 检查 lineage 是否记录拒绝项、配置 hash 和 seed;若缺失,写出无法回答的问题。
常见误区与边界
- 只保存 accepted data,导致看不见 selector 的系统性拒绝偏差。
- 用文件名或时间戳代替稳定内容 hash;文件被覆盖后谱系仍看似完整。
- 把 embedding 距离小等同于重复,把距离大等同于真正的新能力覆盖。
- 根据 lineage 相关性直接宣称某数据导致某行为,没有随机对照或反事实干预。
- 在真实客户数据上记录过多原文以求可追溯,反而产生隐私和保留风险;toy 学习应使用合成标识。
研究/系统场景连接
研究系统可把数据 lineage 与实验 registry、模型 hash、评估切片连接起来,从一次行为失败回溯到训练轮次。金融场景中的高风险长尾(例如少见欺诈组合)应由风险标签和人工抽检定义,而不是让生成器自行决定“重要性”。进入 P4 后,具身轨迹还需要记录环境版本、初始状态、传感器噪声与安全干预,单纯文本 lineage 不足以解释动作失败。
自检问题
- 为什么拒绝样本也是谱系的一部分?
- 哪些多样性维度不能由单一 embedding 指标代替?
- 如何从 lineage 相关性推进到最小因果干预?
- 记录越多为何不一定越好?
专业课程对齐
- STaR 原论文:追踪 rationale 生成、筛选和再训练的样本路径,观察外部答案信号怎样进入循环。
- Large Language Models Can Self-Improve:对照其训练数据构造与评估切分,检查“self”背后的任务信号和实验边界。
- Nature 递归生成数据研究:重点查看多代数据过程和尾部分布变化,为 lineage 字段选择提供依据。
深入学习提示
不要先装数据平台;用一张小表和一幅 DAG 就能检验 schema 是否回答关键问题。选择一个异常,沿 behavior → model → training set → accepted candidate → generator/filter → parent 逆向走一遍;每走不通一步就说明缺了一个证据字段。只有确实需要查询规模时再考虑工具。
学后填写区
- 最小 lineage schema:
- 一个无法回溯的缺口:
- 长尾定义与理由:
- 计划中的反事实删除:
- 当前仍未知: