返回 G01~G90 教材库
G61 · 总 Day 241教材已备 ≠ 学习已完成

G61:受控自改进证据图:平均提升不等于分布变好

受控自改进不是模型反复生成并训练自己,而是一条由外部真值、数据谱系、独立评估和停止条件约束的 `generate → select → train → evaluate` 研究循环。

2027-04-23

内容类型:预习教材(不代表已完成)
日期:2027-04-23
阶段:P3 · AGI Foundations 90
总路线:Day 241
周次节奏:W9 · 周五知识整理
状态:教材已备;学习未完成

一句话定义

受控自改进不是模型反复生成并训练自己,而是一条由外部真值、数据谱系、独立评估和停止条件约束的 generate → select → train → evaluate 研究循环。

学习目标

  1. 区分自训练、自蒸馏、自奖励与 verifier-bounded improvement 所依赖的选择信号。
  2. 能同时检查平均性能、稀有子群召回、校准、多样性与分布漂移,不让单一均值掩盖尾部退化。
  3. 为多轮合成数据循环写出可证伪假设、对照组、最大迭代数和停止条件。

核心知识

“模型参与改进模型”至少包含四个彼此不同的角色:generator 产生候选数据或解法,selector/filter 决定哪些候选被保留,learner 用保留数据更新参数,evaluator 在冻结的测试分布上测量变化。如果同一个模型同时扮演四个角色,错误偏好会形成闭环;它给自己高分只能说明内部偏好一致,不能说明对外部任务更正确。

外部选择信号有不同强度。可执行单元测试、形式化约束、环境回报等确定性 verifier 能排除一部分错误,但 verifier 可能不完备;人工标签或真实数据锚点提供独立信息,却可能稀缺并带标注偏差;另一个语言模型 judge 成本低,但与 generator 共享训练先验时并不独立。研究记录要写清 signal 从哪里来、覆盖什么错误、漏掉什么错误。

数据质量也不只是正确率。合成循环可能提高高频模式的一致性,同时压缩低频模式、表达方式和边界案例。建议维护 support coverage、重复率、类别熵、稀有子群比例、校准误差与 provenance。真实锚点不是“神奇解药”,它只是为分布提供不会随 generator 一起漂移的参照。

机制与推导

设第 (t) 轮真实分布为 (P_{real}(x,y)),generator 产生 (Q_t(x,y)),filter 的接受概率为 (a_t(x,y))。实际训练分布近似为:

P_train,t+1 = α·P_anchor + (1-α)·normalize(a_t·Q_t)

若 filter 对常见子群的真阳性率高、对稀有子群低,重复迭代会使后者质量权重递减。即使总体准确率 Acc = Σ_g p_g Acc_g 上升,只要稀有群体权重 p_g 很小,min_g Acc_g 或 tail recall 仍可能下降。因此比较向量应为:

M_t = [mean, tail_recall, ECE, entropy, duplicate_rate, distance(P_anchor,Q_t)]

一个可证伪假设可以写成:H:固定预算下,α=0.2 的真实锚点比纯合成循环更能保持稀有子群召回;若 5 个 seed 的差值区间跨 0,则当前实验不支持 H。 停止协议不是看到下降才临时决定,而是预先规定最大轮数、tail recall 下限、校准恶化阈值和 verifier 抽检失败率。

最小练习或观察步骤

  1. 生成二分类 toy 数据:90% 常见子群满足规则 A,10% 稀有子群满足规则 B,并保留不参与训练的 frozen test。
  2. 定义三组:纯合成、20% clean anchor 混合、20% anchor 加 diversity filter;每组只计划 3 轮。
  3. 人工设计一个偏向规则 A 的 imperfect verifier,使规则 B 的 false negative 更高;不要把该偏差藏在实现中。
  4. 每轮计划记录混淆矩阵、tail recall、ECE、唯一样本率和来源 id;未实际运行时只保留表头与假设。
  5. 画出“哪一个信号阻止哪一种退化”的控制图,并列一个 verifier 无法覆盖的反例。

常见误区与边界

  • 将训练 loss 降低称为能力自改进,却没有冻结且独立的测试集。
  • 只比较最终一轮与初始轮,忽略中间轮的分布漂移和选择压力。
  • 把模型 judge 当成 ground truth;多个同源 judge 的一致也不等于独立验证。
  • 看到 tail 下降便宣称普遍 model collapse,或没看到下降便宣称递归训练安全;结论只适用于当前生成器、过滤器、轮数和任务。
  • 本日只建立受控循环的证据语言,不预测递归自我改进或 AGI 时间线。

研究/系统场景连接

在金融零售问答数据扩增中,高频“余额查询”可以轻易提高平均分,但稀有的争议交易、继承账户和制裁边界可能被过滤掉。系统上应给原始数据、合成器、prompt、filter、judge 与训练 artifact 分配版本和 lineage;研究上需保留冻结的严重子群,并由规则或人工抽检提供外部锚点。若未来把循环接到 Agent,不应授予它自行发布模型、改 verifier 或扩大权限的能力。

自检问题

  1. 一个自改进主张中,generator、selector、learner、evaluator 分别是谁?
  2. 为什么平均准确率上升可以与稀有子群能力下降同时发生?
  3. 真实锚点降低了什么风险,又不能保证什么?
  4. 什么观察会否定而不是确认你的假设?

专业课程对齐

深入学习提示

先画角色与信号,再读论文结果。每看到“self-improve”,就问新增信息来自 verifier、环境、人类、真实数据还是模型原有先验;如果没有新信息,只能暂称分布重整或自蒸馏。进一步可比较 tail risk、校准与平均分的排序是否一致,但不必为了完整而跑大模型。

学后填写区

  • 我的可证伪假设:
  • generator / selector / evaluator:
  • 平均与尾部指标:
  • 停止条件:
  • 当前证据标签(R/E/C/H/S):
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本