返回 G01~G90 教材库
G57 · 总 Day 237教材已备 ≠ 学习已完成

G57:受控自改进循环、外部选择信号与停止条件

受控自改进循环是有限轮次的 generate→select→train→independent-evaluate 流程,其改进必须依赖可说明的外部选择信号、真实数据锚点和停止条件,而不是模型给自己更高分。

2027-04-19self-improvement、synthetic-data、verifier、anchor-data、stopping-rule

内容类型:预习教材(不代表已完成)
日期:2027-04-19
阶段:P3 · AGI Foundations 90
总路线:Day 237 / 360
周次:W9 · 自改进、合成数据与递归风险
节奏:周一概念与论文
状态:教材已备;学习未完成
标签:self-improvement、synthetic-data、verifier、anchor-data、stopping-rule

一句话定义

受控自改进循环是有限轮次的 generate→select→train→independent-evaluate 流程,其改进必须依赖可说明的外部选择信号、真实数据锚点和停止条件,而不是模型给自己更高分。

学习目标

  1. 区分 self-training、self-distillation、self-reward、verifier-guided learning 与递归自改进叙事。
  2. 识别每种方法中的外部真值、选择压力和不可独立环节。
  3. 推导 verifier false positive 与分布偏差如何跨轮放大。
  4. 定义最大轮次、质量退化、tail coverage 和资源预算停止条件。

核心知识

  • Self-training 用模型产生 pseudo-label,再把高置信样本加入训练;self-distillation 让学生拟合教师分布;self-reward 用模型或同源 judge 产生偏好;verifier-guided 方法用规则、执行器或外部模型筛选。名称中的“self”不表示系统不依赖人、数据或环境。
  • 真实改进需要独立评价:与选择器相同的 judge 既筛数据又打测试分,会产生 Goodhart 与循环确认。可执行任务、隐藏答案或人工抽样提供更强外部锚点,但也有覆盖边界。
  • Synthetic data 会重新分配支持集。生成器更常产生容易、典型或高概率模式,稀有子群和异常表达可能逐轮减少。
  • Clean anchor 是固定、版本化且不进入生成器自评反馈的真实数据子集。它不能保证无退化,但可提供分布与校准参考。
  • Controlled loop 必须有限权:本地数据、固定算力、无外部写权限、最大轮次与可回滚 checkpoint。任何模型提出修改评价器或放宽边界都需外部决定。

机制与推导

第 (k) 轮数据分布为 (P_k(x,y)),生成器产生 (Q_{\theta_k}(x,y)),选择器接受概率 (s_k(x,y))。训练分布可写为:

[ P_{k+1}=(1-\alpha)P_{anchor}+\alpha\frac{s_kQ_{\theta_k}}{Z_k} ]

其中 (Z_k) 归一化,(\alpha) 是 synthetic 比例。若某稀有子群 (g) 的生成概率和接受率都低,则其质量权重近似:

[ P_{k+1}(g)\propto (1-\alpha)P_{anchor}(g)+\alpha Q_k(g)s_k(g) ]

当 anchor 很小且 (Q_k(g)s_k(g)) 低,子群会逐轮消失。

Verifier 的 false positive rate 为:

[ FPR=P(v=accept\mid y=wrong) ]

若生成器学会产生能骗过 verifier 的错误,错误与接受不再独立,后续 (FPR) 可上升。即使 verifier 的总体 accuracy 高,稀有错误上的 FPR 仍可能主导长期循环。

停止向量不宜压成一个数:

max_rounds reached
anchor metric degrades
tail recall/calibration crosses caution boundary
diversity or coverage falls
verifier disagreement rises
compute/data budget exhausted

边界应在运行前定义,但本教材不预填阈值或结果。

最小练习或观察步骤

  1. 画出 generator、filter/verifier、trainer、anchor evaluator、tail evaluator 与 checkpoint 六个组件,标明哪些相互独立。
  2. 为 Self-Instruct、STaR、self-reward 各写一行:生成什么、按什么选、谁提供外部信号、最可能的循环偏差。
  3. 构造一个二分类 toy 分布,包含 10% 稀有子群;手推 (\alpha) 和 verifier FPR 变化对下一轮子群权重的影响。
  4. 写出最多三轮的状态机,每轮保存 data lineage、model version、verifier version 与独立评价;不要求实际训练。
  5. 设计至少四个停止信号,包含一个平均指标之外的 tail 或 calibration 信号。
  6. 将所有尚未跑的改善主张标 H,外部论文结果标 E;不使用“模型已自我提升”作完成声明。

常见误区与边界

  • 模型 judge 分数上升就称为能力提升,没有独立 test 或执行真值。
  • 生成、筛选和评价都用同一模型,却把三票当独立证据。
  • 只看平均准确率,不看尾部、校准、覆盖和多样性。
  • 每轮只保留最好 checkpoint,却不记录失败与筛选 lineage。
  • 将有限 self-training 描述为可无限递归的自主能力爆炸。
  • 本周 toy loop 不允许改写自身权限、评价标准、网络访问或资源上限。

研究/系统场景连接

客服 Agent 可用已确认案件生成练习数据,但模型自行给出的解决方案不能成为权威标签。金融风险场景的稀有高损失 case 尤其不能被总体合成分布淹没;应保留真实锚点、人工审阅和独立规则。研究 Agent 可以提出新题或实验配置,却不能把自己的可读性评分当作科学发现。所谓自改进首先是数据与评价治理问题,其次才是训练算法。

自检问题

  1. Self-training、distillation 与 self-reward 的选择信号有何不同?
  2. 为什么同源 judge 既筛选又评价会制造循环确认?
  3. 稀有子群怎样在 generate–filter–train 中逐轮消失?
  4. 总体 verifier accuracy 高为何仍可能有危险 FPR?
  5. 停止条件为什么必须包含平均指标以外的维度?

专业课程对齐

深入学习提示

进一步可研究 bootstrapping、EM、自蒸馏、weak-to-strong 与 iterated amplification,但不要把共同循环结构误当成相同保证。每种方法都画出 external ground truth 在哪里;若找不到,就把“改进”降格为行为分布变化假设。优先研究失败停止,而不是增加轮数。

学后填写区

  • 实际阅读的方法:
  • 每种方法的外部选择信号:
  • 一条潜在误差放大链:
  • 预先定义的停止条件:
  • 证据标签与边界:
  • 尚未理解的问题:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本