G57:受控自改进循环、外部选择信号与停止条件
受控自改进循环是有限轮次的 generate→select→train→independent-evaluate 流程,其改进必须依赖可说明的外部选择信号、真实数据锚点和停止条件,而不是模型给自己更高分。
内容类型:预习教材(不代表已完成)
日期:2027-04-19
阶段:P3 · AGI Foundations 90
总路线:Day 237 / 360
周次:W9 · 自改进、合成数据与递归风险
节奏:周一概念与论文
状态:教材已备;学习未完成
标签:self-improvement、synthetic-data、verifier、anchor-data、stopping-rule
一句话定义
受控自改进循环是有限轮次的 generate→select→train→independent-evaluate 流程,其改进必须依赖可说明的外部选择信号、真实数据锚点和停止条件,而不是模型给自己更高分。
学习目标
- 区分 self-training、self-distillation、self-reward、verifier-guided learning 与递归自改进叙事。
- 识别每种方法中的外部真值、选择压力和不可独立环节。
- 推导 verifier false positive 与分布偏差如何跨轮放大。
- 定义最大轮次、质量退化、tail coverage 和资源预算停止条件。
核心知识
- Self-training 用模型产生 pseudo-label,再把高置信样本加入训练;self-distillation 让学生拟合教师分布;self-reward 用模型或同源 judge 产生偏好;verifier-guided 方法用规则、执行器或外部模型筛选。名称中的“self”不表示系统不依赖人、数据或环境。
- 真实改进需要独立评价:与选择器相同的 judge 既筛数据又打测试分,会产生 Goodhart 与循环确认。可执行任务、隐藏答案或人工抽样提供更强外部锚点,但也有覆盖边界。
- Synthetic data 会重新分配支持集。生成器更常产生容易、典型或高概率模式,稀有子群和异常表达可能逐轮减少。
- Clean anchor 是固定、版本化且不进入生成器自评反馈的真实数据子集。它不能保证无退化,但可提供分布与校准参考。
- Controlled loop 必须有限权:本地数据、固定算力、无外部写权限、最大轮次与可回滚 checkpoint。任何模型提出修改评价器或放宽边界都需外部决定。
机制与推导
第 (k) 轮数据分布为 (P_k(x,y)),生成器产生 (Q_{\theta_k}(x,y)),选择器接受概率 (s_k(x,y))。训练分布可写为:
[ P_{k+1}=(1-\alpha)P_{anchor}+\alpha\frac{s_kQ_{\theta_k}}{Z_k} ]
其中 (Z_k) 归一化,(\alpha) 是 synthetic 比例。若某稀有子群 (g) 的生成概率和接受率都低,则其质量权重近似:
[ P_{k+1}(g)\propto (1-\alpha)P_{anchor}(g)+\alpha Q_k(g)s_k(g) ]
当 anchor 很小且 (Q_k(g)s_k(g)) 低,子群会逐轮消失。
Verifier 的 false positive rate 为:
[ FPR=P(v=accept\mid y=wrong) ]
若生成器学会产生能骗过 verifier 的错误,错误与接受不再独立,后续 (FPR) 可上升。即使 verifier 的总体 accuracy 高,稀有错误上的 FPR 仍可能主导长期循环。
停止向量不宜压成一个数:
max_rounds reached
anchor metric degrades
tail recall/calibration crosses caution boundary
diversity or coverage falls
verifier disagreement rises
compute/data budget exhausted
边界应在运行前定义,但本教材不预填阈值或结果。
最小练习或观察步骤
- 画出 generator、filter/verifier、trainer、anchor evaluator、tail evaluator 与 checkpoint 六个组件,标明哪些相互独立。
- 为 Self-Instruct、STaR、self-reward 各写一行:生成什么、按什么选、谁提供外部信号、最可能的循环偏差。
- 构造一个二分类 toy 分布,包含 10% 稀有子群;手推 (\alpha) 和 verifier FPR 变化对下一轮子群权重的影响。
- 写出最多三轮的状态机,每轮保存 data lineage、model version、verifier version 与独立评价;不要求实际训练。
- 设计至少四个停止信号,包含一个平均指标之外的 tail 或 calibration 信号。
- 将所有尚未跑的改善主张标
H,外部论文结果标E;不使用“模型已自我提升”作完成声明。
常见误区与边界
- 模型 judge 分数上升就称为能力提升,没有独立 test 或执行真值。
- 生成、筛选和评价都用同一模型,却把三票当独立证据。
- 只看平均准确率,不看尾部、校准、覆盖和多样性。
- 每轮只保留最好 checkpoint,却不记录失败与筛选 lineage。
- 将有限 self-training 描述为可无限递归的自主能力爆炸。
- 本周 toy loop 不允许改写自身权限、评价标准、网络访问或资源上限。
研究/系统场景连接
客服 Agent 可用已确认案件生成练习数据,但模型自行给出的解决方案不能成为权威标签。金融风险场景的稀有高损失 case 尤其不能被总体合成分布淹没;应保留真实锚点、人工审阅和独立规则。研究 Agent 可以提出新题或实验配置,却不能把自己的可读性评分当作科学发现。所谓自改进首先是数据与评价治理问题,其次才是训练算法。
自检问题
- Self-training、distillation 与 self-reward 的选择信号有何不同?
- 为什么同源 judge 既筛选又评价会制造循环确认?
- 稀有子群怎样在 generate–filter–train 中逐轮消失?
- 总体 verifier accuracy 高为何仍可能有危险 FPR?
- 停止条件为什么必须包含平均指标以外的维度?
专业课程对齐
- 阅读 Self-Instruct 原始论文,追踪 seed tasks、生成、过滤和人工评价,明确“自生成”仍依赖初始指令与筛选。
- 阅读 STaR 原始论文,关注 rationale 生成、答案正确性与再训练循环,区分可验证答案和自由生成解释。
- 阅读 Self-Rewarding Language Models 原始论文,定位模型作为 judge 的角色,并主动列出独立性与 reward hacking 问题。
深入学习提示
进一步可研究 bootstrapping、EM、自蒸馏、weak-to-strong 与 iterated amplification,但不要把共同循环结构误当成相同保证。每种方法都画出 external ground truth 在哪里;若找不到,就把“改进”降格为行为分布变化假设。优先研究失败停止,而不是增加轮数。
学后填写区
- 实际阅读的方法:
- 每种方法的外部选择信号:
- 一条潜在误差放大链:
- 预先定义的停止条件:
- 证据标签与边界:
- 尚未理解的问题: