返回 G01~G90 教材库
G11 · 总 Day 191教材已备 ≠ 学习已完成

G11:涌现主张的指标敏感性

“涌现”只有在明确模型尺度、训练充分性、任务结构和测量函数后才是可研究主张;若跃迁随评分阈值任意移动或在连续指标中消失,它首先是测量现象,而非已证明的内部新机制。

2027-03-04continuousmetric、threshold、under-training与表观涌现

内容类型:预习教材(不代表已完成)
日期:2027-03-04
阶段:P3 · AGI Foundations 90
总路线:Day 191 / 360
周次 / 节奏:W2 · 周四争议与反例
状态:教材已备;学习未完成
主题:continuous metric、threshold、under-training 与表观涌现

一句话定义

“涌现”只有在明确模型尺度、训练充分性、任务结构和测量函数后才是可研究主张;若跃迁随评分阈值任意移动或在连续指标中消失,它首先是测量现象,而非已证明的内部新机制。

学习目标

  1. 能区分行为曲线突然、指标离散化与内部机制变化三类不同主张。
  2. 能用连续 partial credit、多个阈值和训练 loss 检查表观跃迁。
  3. 能说明 under-training、样本方差和任务难度混合怎样制造非单调曲线。
  4. 能保留两方证据,不把“涌现存在/不存在”简化成口号对立。

核心知识

涌现至少有三种含义。弱定义只要求某项能力在较小模型不可见、较大模型可见;统计定义关心性能是否相对平滑 scaling 曲线出现不连续;机制定义则声称系统内部形成了新的算法或表示。前两者不能自动推出第三种。

Exact match、pass@k 和阈值准确率都可能把连续质量压成 0/1。假设模型逐渐减少每道题的编辑错误数,但直到完全正确前 exact match 都是零;达到某一规模后多题同时跨过零错误,看起来像突然获得能力。若用编辑距离、步骤正确率或答案概率,改善可能一直平滑。

Under-training 会让小或大模型不在各自可比状态。较大模型若预算不足,曲线可能先平后跳;后续增加训练 token 后,跃迁位置移动。任务混合也会制造阶梯:总分由难度不同的子任务组成,模型依次跨过各子任务阈值,总曲线不代表单一能力突然出现。

机制与推导

设潜在连续能力 z(s)=a log s+b 随规模 s 平滑变化,题目 iz>τ_i 时 exact-match 成功:

[ A(s)=\frac{1}{n}\sum_i \mathbb{1}[z(s)>\tau_i] ]

即使 z(s) 完全连续,有限样本的 τ_i 分布也会让 A(s) 呈阶梯状。改变评分阈值、样本构成或题目难度,跃迁位置就会改变。若内部机制真发生离散变化,应寻找跨指标、跨提示、跨任务仍稳定的行为断点,并进一步做表示或因果分析。

指标敏感性实验可并列:连续 loss L、partial score Q∈[0,1]、阈值分数 1[Q≥τ]。扫描 τ={0.5,0.7,0.9,1.0};若断点随 τ 系统移动,支持测量解释。再控制训练充分性:对每个规模记录最小 validation loss 与训练 token;若较大模型在相同 token 而非相同 compute 下比较,结论可能混入预算差异。

反例也可能相反:连续指标平滑不代表内部绝无机制变化,因为多个机制可以补偿,宏观曲线仍平滑。因此“Mirage”分析限制某类指标证据,不等于证明所有涌现机制不存在。

最小练习或观察步骤

  1. 生成十个连续质量分数,模拟它们随三个模型规模小幅上升。
  2. 分别用四个阈值转成 0/1,观察跃迁的规模位置是否稳定。
  3. 将题目按 easy/medium/hard 分桶,比较总体曲线和分桶曲线。
  4. 为一个较大模型标记 under-trained 条件,写出增加 token 后两种可能结果及其解释。
  5. 建立“行为断点—统计断点—机制断点”三栏证据表,不预先填结论。

常见误区与边界

  • 只要小模型为零、大模型非零就宣称机制涌现。
  • 用一个连续指标消除跃迁后,反向宣称任何新机制都不可能存在。
  • 对不同规模使用不同提示、训练数据或工具,却只画参数量横轴。
  • 汇总难度差异巨大的题目,隐藏各分桶的平滑趋势。
  • 只展示最有戏剧性的 metric,不报告阈值扫描。
  • 从某项能力断点推测 AGI 时间,跨越任务、机制与社会部署三重证据边界。

研究/系统场景连接

金融模型中,连续风险分越过审批阈值后,业务结果会突然从“通过”变为“拒绝”。决策量的阶跃不表示模型内部突然学会新风险概念,而可能只是阈值效应。相反,政策规则更新确实可能引入离散系统机制;需要通过版本、特征与因果干预区分。这个类比提醒我们不要把业务决策曲线直接当作表征曲线。

Agent 系统的任务成功同样是离散终点。计划质量、工具参数正确率与恢复次数可能连续改善,但只有全链无误才计成功。记录中间状态能解释长链成功率的跃迁。即便如此,中间评分也可能由自动 judge 引入偏差,应优先使用可执行 verifier。

自检问题

  1. 行为涌现与机制涌现的证据门槛有何不同?
  2. 阈值扫描为什么能检验一类测量解释?
  3. Under-training 会如何移动表观断点?
  4. 为什么连续曲线不能证明内部绝无离散机制变化?
  5. 任务难度分桶可以暴露什么汇总误差?

专业课程对齐

深入学习提示

不要把论文争议读成二选一辩论。逐项对齐“涌现”的定义、横轴、纵轴、任务分布和训练状态,常会发现结论针对不同层级。若继续深入,可用 change-point model 与平滑模型比较,但样本点少时统计能力有限。最实用的做法仍是保留连续指标、阈值扫描和反例。

学后填写区

  • 我采用的三层涌现定义:
  • 阈值扫描的设计:
  • 一个 under-training 替代解释:
  • 哪项证据可支持行为断点:
  • 哪项机制主张仍然未知:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本