G11:涌现主张的指标敏感性
“涌现”只有在明确模型尺度、训练充分性、任务结构和测量函数后才是可研究主张;若跃迁随评分阈值任意移动或在连续指标中消失,它首先是测量现象,而非已证明的内部新机制。
内容类型:预习教材(不代表已完成)
日期:2027-03-04
阶段:P3 · AGI Foundations 90
总路线:Day 191 / 360
周次 / 节奏:W2 · 周四争议与反例
状态:教材已备;学习未完成
主题:continuous metric、threshold、under-training 与表观涌现
一句话定义
“涌现”只有在明确模型尺度、训练充分性、任务结构和测量函数后才是可研究主张;若跃迁随评分阈值任意移动或在连续指标中消失,它首先是测量现象,而非已证明的内部新机制。
学习目标
- 能区分行为曲线突然、指标离散化与内部机制变化三类不同主张。
- 能用连续 partial credit、多个阈值和训练 loss 检查表观跃迁。
- 能说明 under-training、样本方差和任务难度混合怎样制造非单调曲线。
- 能保留两方证据,不把“涌现存在/不存在”简化成口号对立。
核心知识
涌现至少有三种含义。弱定义只要求某项能力在较小模型不可见、较大模型可见;统计定义关心性能是否相对平滑 scaling 曲线出现不连续;机制定义则声称系统内部形成了新的算法或表示。前两者不能自动推出第三种。
Exact match、pass@k 和阈值准确率都可能把连续质量压成 0/1。假设模型逐渐减少每道题的编辑错误数,但直到完全正确前 exact match 都是零;达到某一规模后多题同时跨过零错误,看起来像突然获得能力。若用编辑距离、步骤正确率或答案概率,改善可能一直平滑。
Under-training 会让小或大模型不在各自可比状态。较大模型若预算不足,曲线可能先平后跳;后续增加训练 token 后,跃迁位置移动。任务混合也会制造阶梯:总分由难度不同的子任务组成,模型依次跨过各子任务阈值,总曲线不代表单一能力突然出现。
机制与推导
设潜在连续能力 z(s)=a log s+b 随规模 s 平滑变化,题目 i 在 z>τ_i 时 exact-match 成功:
[ A(s)=\frac{1}{n}\sum_i \mathbb{1}[z(s)>\tau_i] ]
即使 z(s) 完全连续,有限样本的 τ_i 分布也会让 A(s) 呈阶梯状。改变评分阈值、样本构成或题目难度,跃迁位置就会改变。若内部机制真发生离散变化,应寻找跨指标、跨提示、跨任务仍稳定的行为断点,并进一步做表示或因果分析。
指标敏感性实验可并列:连续 loss L、partial score Q∈[0,1]、阈值分数 1[Q≥τ]。扫描 τ={0.5,0.7,0.9,1.0};若断点随 τ 系统移动,支持测量解释。再控制训练充分性:对每个规模记录最小 validation loss 与训练 token;若较大模型在相同 token 而非相同 compute 下比较,结论可能混入预算差异。
反例也可能相反:连续指标平滑不代表内部绝无机制变化,因为多个机制可以补偿,宏观曲线仍平滑。因此“Mirage”分析限制某类指标证据,不等于证明所有涌现机制不存在。
最小练习或观察步骤
- 生成十个连续质量分数,模拟它们随三个模型规模小幅上升。
- 分别用四个阈值转成 0/1,观察跃迁的规模位置是否稳定。
- 将题目按 easy/medium/hard 分桶,比较总体曲线和分桶曲线。
- 为一个较大模型标记 under-trained 条件,写出增加 token 后两种可能结果及其解释。
- 建立“行为断点—统计断点—机制断点”三栏证据表,不预先填结论。
常见误区与边界
- 只要小模型为零、大模型非零就宣称机制涌现。
- 用一个连续指标消除跃迁后,反向宣称任何新机制都不可能存在。
- 对不同规模使用不同提示、训练数据或工具,却只画参数量横轴。
- 汇总难度差异巨大的题目,隐藏各分桶的平滑趋势。
- 只展示最有戏剧性的 metric,不报告阈值扫描。
- 从某项能力断点推测 AGI 时间,跨越任务、机制与社会部署三重证据边界。
研究/系统场景连接
金融模型中,连续风险分越过审批阈值后,业务结果会突然从“通过”变为“拒绝”。决策量的阶跃不表示模型内部突然学会新风险概念,而可能只是阈值效应。相反,政策规则更新确实可能引入离散系统机制;需要通过版本、特征与因果干预区分。这个类比提醒我们不要把业务决策曲线直接当作表征曲线。
Agent 系统的任务成功同样是离散终点。计划质量、工具参数正确率与恢复次数可能连续改善,但只有全链无误才计成功。记录中间状态能解释长链成功率的跃迁。即便如此,中间评分也可能由自动 judge 引入偏差,应优先使用可执行 verifier。
自检问题
- 行为涌现与机制涌现的证据门槛有何不同?
- 阈值扫描为什么能检验一类测量解释?
- Under-training 会如何移动表观断点?
- 为什么连续曲线不能证明内部绝无离散机制变化?
- 任务难度分桶可以暴露什么汇总误差?
专业课程对齐
- 阅读 Emergent Abilities of Large Language Models,提取其涌现定义、任务和观测方式。
- 阅读 Are Emergent Abilities of Large Language Models a Mirage?,关注非线性指标如何从平滑能力生成跳跃曲线。
- 阅读 Understanding Emergent Abilities from the Loss Perspective,比较 pre-training loss 与模型规模作为横轴时的解释差异。
深入学习提示
不要把论文争议读成二选一辩论。逐项对齐“涌现”的定义、横轴、纵轴、任务分布和训练状态,常会发现结论针对不同层级。若继续深入,可用 change-point model 与平滑模型比较,但样本点少时统计能力有限。最实用的做法仍是保留连续指标、阈值扫描和反例。
学后填写区
- 我采用的三层涌现定义:
- 阈值扫描的设计:
- 一个 under-training 替代解释:
- 哪项证据可支持行为断点:
- 哪项机制主张仍然未知: