返回 G01~G90 教材库
G13 · 总 Day 193教材已备 ≠ 学习已完成

G13:Emergent Abilities 与 Mirage 论证对读

涌现争议的学习重点不是选择阵营,而是对齐双方所说的“能力”“突然”和“尺度”,找出它们产生不同预测的实验条件,以及仍无法由现有曲线判断的内部机制问题。

2027-03-06两方论证、定义对齐、可区分预测与保留争议

内容类型:预习教材(不代表已完成)
日期:2027-03-06
阶段:P3 · AGI Foundations 90
总路线:Day 193 / 360
周次 / 节奏:W2 · 周六可选探索
状态:教材已备;学习未完成
主题:两方论证、定义对齐、可区分预测与保留争议

一句话定义

涌现争议的学习重点不是选择阵营,而是对齐双方所说的“能力”“突然”和“尺度”,找出它们产生不同预测的实验条件,以及仍无法由现有曲线判断的内部机制问题。

学习目标

  1. 能公平复述 Emergent Abilities 与 Mirage 两方的最强论点。
  2. 能用定义、横轴、指标、任务、训练状态五项对照定位分歧。
  3. 能提出至少两个区分测量效应与机制变化的实验预测。
  4. 能将结论标为 E/C/H,不把争议升级成 AGI 乐观或悲观立场。

核心知识

Emergent Abilities 研究记录了一类现象:某些 downstream 任务在较小模型接近随机水平,超过一定规模后明显改善,且不能由较小尺度表现直接预测。它的重要贡献是提醒研究者:只在小模型观察缺失能力,可能低估规模变化后的行为;安全评估也不能假设所有能力都线性出现。

Mirage 论证指出,许多表观跃迁可由非线性或离散指标生成。若换成连续、平滑的 metric,性能可能随规模逐渐改善。因此“不从小模型准确率可预测”不必意味着内部突然产生新机制。该论证要求更仔细审计测量函数。

Loss-perspective 进一步提出,相同参数规模不保证相同训练充分性,而 pre-training loss 可能比参数量更接近能力状态。不同任务在 loss 下降到特定范围后越过下游阈值,仍可能形成阶段性行为。它不自动裁决机制是否新生,而是改变横轴解释。

双方可以同时部分成立:对产品使用者,离散任务从不可用到可用是真实行为变化;对机制研究者,它可能来自平滑底层能力越过阈值。安全上仍需关注行为断点,但不能由此宣称出现了全新认知模块。

机制与推导

对读模板包含五元组:(definition, x-axis, y-axis, controls, claim-level)。若一方横轴是参数量、纵轴是 exact match,另一方横轴是 training loss、纵轴是 partial credit,两条曲线并未直接回答同一问题。先把数据投影到共同坐标,再讨论差异。

区分预测一:若主要是 metric artifact,扫描连续指标和阈值后,断点位置应随 metric 移动;若存在稳定行为结构变化,多种合理指标、提示与任务变体可能在相近能力区间出现一致改变。区分预测二:若主要是 under-training,同规模增加训练 token 会使断点移动;若某机制依赖容量,即使训练充分,小模型仍可能无法实现。

区分预测三可来自干预:在断点上下模型中寻找同一中间表示或算法行为,并做 ablation。若只看输出曲线,机制问题不可识别。但内部可解释性证据也有局限,不能因为发现某 circuit 就宣称通用能力机制已经解释。

最小练习或观察步骤

  1. 分别用三句话写 Emergent Abilities 与 Mirage 的最强论点,禁止使用贬义词。
  2. 为两篇研究填五元组,对齐横轴和纵轴差异。
  3. 选择一个 toy task,预写 metric artifact、under-training、capacity mechanism 三个假设的不同预测。
  4. 设计最小对照:连续 metric、两个阈值、相同 loss 不同规模或相同规模不同 token。
  5. 将当前判断标为 C,并写明需要什么证据才可能更新。

常见误区与边界

  • 把“Mirage”理解为所有能力变化都是假的。
  • 把行为跃迁直接解释为模型内部创造了新算法。
  • 用参数量作为唯一尺度,忽略数据、训练 loss 与系统脚手架。
  • 选择对己方有利的 metric,不报告敏感性。
  • 因争议未决而认为研究没有价值;冲突本身揭示了测量层级。
  • 把涌现争议转成 AGI 时间预测,超出所有被比较证据。

研究/系统场景连接

在反欺诈系统中,召回率越过运营阈值后,团队可能从“仅辅助”切换到“自动拦截”,形成真实部署阶段变化。这种系统跃迁来自策略阈值,并不说明模型内部突现新概念。反过来,新特征或新架构可能改变对欺诈团伙的表示;要通过分群、干预和时间外测试识别。

Agent 在任务成功率到达某阈值后也可能被授予更多权限,风险会非线性增加。即便底层能力平滑,部署后果仍可突然变化。因此机制解释与治理关注点不同:前者问能力如何形成,后者还要问阈值决策与权限如何放大后果。

自检问题

  1. 两方争论中“突然”的操作定义分别是什么?
  2. 参数量与 pre-training loss 作为横轴会改变什么?
  3. 什么观测更支持 metric artifact,什么更支持 capacity 限制?
  4. 行为跃迁为何对部署仍然重要?
  5. 当前 C 标签下最关键的未知证据是什么?

专业课程对齐

深入学习提示

写对读笔记时使用“该证据支持……但未区分……”句式。若两方在不同层级都正确,就保留多层答案,而不是追求一句最终裁决。可以进一步研究 phase transition、grokking 与 mechanistic emergence,但它们有各自定义,不能混用。W2 的轻量成果是会问更精确的问题,而不是确定涌现的终极真相。

学后填写区

  • 两方最强论点:
  • 五元组中的关键错位:
  • 三个假设的区分预测:
  • 当前证据标签:
  • 未来可能改变判断的证据:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本