G86:论文链路一:Scaling → Emergence → Reasoning → Test-time Compute
这条论文链把训练规模带来的连续 loss 变化、任务指标上的表观跃迁、推理策略与测试时搜索预算分开,避免把四种效应都解释成模型内部突然获得新能力。
内容类型:知识整合教材(不代表已完成)
日期:2027-05-18
阶段:P3 · AGI Foundations 90
总路线:Day 266
周次节奏:知识整合 · 周二论文链路
状态:教材已备;学习未完成
一句话定义
这条论文链把训练规模带来的连续 loss 变化、任务指标上的表观跃迁、推理策略与测试时搜索预算分开,避免把四种效应都解释成模型内部突然获得新能力。
学习目标
- 区分 pretraining compute、model/data allocation、metric transformation 与 inference compute 的贡献。
- 构造从 latent quality 到 exact-match 的阈值示例,解释表观 emergence。
- 用 difficulty、verifier quality 与 budget 描述 test-time compute 何时有用、何时浪费。
核心知识
Scaling law 是观测区间内模型、数据、compute 与 loss 的经验关系,不是 AGI 时间线。Compute-optimal 分配说明固定预算下参数和 token 需共同考虑;只放大参数且 under-train 会混淆尺度效应。下游任务表现又经过 prompt、解码与指标变换,不能从 training loss 曲线直接推出某一能力曲线。
Emergence 可指不同现象:连续 underlying score 穿过 exact-match 阈值,看起来突然;任务组合中最难子技能成为瓶颈,整体乘积在某处快速上升;真正算法机制随训练出现阶段变化。前两种不需要内部相变,第三种需要机制证据。改变 partial credit、阈值和 task difficulty 若使“跃迁”移动,说明测量函数贡献很大,但不能因此断言所有 emergence 都是幻象。
Reasoning 输出也要拆分。更长文本可能提供有效中间计算,也可能只是冗余;self-consistency 从多个样本聚合,tree search 显式扩展候选,process/outcome verifier 决定选择质量。Test-time compute 增加的是 sampling、search、verification 或迭代,不自动等于正确推理。
预算收益依赖 base policy 能否产生正确候选、verifier 能否区分候选、任务难度和停止规则。若 base success 极低,更多采样仍几乎无正确候选;若 verifier false-positive 高,搜索会放大错误;若任务简单,额外预算只增加延迟。
机制与推导
假设 latent quality (q(C)=a-bC^{-α}) 随训练 compute C 平滑改善。Exact-match 指标 M=1[q>τ] 会在跨越 τ 时跳变;partial credit M_soft=sigmoid(k(q-τ)) 的陡峭程度由 k 决定。改变 τ 或 k,跃迁位置随之移动,这是一项 metric sensitivity test。
Best-of-N 在单样本正确率 (p)、完美 verifier 下至少有一个正确候选的概率:
P_success=1-(1-p)^N
若 verifier 对错误候选给高分,最终选择率要乘上 ranking quality,不再单调受益。Adaptive compute 可按不确定性分配预算:N(x)=clip(k·uncertainty(x),N_min,N_max);与固定预算比较必须匹配总调用数,并按难度画 accuracy–compute–latency。
论文关系表应含 claim、independent variable、metric、budget、evidence、alternative explanation 与 extrapolation limit,而不是按发布日期串联故事。
最小练习或观察步骤
- 用 10 个平滑递增 q 值,分别计算 exact threshold 和 sigmoid partial credit,观察跃迁是否移动。
- 手算 p=0.05、0.2、0.6 时 N=1、4、16 的完美 verifier 上界,并写现实 verifier 会破坏什么。
- 画 2×2:低/高 base success × 低/高 verifier quality,预测增加预算的结果。
- 为 scaling、emergence、reasoning、test-time compute 四类主张各写一个竞争解释。
- 设计一个 matched total-budget 的 fixed vs adaptive 试验 spec,只保留 planned 状态。
常见误区与边界
- 从小规模 power law 直接外推 frontier 能力或 AGI 日期。
- Exact-match 跳变就断言内部新机制出现。
- 指标敏感就反过来宣称所有涌现都是测量幻象。
- 输出 token 更多就称 test-time compute 更有效,没有搜索/选择结构。
- Best-of-N 公式使用完美 verifier,却把它当真实系统性能。
研究/系统场景连接
金融问答可用 partial credit、事实覆盖和规则一致替代单一 exact match;推理预算应按案件复杂度分配,简单查询不需要长搜索。系统要记录训练版本、inference budget、verifier 和延迟成本。P4 中 inference budget 受控制频率和实时性约束,不能在机器人即将碰撞时无限延长“思考”。
自检问题
- Training compute 与 test-time compute 分别改变什么?
- 哪种实验能区分指标阈值与内部机制变化?
- Verifier false positive 为什么可能使更多搜索更差?
- Adaptive compute 比较怎样匹配预算?
专业课程对齐
- Scaling Laws for Neural Language Models:提取研究变量、拟合区间和 loss 对象,明确论文没有直接给出 AGI 外推。
- Are Emergent Abilities of Large Language Models a Mirage?:理解 metric choice 如何制造或移动表观跃迁,并保留争议边界。
- Scaling LLM Test-Time Compute Optimally:比较不同 difficulty、base policy 与 verifier 条件下的 inference-compute 策略,不把单一结果普遍化。
深入学习提示
用一张因果图代替“规模让推理涌现”:training compute→loss/representation,metric→observed score,decoding/search→candidate set,verifier→selection,budget→latency/cost。只有变量分开,论文结论才能正确落位。
学后填写区
- 四类主张关系表:
- Metric sensitivity 示例:
- Verifier 假设:
- Matched-budget 设计:
- 当前争议与外推禁区: