G12:Scaling 残差、区间与外推禁区
残差分析用预测与实际观测之间的结构化偏差检查 scaling 模型是否遗漏机制,而外推纪律要求任何拟合都只在明确区间内陈述,并把远距离预测标为假设而非事实。
内容类型:预习教材(不代表已完成)
日期:2027-03-05
阶段:P3 · AGI Foundations 90
总路线:Day 192 / 360
周次 / 节奏:W2 · 周五知识整合
状态:教材已备;学习未完成
主题:residual analysis、uncertainty、extra budget point 与边界陈述
一句话定义
残差分析用预测与实际观测之间的结构化偏差检查 scaling 模型是否遗漏机制,而外推纪律要求任何拟合都只在明确区间内陈述,并把远距离预测标为假设而非事实。
学习目标
- 能计算并解释 residual、相对误差与 held-out budget prediction。
- 能识别残差随规模、预算或数据配比呈现的系统模式。
- 能区分拟合参数不确定性、运行随机性与模型形式不确定性。
- 能为 scaling 结果写一段包括范围、残差、异常点和外推禁区的诚实摘要。
核心知识
拟合线漂亮不等于模型正确。残差 r_i=y_i-ŷ_i 若随机围绕零分布,至少没有明显系统模式;若小规模均为正、大规模均为负,斜率或不可约项可能错误;若残差随数据配比变化,单变量 scaling 遗漏了 N/D;若某一规模方差特别大,优化稳定性或 seed 敏感性需要单独解释。
误差来源有三层。Aleatoric 或运行差异来自 seed、样本与优化随机性;parameter uncertainty 来自有限预算点导致指数估计不稳;model-form uncertainty 来自幂律本身可能不适用或需要分段。只给参数置信区间通常没有覆盖第三层。
额外预算点应在拟合前保留为 held-out,而不是看完后再选择。它可以位于区间内部检验插值,也可以略超出上界检验短程外推。若预测失败,价值在于暴露模型边界,不应通过删除点恢复漂亮曲线。
机制与推导
对观测 y_i 和预测 ŷ_i,残差为 r_i=y_i-ŷ_i,相对残差可写 r_i/|y_i|。均方误差会放大异常点,绝对误差更稳健;两者都不能替代残差图。若在 log 空间拟合,应明确 residual 是在 log loss 还是原始 loss 中计算,因为两者权重不同。
可以做 leave-one-out 思考:每次去掉一个预算点拟合,再预测该点。若指数 α 随去掉某一点大幅改变,结论被单点支配。Bootstrap 可重采样 seed 或任务实例得到参数分布,但若只有三个规模,数字区间仍可能过于乐观。
外推误差会随距离放大。幂律 ŷ=A x^{-α} 中,指数误差 δα 导致相对预测误差约随 log x 增大;当外推跨多个数量级,微小斜率差会变得巨大。架构、数据质量和训练方式在远距离通常也不保持不变,因此统计外推之外还有机制断裂。
最小练习或观察步骤
- 为四个假想预算点拟合一条 log–log 直线,手算或用表格得到
ŷ与r。 - 按规模画残差符号,判断是否存在系统弯曲或单点支配。
- 留出第五个预算点,先写预测区间和失败判据,再决定是否观察它。
- 分别删除最小点和最大点,观察斜率方向是否明显改变。
- 写一段五句摘要:配置、区间、趋势、异常/不确定性、不可外推对象。
常见误区与边界
- 用训练数据上的
R²代替 held-out 预测能力。 - 拟合后才挑一个“验证点”,或删除不符合预期的异常点。
- 在 log 空间拟合,却在原空间用未说明权重评价。
- 把 seed 区间当成模型形式不确定性的完整覆盖。
- 用三个微型规模估计高精度指数并远距外推。
- 将 loss 外推进一步转成能力、经济影响或 AGI 日期,连续跨越未验证映射。
研究/系统场景连接
金融时间序列模型的历史拟合常被制度变化打断。即使过去多个季度呈稳定趋势,利率、欺诈策略或客户渠道变化都会改变数据生成机制。Scaling 外推的“配置不变”假设在这里特别脆弱。更诚实的做法是使用短程预测、漂移指示和场景区间,而不是一条远期确定曲线。
Agent 评测也可能随着工具库、提示框架和 verifier 版本发生机制变化。把不同系统版本的点连成 scaling 线会混淆规模与工程改进。应保存系统配置,必要时分段拟合。残差并非只用于统计,它还可指向工具错误、数据覆盖或评测饱和等系统原因。
自检问题
- 残差随机围绕零能证明什么,又不能证明什么?
- 为什么 leave-one-out 能发现单点支配?
- Seed 区间为何没有覆盖模型形式不确定性?
- 指数小误差为何在远距离外推中被放大?
- 你的 scaling 摘要中必须出现哪条外推禁区?
专业课程对齐
- 回看 Scaling Laws for Neural Language Models 的拟合图与实验区间,重点观察数据点而不只看结论线。
- 对照 Training Compute-Optimal Large Language Models 中新增规模与 iso-compute 证据,理解为什么更多预算点会修改配比结论。
- 参考 Stanford CS229 的回归、偏差—方差与模型评估基础,把 residual 当作诊断而不是装饰图。
深入学习提示
若准备实际拟合,先预留一个点再打开拟合工具,避免无意识地用全部数据调模型。观察残差后先提出机制解释,再考虑增加函数复杂度;分段曲线虽更贴合,也更容易过拟合。外推段用虚线、标假设并写触发失效的条件,是比给出“精确预测”更成熟的表达。
学后填写区
- 我的观测与保留区间:
- 最显著的残差模式:
- 斜率对单点的敏感性:
- 五句范围摘要:
- 明确禁止的外推: