返回 G01~G90 教材库
G12 · 总 Day 192教材已备 ≠ 学习已完成

G12:Scaling 残差、区间与外推禁区

残差分析用预测与实际观测之间的结构化偏差检查 scaling 模型是否遗漏机制,而外推纪律要求任何拟合都只在明确区间内陈述,并把远距离预测标为假设而非事实。

2027-03-05residualanalysis、uncertainty、extrabudgetpoint与边界陈述

内容类型:预习教材(不代表已完成)
日期:2027-03-05
阶段:P3 · AGI Foundations 90
总路线:Day 192 / 360
周次 / 节奏:W2 · 周五知识整合
状态:教材已备;学习未完成
主题:residual analysis、uncertainty、extra budget point 与边界陈述

一句话定义

残差分析用预测与实际观测之间的结构化偏差检查 scaling 模型是否遗漏机制,而外推纪律要求任何拟合都只在明确区间内陈述,并把远距离预测标为假设而非事实。

学习目标

  1. 能计算并解释 residual、相对误差与 held-out budget prediction。
  2. 能识别残差随规模、预算或数据配比呈现的系统模式。
  3. 能区分拟合参数不确定性、运行随机性与模型形式不确定性。
  4. 能为 scaling 结果写一段包括范围、残差、异常点和外推禁区的诚实摘要。

核心知识

拟合线漂亮不等于模型正确。残差 r_i=y_i-ŷ_i 若随机围绕零分布,至少没有明显系统模式;若小规模均为正、大规模均为负,斜率或不可约项可能错误;若残差随数据配比变化,单变量 scaling 遗漏了 N/D;若某一规模方差特别大,优化稳定性或 seed 敏感性需要单独解释。

误差来源有三层。Aleatoric 或运行差异来自 seed、样本与优化随机性;parameter uncertainty 来自有限预算点导致指数估计不稳;model-form uncertainty 来自幂律本身可能不适用或需要分段。只给参数置信区间通常没有覆盖第三层。

额外预算点应在拟合前保留为 held-out,而不是看完后再选择。它可以位于区间内部检验插值,也可以略超出上界检验短程外推。若预测失败,价值在于暴露模型边界,不应通过删除点恢复漂亮曲线。

机制与推导

对观测 y_i 和预测 ŷ_i,残差为 r_i=y_i-ŷ_i,相对残差可写 r_i/|y_i|。均方误差会放大异常点,绝对误差更稳健;两者都不能替代残差图。若在 log 空间拟合,应明确 residual 是在 log loss 还是原始 loss 中计算,因为两者权重不同。

可以做 leave-one-out 思考:每次去掉一个预算点拟合,再预测该点。若指数 α 随去掉某一点大幅改变,结论被单点支配。Bootstrap 可重采样 seed 或任务实例得到参数分布,但若只有三个规模,数字区间仍可能过于乐观。

外推误差会随距离放大。幂律 ŷ=A x^{-α} 中,指数误差 δα 导致相对预测误差约随 log x 增大;当外推跨多个数量级,微小斜率差会变得巨大。架构、数据质量和训练方式在远距离通常也不保持不变,因此统计外推之外还有机制断裂。

最小练习或观察步骤

  1. 为四个假想预算点拟合一条 log–log 直线,手算或用表格得到 ŷr
  2. 按规模画残差符号,判断是否存在系统弯曲或单点支配。
  3. 留出第五个预算点,先写预测区间和失败判据,再决定是否观察它。
  4. 分别删除最小点和最大点,观察斜率方向是否明显改变。
  5. 写一段五句摘要:配置、区间、趋势、异常/不确定性、不可外推对象。

常见误区与边界

  • 用训练数据上的 代替 held-out 预测能力。
  • 拟合后才挑一个“验证点”,或删除不符合预期的异常点。
  • 在 log 空间拟合,却在原空间用未说明权重评价。
  • 把 seed 区间当成模型形式不确定性的完整覆盖。
  • 用三个微型规模估计高精度指数并远距外推。
  • 将 loss 外推进一步转成能力、经济影响或 AGI 日期,连续跨越未验证映射。

研究/系统场景连接

金融时间序列模型的历史拟合常被制度变化打断。即使过去多个季度呈稳定趋势,利率、欺诈策略或客户渠道变化都会改变数据生成机制。Scaling 外推的“配置不变”假设在这里特别脆弱。更诚实的做法是使用短程预测、漂移指示和场景区间,而不是一条远期确定曲线。

Agent 评测也可能随着工具库、提示框架和 verifier 版本发生机制变化。把不同系统版本的点连成 scaling 线会混淆规模与工程改进。应保存系统配置,必要时分段拟合。残差并非只用于统计,它还可指向工具错误、数据覆盖或评测饱和等系统原因。

自检问题

  1. 残差随机围绕零能证明什么,又不能证明什么?
  2. 为什么 leave-one-out 能发现单点支配?
  3. Seed 区间为何没有覆盖模型形式不确定性?
  4. 指数小误差为何在远距离外推中被放大?
  5. 你的 scaling 摘要中必须出现哪条外推禁区?

专业课程对齐

深入学习提示

若准备实际拟合,先预留一个点再打开拟合工具,避免无意识地用全部数据调模型。观察残差后先提出机制解释,再考虑增加函数复杂度;分段曲线虽更贴合,也更容易过拟合。外推段用虚线、标假设并写触发失效的条件,是比给出“精确预测”更成熟的表达。

学后填写区

  • 我的观测与保留区间:
  • 最显著的残差模式:
  • 斜率对单点的敏感性:
  • 五句范围摘要:
  • 明确禁止的外推:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本