返回 G01~G90 教材库
G10 · 总 Day 190教材已备 ≠ 学习已完成

G10:Compute-Optimal 预算网格与公平基线

Compute-optimal 实验在相近训练预算下改变模型容量与数据量的分配,寻找哪个组合更有效,同时把“容量不足”和“数据或训练不足”两类失败分开。

2027-03-03固定compute、模型/数据配比、2~3个预算组合与训练充分性

内容类型:预习教材(不代表已完成)
日期:2027-03-03
阶段:P3 · AGI Foundations 90
总路线:Day 190 / 360
周次 / 节奏:W2 · 周三引导实验
状态:教材已备;学习未完成
主题:固定 compute、模型/数据配比、2~3 个预算组合与训练充分性

一句话定义

Compute-optimal 实验在相近训练预算下改变模型容量与数据量的分配,寻找哪个组合更有效,同时把“容量不足”和“数据或训练不足”两类失败分开。

学习目标

  1. 能建立一个小型 N×D 预算网格,并解释为何不是所有格子都具有相同 compute。
  2. 能在相近预算下比较小模型多数据与大模型少数据,而不是只按参数排名。
  3. 能用训练/验证 loss、优化曲线和重复数据比例识别 under-training。
  4. 能将训练最优、推理成本和业务约束分开,不把一个目标函数的最优当成全局最优。

核心知识

固定 compute 的实验要求先定义预算代理。对相同架构族,可用 C_est≈kND;若序列长度、稀疏激活或实现改变,系数会变化。预算网格不必大:例如三个近似等 compute 组合 (N,D)=(1,16),(2,8),(4,4),再加一个更高预算点观察趋势。数字是相对单位,不代表真实参数十亿或 token 数。

“数据量”应指有效训练 token,而非文件大小。重复同一小数据集十轮与看十倍独立样本不同。需记录 unique examples、epochs、重复率与生成器覆盖。大模型少数据可能快速压低训练 loss,却在验证集过拟合;小模型多数据可能容量受限,训练和验证 loss 都停在较高水平。

训练充分性也依赖优化设置。若所有规模使用同一绝对学习率和步数,大模型可能尚未收敛。公平并不总是配置完全相同,而是为每个规模使用预先规定、等强度的调参规则。若只给某一方法更多试验次数,比较会偏斜。

机制与推导

在近似约束 C=kND 下,对每个预算 C_j 选择若干配比。定义验证损失 L_val(N,D,C),同预算最优点为:

[ (N_j^,D_j^)=\arg\min_{(N,D):kND\approx C_j} L_{val}(N,D) ]

但观测含随机性与优化误差。若只跑一个 seed,最小值可能是幸运点。轻量做法是先用一 seed 探索,再对关键对照保留相同的第二 seed;若资源不足,就报告不确定,不必新增 Gate。

识别两种极端:容量受限时,增加数据几乎不再降低 loss,训练与验证都较高;数据受限或过拟合时,训练 loss 继续下降而验证 loss 恶化。Under-training 则可能表现为训练 loss 仍快速下降、梯度稳定但预算终止。它与模型能力不足不是同一结论。

加入推理成本后,可构造多目标:J=L_val + λ·train_cost + μ·inference_costλ/μ 是情景选择,不存在跨任务的唯一值。研究论文若只优化训练 loss,不应被误读为生产系统总成本答案。

最小练习或观察步骤

  1. 使用 G09 的任务,选择三个近似等 compute 的相对配比,写出 N/D/steps/unique tokens/epochs
  2. 为所有配置规定同一数据生成分布、验证集、metric 和 checkpoint 选择规则。
  3. 预画四类曲线:容量受限、过拟合、under-training、正常收敛,并写出判断依据。
  4. 若实际运行,只先跑 2~3 个组合;保存失败和中断原因,不要求补齐大网格。
  5. 增加一个推理成本字段,比较 loss 最低点是否仍是系统偏好点。

常见误区与边界

  • 声称固定 compute,却只固定训练步数而 batch token 与参数量不同。
  • 把 epochs 当作数据规模,忽略样本重复和覆盖。
  • 所有模型盲用同一学习率,随后把优化失败解释成 scaling 失败。
  • 对最优点精细调参,对 baseline 只跑默认配置。
  • 只看最终 loss,不看训练曲线判断是否预算终止过早。
  • 将本地相对 compute 的最优配比直接套用到大模型训练。

研究/系统场景连接

金融零售数据常受时间窗口和标签成熟期限制。把同一历史数据重复训练更久,不能替代跨周期、跨客群的新信息。大模型可能记忆商户或模板,在随机验证集上看似占优;时间切分更能揭示数据不足。实际系统还要考虑在线吞吐和审计复杂度,因此训练 loss 的最优点可能不是部署选择。

Agent 研究可将 test-time search 视为另一种预算分配:参数较小但搜索更深,或参数较大但直接生成。W3 会把训练 compute 与 test-time compute 放在不同坐标中。当前只建立实验习惯:预算必须可比较,最优只对明确目标成立。

自检问题

  1. 为什么固定步数不等于固定 compute?
  2. 数据重复与独立 token 增长对 scaling 有何不同?
  3. 如何从曲线区分容量受限、过拟合与 under-training?
  4. 公平比较为什么不一定要求所有超参数完全相同?
  5. 训练 loss 最优点为何可能不是系统成本最优点?

专业课程对齐

深入学习提示

若只有有限时间,宁可做三个解释清楚的配比,也不要扩展成无法检查的网格。为每个点写一句失败诊断,再看是否需要额外预算。可进一步阅读 isoFLOP profile 或研究推理成本,但不要把某篇论文的指数当成永久常数。模型架构、数据质量和优化方法改变后,最优配比也会改变。

学后填写区

  • 我的等预算配比:
  • 数据独立性与重复率:
  • 训练充分性的观察信号:
  • 推理成本字段:
  • 仍不能外推的范围:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本