G10:Compute-Optimal 预算网格与公平基线
Compute-optimal 实验在相近训练预算下改变模型容量与数据量的分配,寻找哪个组合更有效,同时把“容量不足”和“数据或训练不足”两类失败分开。
内容类型:预习教材(不代表已完成)
日期:2027-03-03
阶段:P3 · AGI Foundations 90
总路线:Day 190 / 360
周次 / 节奏:W2 · 周三引导实验
状态:教材已备;学习未完成
主题:固定 compute、模型/数据配比、2~3 个预算组合与训练充分性
一句话定义
Compute-optimal 实验在相近训练预算下改变模型容量与数据量的分配,寻找哪个组合更有效,同时把“容量不足”和“数据或训练不足”两类失败分开。
学习目标
- 能建立一个小型
N×D预算网格,并解释为何不是所有格子都具有相同 compute。 - 能在相近预算下比较小模型多数据与大模型少数据,而不是只按参数排名。
- 能用训练/验证 loss、优化曲线和重复数据比例识别 under-training。
- 能将训练最优、推理成本和业务约束分开,不把一个目标函数的最优当成全局最优。
核心知识
固定 compute 的实验要求先定义预算代理。对相同架构族,可用 C_est≈kND;若序列长度、稀疏激活或实现改变,系数会变化。预算网格不必大:例如三个近似等 compute 组合 (N,D)=(1,16),(2,8),(4,4),再加一个更高预算点观察趋势。数字是相对单位,不代表真实参数十亿或 token 数。
“数据量”应指有效训练 token,而非文件大小。重复同一小数据集十轮与看十倍独立样本不同。需记录 unique examples、epochs、重复率与生成器覆盖。大模型少数据可能快速压低训练 loss,却在验证集过拟合;小模型多数据可能容量受限,训练和验证 loss 都停在较高水平。
训练充分性也依赖优化设置。若所有规模使用同一绝对学习率和步数,大模型可能尚未收敛。公平并不总是配置完全相同,而是为每个规模使用预先规定、等强度的调参规则。若只给某一方法更多试验次数,比较会偏斜。
机制与推导
在近似约束 C=kND 下,对每个预算 C_j 选择若干配比。定义验证损失 L_val(N,D,C),同预算最优点为:
[ (N_j^,D_j^)=\arg\min_{(N,D):kND\approx C_j} L_{val}(N,D) ]
但观测含随机性与优化误差。若只跑一个 seed,最小值可能是幸运点。轻量做法是先用一 seed 探索,再对关键对照保留相同的第二 seed;若资源不足,就报告不确定,不必新增 Gate。
识别两种极端:容量受限时,增加数据几乎不再降低 loss,训练与验证都较高;数据受限或过拟合时,训练 loss 继续下降而验证 loss 恶化。Under-training 则可能表现为训练 loss 仍快速下降、梯度稳定但预算终止。它与模型能力不足不是同一结论。
加入推理成本后,可构造多目标:J=L_val + λ·train_cost + μ·inference_cost。λ/μ 是情景选择,不存在跨任务的唯一值。研究论文若只优化训练 loss,不应被误读为生产系统总成本答案。
最小练习或观察步骤
- 使用 G09 的任务,选择三个近似等 compute 的相对配比,写出
N/D/steps/unique tokens/epochs。 - 为所有配置规定同一数据生成分布、验证集、metric 和 checkpoint 选择规则。
- 预画四类曲线:容量受限、过拟合、under-training、正常收敛,并写出判断依据。
- 若实际运行,只先跑 2~3 个组合;保存失败和中断原因,不要求补齐大网格。
- 增加一个推理成本字段,比较 loss 最低点是否仍是系统偏好点。
常见误区与边界
- 声称固定 compute,却只固定训练步数而 batch token 与参数量不同。
- 把 epochs 当作数据规模,忽略样本重复和覆盖。
- 所有模型盲用同一学习率,随后把优化失败解释成 scaling 失败。
- 对最优点精细调参,对 baseline 只跑默认配置。
- 只看最终 loss,不看训练曲线判断是否预算终止过早。
- 将本地相对 compute 的最优配比直接套用到大模型训练。
研究/系统场景连接
金融零售数据常受时间窗口和标签成熟期限制。把同一历史数据重复训练更久,不能替代跨周期、跨客群的新信息。大模型可能记忆商户或模板,在随机验证集上看似占优;时间切分更能揭示数据不足。实际系统还要考虑在线吞吐和审计复杂度,因此训练 loss 的最优点可能不是部署选择。
Agent 研究可将 test-time search 视为另一种预算分配:参数较小但搜索更深,或参数较大但直接生成。W3 会把训练 compute 与 test-time compute 放在不同坐标中。当前只建立实验习惯:预算必须可比较,最优只对明确目标成立。
自检问题
- 为什么固定步数不等于固定 compute?
- 数据重复与独立 token 增长对 scaling 有何不同?
- 如何从曲线区分容量受限、过拟合与 under-training?
- 公平比较为什么不一定要求所有超参数完全相同?
- 训练 loss 最优点为何可能不是系统成本最优点?
专业课程对齐
- 阅读 Training Compute-Optimal Large Language Models,重点理解固定计算预算下参数与 token 的联合选择。
- 阅读 Scaling Laws for Neural Language Models,比较不同资源轴的拟合对象与实验控制。
- 参考 Stanford CS336 的训练与系统部分,补充 batch、optimizer、memory 和吞吐怎样影响实际预算。
深入学习提示
若只有有限时间,宁可做三个解释清楚的配比,也不要扩展成无法检查的网格。为每个点写一句失败诊断,再看是否需要额外预算。可进一步阅读 isoFLOP profile 或研究推理成本,但不要把某篇论文的指数当成永久常数。模型架构、数据质量和优化方法改变后,最优配比也会改变。
学后填写区
- 我的等预算配比:
- 数据独立性与重复率:
- 训练充分性的观察信号:
- 推理成本字段:
- 仍不能外推的范围: