M05:把计算图、梯度与优化串成一张图
模型训练是一条由目标、计算图、梯度估计、优化规则与数值条件共同决定的反馈回路,任何一环失真都会改变最终行为。
内容类型:预习教材(不代表已完成)
日期:2026-08-28
阶段:P1 · AI Model Engineering 90
周次:W1 · 张量、梯度、autograd
节奏:周五一页小结
状态:教材已备;学习未完成
标签:计算图、梯度、优化器、学习率、数值稳定性
一句话定义
模型训练是一条由目标、计算图、梯度估计、优化规则与数值条件共同决定的反馈回路,任何一环失真都会改变最终行为。
学习目标
- 用一页图整合 W1 的五个核心对象。
- 区分梯度方向、学习率步幅和优化器状态。
- 理解数值稳定性为何属于训练机制而非附加优化。
- 找出本周尚未形成可解释链条的一处知识缺口。
核心知识
计算图回答“损失如何依赖参数”;梯度回答“在当前点微小改变参数,损失如何变化”;优化器回答“根据当前和历史梯度采取怎样的有限步更新”;学习率控制更新尺度;数值稳定性决定这些计算能否在有限精度下保留有效信息。
最朴素的 SGD 使用 θₜ₊₁ = θₜ-ηgₜ。Momentum 对历史梯度做指数累积以平滑方向;Adam 类方法还按梯度二阶矩缩放不同参数的步幅。无论优化器多复杂,它都不能修复错误标签或错误目标,只是在既定损失地形上采用不同移动规则。
数值稳定性常见问题包括溢出、下溢、灾难性消减和精度不足。计算 BCE 时若先算 sigmoid 再取 log,极端 logit 可能导致 log(0);稳定实现会把公式重排成 log-sum-exp 形式。混合精度能节省内存并加速,但也使小梯度下溢风险更突出,因此可能需要 loss scaling。
机制与整合
建议把一页图分为两层。上层是因果主链:数据 x → 模型 fθ → 预测 ŷ → 损失 L(ŷ,y) → 梯度 g → 参数更新 θ′。下层为每个箭头添加约束:shape/dtype/device 约束前向;链式法则约束反向;学习率和优化器状态约束更新;浮点范围贯穿全链;数据与业务目标决定 y 和 L 是否有意义。
再加入两个反馈箭头:新参数回到下一次前向;验证数据产生独立的泛化信号。这样可以清楚看到训练 loss 只是内部优化反馈,验证和场景成本才告诉我们模型是否迁移到目标分布。
本周最难的一步不必是公式,也可能是区分几个相似概念。例如“梯度大”不等于“更新一定大”,因为优化器会归一化、裁剪或使用独立学习率;“没有梯度”可能来自 detach、非叶子张量、饱和激活或图未连接,需要证据区分。
最小整理步骤
- 不看资料,先画训练主链和两条反馈箭头。
- 给每个节点写一个可观察量,如输入范围、loss、grad norm、update norm。
- 给每个箭头写一个 W1 出现过的故障模式。
- 用 M02 的手算例子解释图中的每一段。
- 将说不清的一处加入复习清单,不要求本日全部消除。
常见误区
- 把“梯度下降”当成所有 optimizer 的完整描述,忽略状态与缩放。
- 认为学习率是独立超参数,不受 batch、归一化和参数尺度影响。
- 数值出现 NaN 后只做裁剪,不追踪第一个非有限节点。
- 一页小结复制术语定义,却没有画出术语之间的依赖关系。
- 为了显得完成而填入尚未运行的曲线或心得。
场景连接
信用或欺诈模型的损失可能对少数类加权。权重先改变样本对梯度的贡献,再通过优化器影响参数,最终改变分数分布。但阈值与业务决策不在这条训练链里自动产生,需要 W2 单独学习校准和成本。
自检问题
- 梯度、更新量和参数变化为何不是同义词?
- 验证 loss 在整张训练反馈图中处于什么位置?
- 一个数值稳定的 BCE 实现为何不应直接计算 log(sigmoid(x))?
- 如果只能保留三个训练观测量,你会选什么,为什么?
专业课程对齐
- MIT 6.S191:对应神经网络训练总览,用于把张量、损失、反传和优化器重新串成闭环。
- Stanford CS229 Materials:对应梯度下降、随机梯度下降和监督学习目标,补齐经验风险最小化视角。
- PyTorch Autograd 教程:对应计算图与梯度累积,作为本周 API 层复核材料。
深入学习提示
先用自己的图复述训练闭环,再精读 6.S191 核对遗漏;随后读 CS229 的优化公式,最后用 autograd 页确认框架行为。必须能区分 loss.backward()、optimizer.step()、optimizer.zero_grad() 的状态变化,并解释 batch 平均损失为何影响梯度尺度。公式重点比较普通梯度下降 w←w-ηg、带动量更新和自适应步长的差异,但本日不追求算法清单。反例复盘应至少包括梯度正确但学习率不合适、训练循环正确但标签错位、loss 降低但决策代价变差。若无法从观测信号定位到“数据、计算图、梯度、优化或泛化”之一,就回看对应日,而不是继续堆概念。
学后填写区
- W1 一页图位置:____
- 本周最难的一步:____
- 已能讲清的因果链:____
- 下一次复习入口:____
- 实际学习日期与用时:____