返回 M01~M90 教材库
M26 · 预习教材教材已备 ≠ 学习已完成

M26:第一阶段全景——从梯度到 Transformer

第一阶段把四条基础链合并为一条:数据被表示为张量和 token,模型产生分数或表示,损失定义学习方向,梯度与优化更新参数,Transformer 则提供可扩展的序列计算结构。

2026-09-18阶段复盘、梯度、概率、表示、Transformer、全景图

内容类型:预习教材(不代表已完成)
日期:2026-09-18
阶段:P1 · AI Model Engineering 90
周次:W4 · Transformer 第一性原理
节奏:周五一页小结 / 阶段复盘
状态:教材已备;学习未完成
标签:阶段复盘、梯度、概率、表示、Transformer、全景图

一句话定义

第一阶段把四条基础链合并为一条:数据被表示为张量和 token,模型产生分数或表示,损失定义学习方向,梯度与优化更新参数,Transformer 则提供可扩展的序列计算结构。

学习目标

  1. 连接 W1 梯度、W2 概率、W3 表示与 W4 Transformer。
  2. 区分训练目标、模型分数、向量相似与最终决策。
  3. 用一张全景图标出信息流、梯度流和决策流。
  4. 生成低压力复习清单,不评分、不补造结果。

核心知识

信息流从原始数据开始。数值特征直接形成张量;文本先规范化和 tokenization,再查 embedding 得到向量序列。Transformer 通过 Q/K/V attention 跨位置聚合信息,通过 FFN 做逐位置非线性变换,最终产生分类 logit、token logit 或任务表示。

目标流从标签或 next-token 目标进入损失函数。BCE、cross-entropy 或其他目标把模型输出与期望行为压成标量。损失不是业务价值的完整替代,只是可优化代理。W2 的阈值、成本与拒答位于模型输出之后,负责把 score 变成行动。

梯度流与信息流方向相反:从 loss 经输出层、Transformer、embedding 回到参数。链式法则组合局部导数,autograd 组织计算,optimizer 根据梯度与内部状态更新。residual、normalization、scale 等结构改变梯度和激活传播条件。

表示流说明模型看到的不是原始事实本身,而是 token 和向量。语义相似可帮助候选检索,但身份、事实与权限需要独立验证。概率层同样有边界:logit 经 sigmoid/softmax 形成分数,仍需校准和人群适配后才可作频率解释。

机制与全景图

建议画三种颜色的箭头:

  1. 蓝色信息流:raw data → tensor/token → embedding → Transformer/MLP → score。
  2. 红色学习流:label/objective → loss → gradient → optimizer → parameters。
  3. 绿色决策流:score → calibration → threshold/abstention → action → outcome。

在节点旁标注四类边界:数据时点与标签是否正确;token/embedding 是否保存关键事实;计算图与 shape 是否正确;分数到行动是否考虑基准率和成本。这样一张图能防止把所有问题都归因于“模型能力”。

第一阶段的核心不是独立记住四周术语,而是能追踪一个错误如何传播:字段规范化错误可能改变 token,表示变化改变 attention,输出 score 偏移,经旧校准和阈值后增加误拦截。每层都需要与其职责匹配的检查。

最小复盘步骤

  1. 先凭记忆画三色全景图,再回看 W1~W4 小结补缺。
  2. 选择一个合成 AML 文本分类例,把样本沿全链走一遍。
  3. 为每周写一个“我已能解释”和一个“仍需复习”,未实际学习则如实留空。
  4. 选一个跨周联系,例如 token 长度如何影响 attention 计算。
  5. 把不清楚内容加入 reflections 复习清单,不做分数或 Gate。

常见误区

  • 用更多术语填满全景图,却没有箭头和因果关系。
  • 把 softmax 输出自动当作已校准概率。
  • 把 attention 权重、embedding 相似和业务重要性混为一谈。
  • 阶段复盘变成补完所有实验,造成额外压力。
  • 为了显示进度而填写未运行指标或学习心得。

金融、Web3 与文档场景连接

对一份支付争议文档,tokenizer 决定字段和叙述如何切分,Transformer 产生表示,分类头给出案件类型分数,校准层解释风险,策略层决定自动分流或人工复核。地址、金额与权限仍需结构化验证。这一完整链比“用大模型分类”更接近可审计系统思维。

自检问题

  1. 信息流、学习流和决策流分别从哪里到哪里?
  2. 哪些问题 optimizer 无法解决?
  3. token 长度怎样连接 W3 与 W4?
  4. 为什么阶段复盘不需要评分或强制补实验?

专业课程对齐

  • MIT 6.S191:对应梯度、神经网络与训练闭环,复核 W1 的参数更新主线。
  • Stanford CS229 Materials:对应概率分类、损失、优化与泛化,复核 W2 的分数—概率—决策边界。
  • Stanford CS224N:对应表示、attention 与 Transformer,复核 W3~W4 的 text—token—vector—context 路径。

深入学习提示

不要顺序重看所有课程;先凭记忆画三条流:信息流 text→token→hidden→logits、梯度流 loss→parameters、决策流 score→calibration→threshold→action,再用 6.S191、CS229、CS224N 分别查漏。公式最少保留链式法则、二元交叉熵、embedding lookup 和 scaled attention 四个锚点,并说明每个公式的输入输出。反例复盘要跨层:token 截断造成的信息丢失不能靠校准修复,梯度正确不保证阈值成本合理,attention 权重也不自动等于因果解释。阅读优先级由图上的断点决定;若某一箭头无法口述,就只精读对应课程片段。产出是低压力知识地图和问题清单,不是考试分数,也不把教材准备视为已经掌握。

学后填写区

  • 第一阶段全景图:____
  • 四周最重要的三个联系:____
  • 复习清单:____
  • 本阶段未验证的假设:____
  • 实际学习日期与用时:____
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。