M26:第一阶段全景——从梯度到 Transformer
第一阶段把四条基础链合并为一条:数据被表示为张量和 token,模型产生分数或表示,损失定义学习方向,梯度与优化更新参数,Transformer 则提供可扩展的序列计算结构。
内容类型:预习教材(不代表已完成)
日期:2026-09-18
阶段:P1 · AI Model Engineering 90
周次:W4 · Transformer 第一性原理
节奏:周五一页小结 / 阶段复盘
状态:教材已备;学习未完成
标签:阶段复盘、梯度、概率、表示、Transformer、全景图
一句话定义
第一阶段把四条基础链合并为一条:数据被表示为张量和 token,模型产生分数或表示,损失定义学习方向,梯度与优化更新参数,Transformer 则提供可扩展的序列计算结构。
学习目标
- 连接 W1 梯度、W2 概率、W3 表示与 W4 Transformer。
- 区分训练目标、模型分数、向量相似与最终决策。
- 用一张全景图标出信息流、梯度流和决策流。
- 生成低压力复习清单,不评分、不补造结果。
核心知识
信息流从原始数据开始。数值特征直接形成张量;文本先规范化和 tokenization,再查 embedding 得到向量序列。Transformer 通过 Q/K/V attention 跨位置聚合信息,通过 FFN 做逐位置非线性变换,最终产生分类 logit、token logit 或任务表示。
目标流从标签或 next-token 目标进入损失函数。BCE、cross-entropy 或其他目标把模型输出与期望行为压成标量。损失不是业务价值的完整替代,只是可优化代理。W2 的阈值、成本与拒答位于模型输出之后,负责把 score 变成行动。
梯度流与信息流方向相反:从 loss 经输出层、Transformer、embedding 回到参数。链式法则组合局部导数,autograd 组织计算,optimizer 根据梯度与内部状态更新。residual、normalization、scale 等结构改变梯度和激活传播条件。
表示流说明模型看到的不是原始事实本身,而是 token 和向量。语义相似可帮助候选检索,但身份、事实与权限需要独立验证。概率层同样有边界:logit 经 sigmoid/softmax 形成分数,仍需校准和人群适配后才可作频率解释。
机制与全景图
建议画三种颜色的箭头:
- 蓝色信息流:raw data → tensor/token → embedding → Transformer/MLP → score。
- 红色学习流:label/objective → loss → gradient → optimizer → parameters。
- 绿色决策流:score → calibration → threshold/abstention → action → outcome。
在节点旁标注四类边界:数据时点与标签是否正确;token/embedding 是否保存关键事实;计算图与 shape 是否正确;分数到行动是否考虑基准率和成本。这样一张图能防止把所有问题都归因于“模型能力”。
第一阶段的核心不是独立记住四周术语,而是能追踪一个错误如何传播:字段规范化错误可能改变 token,表示变化改变 attention,输出 score 偏移,经旧校准和阈值后增加误拦截。每层都需要与其职责匹配的检查。
最小复盘步骤
- 先凭记忆画三色全景图,再回看 W1~W4 小结补缺。
- 选择一个合成 AML 文本分类例,把样本沿全链走一遍。
- 为每周写一个“我已能解释”和一个“仍需复习”,未实际学习则如实留空。
- 选一个跨周联系,例如 token 长度如何影响 attention 计算。
- 把不清楚内容加入 reflections 复习清单,不做分数或 Gate。
常见误区
- 用更多术语填满全景图,却没有箭头和因果关系。
- 把 softmax 输出自动当作已校准概率。
- 把 attention 权重、embedding 相似和业务重要性混为一谈。
- 阶段复盘变成补完所有实验,造成额外压力。
- 为了显示进度而填写未运行指标或学习心得。
金融、Web3 与文档场景连接
对一份支付争议文档,tokenizer 决定字段和叙述如何切分,Transformer 产生表示,分类头给出案件类型分数,校准层解释风险,策略层决定自动分流或人工复核。地址、金额与权限仍需结构化验证。这一完整链比“用大模型分类”更接近可审计系统思维。
自检问题
- 信息流、学习流和决策流分别从哪里到哪里?
- 哪些问题 optimizer 无法解决?
- token 长度怎样连接 W3 与 W4?
- 为什么阶段复盘不需要评分或强制补实验?
专业课程对齐
- MIT 6.S191:对应梯度、神经网络与训练闭环,复核 W1 的参数更新主线。
- Stanford CS229 Materials:对应概率分类、损失、优化与泛化,复核 W2 的分数—概率—决策边界。
- Stanford CS224N:对应表示、attention 与 Transformer,复核 W3~W4 的 text—token—vector—context 路径。
深入学习提示
不要顺序重看所有课程;先凭记忆画三条流:信息流 text→token→hidden→logits、梯度流 loss→parameters、决策流 score→calibration→threshold→action,再用 6.S191、CS229、CS224N 分别查漏。公式最少保留链式法则、二元交叉熵、embedding lookup 和 scaled attention 四个锚点,并说明每个公式的输入输出。反例复盘要跨层:token 截断造成的信息丢失不能靠校准修复,梯度正确不保证阈值成本合理,attention 权重也不自动等于因果解释。阅读优先级由图上的断点决定;若某一箭头无法口述,就只精读对应课程片段。产出是低压力知识地图和问题清单,不是考试分数,也不把教材准备视为已经掌握。
学后填写区
- 第一阶段全景图:____
- 四周最重要的三个联系:____
- 复习清单:____
- 本阶段未验证的假设:____
- 实际学习日期与用时:____