返回 M01~M90 教材库
M86 · 预习教材教材已备 ≠ 学习已完成

M86:W1~W4 阅读回访与最小实现重访

阅读回访不是重新通读 W1~W4,而是选择一个仍有兴趣或仍模糊的主题,用旧问题、当前理解和一个最小例子检验知识是否已经形成连接。

2026-11-17revisitautogradcalibrationtokenizationtransformer

内容类型:预习教材(不代表已完成)
日期:2026-11-17
阶段:P1 · AI Model Engineering 90 · 知识整合
周次:整合周(M85~M90)
节奏:周二阅读回访
状态:教材已备;学习未完成
标签revisit autograd calibration tokenization transformer

一句话定义

阅读回访不是重新通读 W1~W4,而是选择一个仍有兴趣或仍模糊的主题,用旧问题、当前理解和一个最小例子检验知识是否已经形成连接。

学习目标

  1. 只从梯度、概率校准、表示学习、Transformer 中选一个主题。
  2. 用“第一次理解—现在理解—仍不确定”结构重读。
  3. 选择短阅读或最小实现重跑之一,不制造补课洪水。
  4. 留下真实阅读/运行记录,未执行不填结果。

核心知识

四个可选主题的核心问题

W1 梯度与 autograd:局部导数如何沿计算图组合?zero-grad、学习率与数值稳定怎样在曲线上显现?适合重跑一个标量反向传播或有限差分检查。

W2 概率、校准与决策损失:模型 score、概率和业务动作为何不同?基准率、阈值、Brier/ECE 与错误成本如何连接?适合手算一个混淆矩阵或 reliability 小例。

W3 tokenization 与表示:文本如何变 token/vector,词法相似、语义相似和事实/权限相同为何不同?适合对中英混合、数字、地址/哈希重新分词或比较两种表示。

W4 Transformer:Q/K/V、scale、mask、multi-head、residual、normalization、FFN 各自解决什么?适合重算两个 token attention 或重新追踪 shape。

主动回访的三层

第一层是回忆:不看资料先写自己能解释的因果链。第二层是对照:打开原笔记,找出遗漏和错误,而不是抄录。第三层是验证:用一个手算、代码或反例检验修正后的理解。只读容易产生熟悉感,无法暴露是否能独立解释。

保留历史痕迹

不要覆盖旧笔记中的原始疑问。可在新记录中引用旧理解,再写“现在修正为……,依据是……”。知识变化本身是有价值的学习证据。若重跑代码,记录环境、命令和实际输出;依赖变化导致失败也可如实记录。

机制与推导

选择主题可用两轴:兴趣强度与基础连接度。优先选择既感兴趣、又影响后续多个主题的一个。不要按“最薄弱必须补齐”制造压力。回访结束标准不是全懂,而是能新增一个正确连接、修正一个误区、留下一个可回答问题。

例如选择 Transformer,可从 token→embedding→Q/K/V→attention→residual→FFN→logits 口述,再手算 shape;选择校准,可从 score 分布到阈值和人工容量画图。每条路线都应控制在一份短记录。

最小练习或观察步骤

  1. 四选一并写选择原因。
  2. 不看资料写 5 分钟自由回忆,标注确信/不确信。
  3. 重读一份指定笔记的相关小节,最多 30 分钟。
  4. 选择一个手算或最小实现;也可仅做概念反例。
  5. 写三栏:原理解、修正、仍待验证。
  6. 若运行,记录真实结果;若未运行,明确注明。

常见误区

  • 四个主题全部回访。
  • 重新复制原笔记,未检验自己的理解。
  • 以代码成功运行代替机制解释。
  • 环境变化后为了修依赖无限扩展时间。
  • 删除旧误解,失去认知变化记录。
  • 把仍不确定的问题视为阶段失败。

金融、Web3 与文档场景连接

选择校准可连接风险分数与复核阈值;选择 tokenization 可观察金额、缩写和钱包地址的边界;选择 Transformer 可理解文档/交易序列中的上下文交互;选择梯度可连接领域适配和训练曲线。场景连接只用于理解,不需要扩展成应用。

自检问题

  1. 我选择哪个主题,为什么它值得回访?
  2. 原理解中哪一处被修正,依据是什么?
  3. 最小例子验证了机制的哪一部分?
  4. 哪个问题仍不确定,但不阻碍继续?
  5. 我是否在预定边界内停止?

专业课程对齐

  • Stanford CS336:对应从 tokenizer、Transformer、训练循环到 scaling/推理的实现型课程;用于回访 W1~W4 中张量、反向传播、语言建模和训练基础。
  • Stanford CS229:对应梯度优化、概率建模、正则化和泛化;用于补清公式为何成立及其假设,而不是只记 PyTorch 调用。
  • ARENA 主课程:对应深度学习与 Transformer 的练习式实现路线;适合把某个早期概念重新连接到最小代码与张量形状。

深入学习提示

先从自己的 W1~W4 笔记挑一个真实薄弱点,而不是同时回看四周。若问题是 tokenizer/Transformer/训练循环,精读 CS336 对应模块;若问题是损失、梯度、正则化或泛化,先读 CS229;若需要通过代码恢复直觉,再选读 ARENA 的对应练习。采用三层回访:第一层不看答案画出输入输出与公式,第二层打开旧实现逐行标张量 shape、参数与梯度路径,第三层才查课程材料修正。可重做一个最小例子,如手算 softmax cross-entropy、验证 autograd 梯度或跟踪一个 attention head,但不要求新增大型实验。保留原笔记并追加“当时理解 / 现在修正 / 仍待确认”,以知识重连为目标,也不能把浏览过目录记成掌握。

最后把修正点链接回 M85 全景图的对应节点,并注明它改变了哪一条旧理解或模型选择依据。

学后填写区

  • 选择主题与原因:
  • 原理解 / 修正 / 依据:
  • 阅读或运行记录(未执行请注明):
  • 新增的一条连接:
  • 仍待验证的问题:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。