返回 M01~M90 教材库
M27 · 预习教材教材已备 ≠ 学习已完成

M27:可选探索——Head、位置或 Context

今天最多探索 head 数、位置表示或 context 长度之一,也可只补 W1~W4 中最模糊的一处。

2026-09-19可选探索、Multi-head、位置编码、Context、补课

内容类型:预习教材(不代表已完成)
日期:2026-09-19
阶段:P1 · AI Model Engineering 90
周次:W4 · Transformer 第一性原理
节奏:周六可选探索 / 补课
状态:教材已备;学习未完成
标签:可选探索、Multi-head、位置编码、Context、补课

一句话定义

今天最多探索 head 数、位置表示或 context 长度之一,也可只补 W1~W4 中最模糊的一处。

学习目标

  1. 通过一个局部旋钮深化 Transformer 结构理解。
  2. 区分固定总维度与增加总容量两种 head 比较。
  3. 理解位置和 context 是信息条件,不只是配置数字。
  4. 保持周六可选、低压力、可停止。

核心知识

head 路线必须说明总 d_model 是否固定。固定 d_model 时,head 数增加意味着每头 d_head 减小,参数量可能近似不变;若每头维度固定,总维度随 head 增加,则容量和计算同时增加,无法只归因于“更多视角”。多头也不保证自动分工,需要任务与训练塑造。

位置路线可比较没有位置编码与加入简单绝对位置向量。没有位置信号的自注意力对 token 置换具有相应置换性质,难区分“客户转账给商户”和“商户转账给客户”的顺序。现代 RoPE 等方法进一步把相对位置信息融入 Q/K,但本日只需理解“顺序信息从哪里进入”。

context 路线关注序列长度带来的信息与成本。标准 attention 的 score 矩阵是 T×T,时间和显存对 T 近似二次增长;更长 context 也会稀释相关信息、增加截断和位置泛化问题。窗口更长不等于模型必然会用到远处证据。

机制与可选路线

  • 路线 A:固定 d_model,比较 1 head 与 2 heads 的 shape 和参数组织。
  • 路线 B:对同一 token 集改变顺序,比较有/无位置表示的输出性质。
  • 路线 C:手算 T 从 128 增到 256 时 attention score 元素数量变化。
  • 路线 D:完全不扩展,只补第一阶段全景图中的一个箭头。

预习只建立问题和方法,实际观察必须运行后再填。若所选路线需要大量重构,就缩回手算或图解。

最小练习或观察步骤

  1. 最多选一条路线,设 45 分钟上限。
  2. 写出固定条件、唯一变量和一个结构不变量。
  3. 先预测变化会发生在哪个张量或信息边界。
  4. 只保存一条观察或一张小图。
  5. 若 W1~W4 有欠缺,优先补概念,不补全部实验。

常见误区

  • head 数变化时总维度也变化,却仍称单变量比较。
  • 没有位置编码就认为模型完全看不到 token;它看到内容但缺顺序依据。
  • context 翻倍只增加两倍 attention 成本。
  • 长 context 被当作可靠长程推理能力。
  • 可选日开始实现完整 Transformer 训练框架。

场景连接

长金融合同需要更长 context,但关键条款可能跨章节,单纯扩窗不保证正确关联。文档分段、结构位置、检索和证据引用仍是后续系统工程问题。

自检问题

  1. 固定 d_model 时增加 heads 会怎样改变每头维度?
  2. 没有位置编码时模型缺少什么信息?
  3. T 翻倍时 T² score 矩阵增大多少?
  4. 今天完全休息是否影响阶段复盘?

专业课程对齐

  • Stanford CS224N:按所选变量回看 multi-head attention、位置表示或上下文建模相关章节,作为机制基线。
  • Stanford CS336:对应 Transformer 实现和语言模型训练,用于检查 head dimension、context length 与计算量的约束。
  • Hugging Face LLM Course:可选查看模型配置与 tokenizer/model pipeline,了解真实接口如何暴露这些参数。

深入学习提示

只选择 head、position 或 context 中一个旋钮。先精读 CS224N 对应机制,再用 CS336 约束公平比较;Hugging Face 仅在需要映射配置时选读。比较 head 数时区分固定总维度与扩大总容量,并记录每头 d_k=d_model/H;研究 position 时构造 token 相同但顺序不同的反例;研究 context 时固定样本,观察截断、可见范围和 attention 矩阵的二次成本。代码观察点只需 shape、参数量、一次前向输出或结构不变量,不强求训练曲线。反例是同时改变 head 数与 d_model 后宣称多头有效,或把更长 context 等同于模型必然使用远距离信息。写下假设、控制变量和停止条件后,任何结果都可结束。

学后填写区

  • 选择路线(或“休息”):____
  • 固定条件与预测:____
  • 一条实际观察:____
  • 仍需复习的箭头:____
  • 实际学习日期与用时:____
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。