返回 M01~M90 教材库
M15 · 预习教材教材已备 ≠ 学习已完成

M15:Tokenization、Embedding 与表示学习

文本模型先用 tokenizer 把字符串变成离散 token,再把 token 映射为可学习向量,使任务能在连续表示空间中计算相似与组合关系。

2026-09-07字符、Subword、Vocabulary、Embedding、Similarity、表示偏差

内容类型:预习教材(不代表已完成)
日期:2026-09-07
阶段:P1 · AI Model Engineering 90
周次:W3 · Tokenization、Embedding 与表示学习
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:字符、Subword、Vocabulary、Embedding、Similarity、表示偏差

一句话定义

文本模型先用 tokenizer 把字符串变成离散 token,再把 token 映射为可学习向量,使任务能在连续表示空间中计算相似与组合关系。

学习目标

  1. 区分字符、字节、词和 subword tokenization。
  2. 理解 vocabulary 大小、序列长度与 OOV 之间的取舍。
  3. 区分 token embedding、句向量和上下文化表示。
  4. 识别缩写、数字、中英混合与地址类文本的表示风险。

核心知识

词级 tokenizer 序列短、含义直观,但词表巨大且容易 OOV;字符级几乎无 OOV,却使序列很长,学习跨字符模式困难;字节级能覆盖任意输入,但人类语义边界更弱;subword 在常见片段与开放词表间折中,BPE、WordPiece、Unigram/SentencePiece 是常见路线。

vocabulary 越大,常见词可能用更少 token 表示,embedding 参数矩阵却更大,低频词条学习不足;词表小则序列增长,注意力计算和上下文占用增加。token 成本不仅受字符数影响,还受语言、空格、规范化、数字格式和领域字符串影响。

embedding 是从离散 ID 到稠密向量的查表映射。静态 embedding 给同一 token 固定向量;上下文化表示经过模型层后,会随周围文本变化。“bank”在银行与河岸语境中的内部表示可以不同。句向量通常通过 pooling 或专门训练获得,用于检索和聚类,但相似度只反映训练目标塑造的几何关系。

机制与推导

tokenizer 输出 ID 序列 [i₁,…,iₙ],embedding 矩阵 E∈R^(V×d) 选取对应行形成 X∈R^(n×d)。相似度常用 cosine:cos(a,b)=a·b/(‖a‖‖b‖),关注方向而非长度;dot product 同时受范数影响;欧氏距离关注绝对位置差。选哪个度量必须与训练目标和索引实现一致。

表示偏差来自语料分布、token 粒度和训练任务。两个句子向量接近,可能只是共享领域词,而非事实等价;地址或哈希只差一个字符,语义 embedding 可能错误地认为很近;“禁止”与“允许”共享大量词,也可能近邻。因此向量相似不能替代事实、权限或精确匹配。

最小练习

  1. 先预测以下类型的切分:AML/KYC 缩写、2026-09-07、中文金额、0x 地址、中英混合句。
  2. 用可用 tokenizer 实际查看 token 和数量,运行后再填写差异。
  3. 画 text → normalization → token → ID → embedding → task 的流程。
  4. 为 lexical match、cosine similarity、exact match 各写一个适用例。
  5. 构造一对“词很像但事实相反”的边界文本。

常见误区

  • token 等同于单词;它可能是字节、字符或词片段。
  • embedding 相近就断言事实相同、主体相同或权限相同。
  • 只比较词表大小,不考虑平均序列长度和领域覆盖。
  • 更换 tokenizer 后仍直接复用不匹配的 embedding 权重。
  • 用可视化二维距离替代高维任务评估。

金融、Web3 与文档场景连接

金融文档含缩写、金额、账号掩码和多语言;Web3 含地址、交易哈希和代币符号。这些字符串既有语义部分,也有必须精确匹配的标识部分。稳妥系统常把 embedding 检索与结构化字段、正则解析和 exact match 组合,而非全部向量化。

自检问题

  1. 字节级 tokenization 为什么几乎没有 OOV,却可能增加序列长度?
  2. token embedding 与上下文化表示的差别是什么?
  3. cosine 与 dot product 对向量范数的敏感度有何不同?
  4. 哪些字段不应只依赖语义相似度匹配?

专业课程对齐

  • Stanford CS224N:对应 word vectors、词表示与神经语言模型,重点区分静态词向量和上下文化表示。
  • Hugging Face LLM Course:对应 tokenizer pipeline 与 subword tokenization,观察文本如何变为 token IDs、attention mask 和模型输入。
  • Stanford CS336:对应语言模型基础与 tokenizer/data 课程内容,从训练系统视角理解词表和序列长度成本。

深入学习提示

先精读 CS224N 的词向量与表示基础,再学习 Hugging Face Course 的 tokenizer 章节,最后选读 CS336 的 tokenizer/data 部分。必须画出 text → normalization → tokens → IDs → embedding lookup → contextual states,并标注每步是否可训练。公式观察 embedding 矩阵 E∈R^{|V|×d} 的参数量如何随词表增大,以及序列长度如何影响后续 attention 成本。代码/反例用同一组中文、英文、缩写、数字、地址和 emoji 查看切分;比较 [UNK]、过度碎片化、大小写归一化丢失实体信息。不要用余弦相似就断言“理解语义”,也不要把 tokenizer 的可逆解码等同于表示无信息损失。

学后填写区

  • 切分预测与实际差异:____
  • 表示学习概念图:____
  • 一个近义误命中例:____
  • 仍不清楚的概念:____
  • 实际学习日期与用时:____
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。