M15:Tokenization、Embedding 与表示学习
文本模型先用 tokenizer 把字符串变成离散 token,再把 token 映射为可学习向量,使任务能在连续表示空间中计算相似与组合关系。
内容类型:预习教材(不代表已完成)
日期:2026-09-07
阶段:P1 · AI Model Engineering 90
周次:W3 · Tokenization、Embedding 与表示学习
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:字符、Subword、Vocabulary、Embedding、Similarity、表示偏差
一句话定义
文本模型先用 tokenizer 把字符串变成离散 token,再把 token 映射为可学习向量,使任务能在连续表示空间中计算相似与组合关系。
学习目标
- 区分字符、字节、词和 subword tokenization。
- 理解 vocabulary 大小、序列长度与 OOV 之间的取舍。
- 区分 token embedding、句向量和上下文化表示。
- 识别缩写、数字、中英混合与地址类文本的表示风险。
核心知识
词级 tokenizer 序列短、含义直观,但词表巨大且容易 OOV;字符级几乎无 OOV,却使序列很长,学习跨字符模式困难;字节级能覆盖任意输入,但人类语义边界更弱;subword 在常见片段与开放词表间折中,BPE、WordPiece、Unigram/SentencePiece 是常见路线。
vocabulary 越大,常见词可能用更少 token 表示,embedding 参数矩阵却更大,低频词条学习不足;词表小则序列增长,注意力计算和上下文占用增加。token 成本不仅受字符数影响,还受语言、空格、规范化、数字格式和领域字符串影响。
embedding 是从离散 ID 到稠密向量的查表映射。静态 embedding 给同一 token 固定向量;上下文化表示经过模型层后,会随周围文本变化。“bank”在银行与河岸语境中的内部表示可以不同。句向量通常通过 pooling 或专门训练获得,用于检索和聚类,但相似度只反映训练目标塑造的几何关系。
机制与推导
tokenizer 输出 ID 序列 [i₁,…,iₙ],embedding 矩阵 E∈R^(V×d) 选取对应行形成 X∈R^(n×d)。相似度常用 cosine:cos(a,b)=a·b/(‖a‖‖b‖),关注方向而非长度;dot product 同时受范数影响;欧氏距离关注绝对位置差。选哪个度量必须与训练目标和索引实现一致。
表示偏差来自语料分布、token 粒度和训练任务。两个句子向量接近,可能只是共享领域词,而非事实等价;地址或哈希只差一个字符,语义 embedding 可能错误地认为很近;“禁止”与“允许”共享大量词,也可能近邻。因此向量相似不能替代事实、权限或精确匹配。
最小练习
- 先预测以下类型的切分:AML/KYC 缩写、2026-09-07、中文金额、0x 地址、中英混合句。
- 用可用 tokenizer 实际查看 token 和数量,运行后再填写差异。
- 画 text → normalization → token → ID → embedding → task 的流程。
- 为 lexical match、cosine similarity、exact match 各写一个适用例。
- 构造一对“词很像但事实相反”的边界文本。
常见误区
- token 等同于单词;它可能是字节、字符或词片段。
- embedding 相近就断言事实相同、主体相同或权限相同。
- 只比较词表大小,不考虑平均序列长度和领域覆盖。
- 更换 tokenizer 后仍直接复用不匹配的 embedding 权重。
- 用可视化二维距离替代高维任务评估。
金融、Web3 与文档场景连接
金融文档含缩写、金额、账号掩码和多语言;Web3 含地址、交易哈希和代币符号。这些字符串既有语义部分,也有必须精确匹配的标识部分。稳妥系统常把 embedding 检索与结构化字段、正则解析和 exact match 组合,而非全部向量化。
自检问题
- 字节级 tokenization 为什么几乎没有 OOV,却可能增加序列长度?
- token embedding 与上下文化表示的差别是什么?
- cosine 与 dot product 对向量范数的敏感度有何不同?
- 哪些字段不应只依赖语义相似度匹配?
专业课程对齐
- Stanford CS224N:对应 word vectors、词表示与神经语言模型,重点区分静态词向量和上下文化表示。
- Hugging Face LLM Course:对应 tokenizer pipeline 与 subword tokenization,观察文本如何变为 token IDs、attention mask 和模型输入。
- Stanford CS336:对应语言模型基础与 tokenizer/data 课程内容,从训练系统视角理解词表和序列长度成本。
深入学习提示
先精读 CS224N 的词向量与表示基础,再学习 Hugging Face Course 的 tokenizer 章节,最后选读 CS336 的 tokenizer/data 部分。必须画出 text → normalization → tokens → IDs → embedding lookup → contextual states,并标注每步是否可训练。公式观察 embedding 矩阵 E∈R^{|V|×d} 的参数量如何随词表增大,以及序列长度如何影响后续 attention 成本。代码/反例用同一组中文、英文、缩写、数字、地址和 emoji 查看切分;比较 [UNK]、过度碎片化、大小写归一化丢失实体信息。不要用余弦相似就断言“理解语义”,也不要把 tokenizer 的可逆解码等同于表示无信息损失。
学后填写区
- 切分预测与实际差异:____
- 表示学习概念图:____
- 一个近义误命中例:____
- 仍不清楚的概念:____
- 实际学习日期与用时:____