M20:可选探索——词表、规范化或相似度
今天最多改变词表大小、文本规范化或相似度度量之一,观察表示链的一处局部取舍。
内容类型:预习教材(不代表已完成)
日期:2026-09-12
阶段:P1 · AI Model Engineering 90
周次:W3 · Tokenization、Embedding 与表示学习
节奏:周六可选探索 / 补课
状态:教材已备;学习未完成
标签:可选探索、Vocabulary、Normalization、Cosine、Dot Product
一句话定义
今天最多改变词表大小、文本规范化或相似度度量之一,观察表示链的一处局部取舍。
学习目标
- 用单变量方式深化 W3,而不是重做完整 tokenizer 或检索系统。
- 理解表示参数改变后必须重新确认的下游假设。
- 把观察限定为压缩、几何或边界案例中的一个问题。
- 允许完全休息或只补一处概念。
核心知识
词表大小路线关注压缩与参数:同一语料训练两个小 BPE,比较平均 token 数、领域字符串切分和新增词表规模。词表变化后 token ID 语义整体改变,不能直接把旧 embedding 矩阵当作匹配权重。
规范化路线关注信息保留:lowercase 可能改善英文词形一致性,却会改变大小写敏感标识;Unicode normalization 可合并视觉相似形式,但安全场景仍需防混淆字符;删除标点可能破坏金额小数、负号、地址或法规编号。
metric 路线关注向量几何:cosine 先除范数,dot product 保留范数信息,欧氏距离受尺度影响。若 embedding 模型训练时使用归一化 cosine,索引时改用未经归一化 dot product,近邻排序可能改变。度量必须匹配训练方式与业务含义。
机制与可选路线
- 路线 A:用两个小词表训练同一语料,只比较 token 数与切分。
- 路线 B:对金额、地址、中英文本应用两种 normalization,列出保留/损坏信息。
- 路线 C:为三个二维向量手算 cosine、dot、L2,观察排序何时不同。
- 路线 D:只补 M19 的四类关系边界,不运行代码。
本日不是为了选全局最优设置,而是训练“参数改变会触发哪些连锁影响”的思维。任何结果都只适用于所用小语料或向量例子。
最小练习或观察步骤
- 选择一条路线,明确唯一变量与两个观察量。
- 先写方向性预测,不写具体结果。
- 将时间限制在 45 分钟内。
- 运行后只保存一条观察和一个反例。
- 若疲劳,停止并把路线留给未来兴趣日。
常见误区
- 词表越大、token 越少就一定更优。
- 规范化被视为无损清洗,没有列出敏感字段。
- 任意切换相似度,却不处理向量归一化。
- 在一个例子上的近邻变化被泛化为整体效果。
- 周六探索演变成实现生产检索系统。
场景连接
金融金额中的逗号、小数点和负号,以及 Web3 地址大小写校验,都提醒我们 normalization 是业务规则的一部分。文档检索则常需在统一文本形式与保留原始证据之间同时维护两份表示。
自检问题
- 词表变化为何会使旧 embedding 不再对齐?
- 哪三类字段不适合盲目 lowercase 或去标点?
- cosine 与 dot 的排序何时可能不同?
- 今天跳过是否会阻塞 Transformer 学习?
专业课程对齐
- Stanford CS224N:按兴趣选读 word vectors、subword 或 contextual representations 中的一项,作为单变量探索的理论锚点。
- Hugging Face LLM Course:选择 tokenizer 或预训练模型使用章节,为最小可复现实验提供官方接口参照。
- Stanford CS336:可选查看 tokenizer/data 课程内容,从训练成本角度解释观察结果。
深入学习提示
只选一个问题:改变词表/规范化后 token 长度怎样变,改变 pooling 后近邻怎样变,或加入边界样本后相似度排序怎样变。先读 CS224N 对应片段,再按 Hugging Face 方式固定 tokenizer、模型、数据和随机因素,仅改变一个变量;CS336 只在需要解释成本时选读。公式可记录 fertility、余弦相似度或 top-k 排名变化中的一个,不要求多指标。反例是把 tokenizer 与 encoder 同时更换、只展示支持预期的样本、把定性近邻当成任务准确率。探索产出应含假设、控制变量、一个反例和停止条件;若无法保证公平比较,则把问题写成下周待办即可,不需要补做大实验。
学后填写区
- 选择路线(或“休息”):____
- 预期变化:____
- 一条实际观察:____
- 一个反例:____
- 实际学习日期与用时:____