返回 M01~M90 教材库
M17 · 预习教材教材已备 ≠ 学习已完成

M17:比较 Lexical、Frozen Embedding 与小 Encoder

不同表示路线保存的信息不同:词法方法强调表面重合,预训练 embedding 强调既有语义几何,小 encoder 则可针对任务学习可变表示。

2026-09-09Lexical、Embedding、Encoder、相似度、表示比较

内容类型:预习教材(不代表已完成)
日期:2026-09-09
阶段:P1 · AI Model Engineering 90
周次:W3 · Tokenization、Embedding 与表示学习
节奏:周三引导练习
状态:教材已备;学习未完成
标签:Lexical、Embedding、Encoder、相似度、表示比较

一句话定义

不同表示路线保存的信息不同:词法方法强调表面重合,预训练 embedding 强调既有语义几何,小 encoder 则可针对任务学习可变表示。

学习目标

  1. 说明三类表示的输入、学习对象与相似度来源。
  2. 在同一组短文本上公平比较至少两条可行路线。
  3. 分析同义、否定、数字和实体标识带来的差异。
  4. 不把“向量更先进”当作默认胜出理由。

核心知识

Lexical 路线包括词袋、TF-IDF、BM25 或字符 n-gram。它们依赖可见片段重合,对罕见精确词、代码、编号和专有名词很强,也容易解释;但同义改写可能得分低,长文本词频还需归一化。

Frozen embedding 使用固定预训练模型把文本编码为向量,比较通常用 cosine。它无需当前任务训练,能处理不少语义改写,但几何空间由原训练数据和目标决定,领域缩写、否定、数字差异或新实体未必可靠。

小 encoder 可在任务数据上训练,让相关文本靠近、不相关文本分开,或直接预测类别。它能适配领域,却引入标签质量、负样本构造、过拟合和维护成本。小数据时,线性 probe 或冻结大部分表示往往比端到端训练更稳,是连接固定表示与完整微调的中间路线。

机制与比较

为文本对 (q,d) 定义相关标签。Lexical 分数来自共享 token 的加权重合;embedding 分数来自向量角度;监督 encoder 的损失可使用对比学习,例如让正对的相似度高于负对。三者优化目标不同,所以“分数 0.8”不能横向直接解释。

构造四组最有诊断价值的短文本:同义改写、共享词但含义相反、只有金额数字不同、地址只差一位。预计 embedding 对同义改写更有优势,lexical/exact 对标识与数字更稳;但这只是待验证假设,不应提前写成实验结论。

最小练习

  1. 准备 8~12 对自写短文本,明确每对希望判断的是主题、事实还是实体。
  2. 选择可用的两条路线,例如字符 n-gram 与 frozen embedding。
  3. 对所有文本使用相同 normalization,另保留原始精确字段。
  4. 建立“文本对、期望关系、路线 A、路线 B、失败解释”空表。
  5. 运行后只记录实际差异;若没有可用 embedding,可完成设计而不伪造分数。

常见误区

  • 用不同文本清洗与数据集比较两种表示。
  • 把语义相关、事实一致和实体相同混成一个标签。
  • 只挑 embedding 擅长的同义例,忽略否定与精确标识。
  • 小 encoder 在同一数据上训练和评估。
  • 把可视化聚类看起来合理当作下游任务有效。

金融、Web3 与文档场景连接

政策检索适合语义与词法混合:用户可能换一种说法提问,但法规编号、账户类型和“不得”必须精确保留。Web3 地址则应 exact match;embedding 可帮助找相关说明,不能判断地址身份。

自检问题

  1. 字符 n-gram 为什么对拼写变体和编号可能有用?
  2. Frozen embedding 的分数由什么训练历史塑造?
  3. 小 encoder 相比固定 embedding 新增哪些风险?
  4. 如何设计一组能暴露否定误判的文本对?

专业课程对齐

  • Stanford CS224N:对应词向量、上下文化表示与句子建模,用来区分 lexical overlap、静态 embedding 和 encoder 表示。
  • Hugging Face LLM Course:对应使用预训练模型与 tokenizer 的章节,核对 pooling、padding 和 batch 推理的实现边界。
  • Stanford CS336:选读模型表示与训练基础,理解小 encoder 的表示来自任务数据和优化目标,而非天然更“语义化”。

深入学习提示

先精读 CS224N 的表示谱系,再用 Hugging Face Course 对照 frozen encoder 的输入输出,最后选读 CS336 解释训练目标。比较时固定文本对、相似度指标和下游判定规则:lexical 用稀疏权重,frozen embedding 用预训练空间,小 encoder 则允许任务监督改变空间。公式上观察余弦相似度对向量尺度不敏感,以及 pooling 如何从 token states 得到句向量。反例必须包含否定句、同词异义、数字变化、同实体不同写法和模板化长句;这些能揭示高相似并不等于事实一致。代码还要记录 tokenizer、最大长度、pooling 和归一化,否则结果不可复核。精读结果应形成“何时最简单路线足够”的决策表,而不是模型排行榜。

学后填写区

  • 选择的两条路线:____
  • 文本对集合:____
  • 表示差异表:____
  • 实际失败类型:____
  • 实际学习日期与用时:____
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。