M17:比较 Lexical、Frozen Embedding 与小 Encoder
不同表示路线保存的信息不同:词法方法强调表面重合,预训练 embedding 强调既有语义几何,小 encoder 则可针对任务学习可变表示。
内容类型:预习教材(不代表已完成)
日期:2026-09-09
阶段:P1 · AI Model Engineering 90
周次:W3 · Tokenization、Embedding 与表示学习
节奏:周三引导练习
状态:教材已备;学习未完成
标签:Lexical、Embedding、Encoder、相似度、表示比较
一句话定义
不同表示路线保存的信息不同:词法方法强调表面重合,预训练 embedding 强调既有语义几何,小 encoder 则可针对任务学习可变表示。
学习目标
- 说明三类表示的输入、学习对象与相似度来源。
- 在同一组短文本上公平比较至少两条可行路线。
- 分析同义、否定、数字和实体标识带来的差异。
- 不把“向量更先进”当作默认胜出理由。
核心知识
Lexical 路线包括词袋、TF-IDF、BM25 或字符 n-gram。它们依赖可见片段重合,对罕见精确词、代码、编号和专有名词很强,也容易解释;但同义改写可能得分低,长文本词频还需归一化。
Frozen embedding 使用固定预训练模型把文本编码为向量,比较通常用 cosine。它无需当前任务训练,能处理不少语义改写,但几何空间由原训练数据和目标决定,领域缩写、否定、数字差异或新实体未必可靠。
小 encoder 可在任务数据上训练,让相关文本靠近、不相关文本分开,或直接预测类别。它能适配领域,却引入标签质量、负样本构造、过拟合和维护成本。小数据时,线性 probe 或冻结大部分表示往往比端到端训练更稳,是连接固定表示与完整微调的中间路线。
机制与比较
为文本对 (q,d) 定义相关标签。Lexical 分数来自共享 token 的加权重合;embedding 分数来自向量角度;监督 encoder 的损失可使用对比学习,例如让正对的相似度高于负对。三者优化目标不同,所以“分数 0.8”不能横向直接解释。
构造四组最有诊断价值的短文本:同义改写、共享词但含义相反、只有金额数字不同、地址只差一位。预计 embedding 对同义改写更有优势,lexical/exact 对标识与数字更稳;但这只是待验证假设,不应提前写成实验结论。
最小练习
- 准备 8~12 对自写短文本,明确每对希望判断的是主题、事实还是实体。
- 选择可用的两条路线,例如字符 n-gram 与 frozen embedding。
- 对所有文本使用相同 normalization,另保留原始精确字段。
- 建立“文本对、期望关系、路线 A、路线 B、失败解释”空表。
- 运行后只记录实际差异;若没有可用 embedding,可完成设计而不伪造分数。
常见误区
- 用不同文本清洗与数据集比较两种表示。
- 把语义相关、事实一致和实体相同混成一个标签。
- 只挑 embedding 擅长的同义例,忽略否定与精确标识。
- 小 encoder 在同一数据上训练和评估。
- 把可视化聚类看起来合理当作下游任务有效。
金融、Web3 与文档场景连接
政策检索适合语义与词法混合:用户可能换一种说法提问,但法规编号、账户类型和“不得”必须精确保留。Web3 地址则应 exact match;embedding 可帮助找相关说明,不能判断地址身份。
自检问题
- 字符 n-gram 为什么对拼写变体和编号可能有用?
- Frozen embedding 的分数由什么训练历史塑造?
- 小 encoder 相比固定 embedding 新增哪些风险?
- 如何设计一组能暴露否定误判的文本对?
专业课程对齐
- Stanford CS224N:对应词向量、上下文化表示与句子建模,用来区分 lexical overlap、静态 embedding 和 encoder 表示。
- Hugging Face LLM Course:对应使用预训练模型与 tokenizer 的章节,核对 pooling、padding 和 batch 推理的实现边界。
- Stanford CS336:选读模型表示与训练基础,理解小 encoder 的表示来自任务数据和优化目标,而非天然更“语义化”。
深入学习提示
先精读 CS224N 的表示谱系,再用 Hugging Face Course 对照 frozen encoder 的输入输出,最后选读 CS336 解释训练目标。比较时固定文本对、相似度指标和下游判定规则:lexical 用稀疏权重,frozen embedding 用预训练空间,小 encoder 则允许任务监督改变空间。公式上观察余弦相似度对向量尺度不敏感,以及 pooling 如何从 token states 得到句向量。反例必须包含否定句、同词异义、数字变化、同实体不同写法和模板化长句;这些能揭示高相似并不等于事实一致。代码还要记录 tokenizer、最大长度、pooling 和归一化,否则结果不可复核。精读结果应形成“何时最简单路线足够”的决策表,而不是模型排行榜。
学后填写区
- 选择的两条路线:____
- 文本对集合:____
- 表示差异表:____
- 实际失败类型:____
- 实际学习日期与用时:____