M18:领域文本的 Token 与表示边界
领域表示边界是通用 tokenizer 与 embedding 遇到缩写、精确标识、混合语言和分布外表达时,压缩效率与语义可靠性同时下降的区域。
内容类型:预习教材(不代表已完成)
日期:2026-09-10
阶段:P1 · AI Model Engineering 90
周次:W3 · Tokenization、Embedding 与表示学习
节奏:周四案例与连接
状态:教材已备;学习未完成
标签:AML、缩写、中英混合、地址、哈希、OOD、Token 成本
一句话定义
领域表示边界是通用 tokenizer 与 embedding 遇到缩写、精确标识、混合语言和分布外表达时,压缩效率与语义可靠性同时下降的区域。
学习目标
- 分析 AML 缩写、中英混合、地址/哈希的切分与表示风险。
- 区分 token 成本问题、检索召回问题和事实判断问题。
- 识别近义误命中与 OOD 的不同来源。
- 设计结构化、词法与向量路线的组合边界。
核心知识
缩写具有多义性:SAR 可指可疑活动报告,也可能在别的领域表示完全不同概念。tokenizer 可能把它作为一个 token,但这并不消除语义歧义;embedding 必须依赖上下文。中英混合文本会在不同文字系统间产生不均匀切分,英文缩写、中文词、数字和标点可能分别占用多个 token,影响上下文预算。
地址和哈希是高熵标识符。它们的字符相似通常不代表语义接近;相差一位就可能是完全不同主体。将其整体送入语义 embedding 不仅浪费 token,还可能引入近邻误判。更合理的做法是解析为结构化字段、规范化大小写或校验和,再执行 exact match、前缀展示与权限控制。
近义误命中是系统把主题相近但事实不等价的文本当成答案,如“提高转账限额”与“禁止提高转账限额”。OOD 则指输入来自训练或校准之外的分布,例如新缩写、新语言、异常长度或新文档模板。高相似度不等于处于分布内,低相似度也不必然表示错误。
机制与边界分析
将错误链拆为四层:原始文本 → token 序列 → 向量/索引 → 下游判断。长 token 序列会增加成本或截断风险;罕见片段导致表示不稳;相似度目标可能忽略否定和数字;下游若把相似直接当事实,就把表示误差放大为决策错误。
混合检索可用 lexical 分数捕获编号和关键词,vector 分数捕获改写,再用结构化过滤限制实体、日期、权限。必要时把 exact-match 字段从 embedding 文本中拆出。这个组合不是“多加一路一定更好”,而是让每种表示负责其擅长的信息类型。
最小练习
- 写 12 条边界文本:3 个缩写、3 条中英混合、3 个假地址/哈希、3 对否定或数字差异。
- 预测每条 token 数和潜在错误,再用可用 tokenizer 检查。
- 为每条标注应使用 semantic、lexical、exact 或 hybrid。
- 计算一个“每字符 token 数”的简单成本观察,运行后再填数字。
- 写出一条 OOD 时的拒答或降级规则,不假设模型自动识别全部 OOD。
常见误区
- 单 token 缩写就被认为理解得更好。
- 对地址做 cosine 检索,并据此判断同一主体。
- 只优化 token 数,却忽略规范化改变了法律或金额含义。
- 将否定词过滤为停用词,造成事实反转。
- 用“相似度低”简单定义 OOD,不做独立验证。
金融、Web3 与文档场景连接
AML 文档中的账户号、币种、制裁名单实体和日期都需要结构化证据;叙述性案情适合语义检索。Web3 交易哈希用于精确定位,协议说明可用 embedding。文档系统应在字段级明确哪种表示具有决定权。
自检问题
- Token 压缩效率与语义正确性为什么是两个问题?
- 什么信息必须从向量检索中拆出做 exact match?
- 近义误命中和 OOD 有何不同?
- Hybrid retrieval 的三条路线分别负责什么?
专业课程对齐
- Hugging Face LLM Course:对应 tokenizer、预处理与模型输入章节,用来检查领域字符串进入模型前发生的规范化和切分。
- Stanford CS224N:对应 subword、词表示与上下文建模,理解近义词和实体标识在表示空间中的不同需求。
- Stanford CS336:对应 tokenizer/data pipeline,关注领域语料分布、序列长度和训练成本的耦合。
深入学习提示
先用 Hugging Face tokenizer 检视 AML 缩写、SWIFT 字段、中英混合、账号、哈希和金额,再以 CS224N 解释表示差异,最后选读 CS336 评估是否值得训练领域 tokenizer。观察每字符 token 数、特殊片段完整率、规范化前后可区分性及截断位置;公式上用平均 fertility(token 数/原始词或字符数)量化碎片化。反例包括 lowercasing 把大小写实体合并、去标点破坏账户格式、向量近邻把金额不同的陈述视为同义、罕见哈希因共享前缀误召回。结论要分别落到结构化解析、词法匹配、向量召回或人工规则,不能把所有失败都归为“embedding 不好”;精读顺序最终服务于边界决策。
学后填写区
- 边界文本集合:____
- token 成本观察:____
- 表示责任划分:____
- 一个仍无法解决的 OOD:____
- 实际学习日期与用时:____