M19:Text → Token → Vector → Task 因果链
从文本到任务结果的每一步都只保留并重组部分信息,因此相似向量不能越级证明事实相同、实体相同或权限相同。
内容类型:预习教材(不代表已完成)
日期:2026-09-11
阶段:P1 · AI Model Engineering 90
周次:W3 · Tokenization、Embedding 与表示学习
节奏:周五一页小结
状态:教材已备;学习未完成
标签:表示因果链、Similarity、事实、权限、检索边界
一句话定义
从文本到任务结果的每一步都只保留并重组部分信息,因此相似向量不能越级证明事实相同、实体相同或权限相同。
学习目标
- 绘制 text→normalization→token→vector→similarity→task 全链路。
- 为每一步标注信息损失、训练假设和可观察错误。
- 明确语义相似、事实一致、实体身份和访问权限的边界。
- 汇总 W3 的 tokenizer、表示路线与领域案例。
核心知识
原始文本首先可能被 Unicode 规范化、大小写转换、空白处理或字段拼接。任何清洗都在改变表示:统一无意义空白可能有益,删除负号、币种或否定词则会损坏事实。tokenizer 再把字符串映射为有限词表 ID;这一步保持可解码性不等于保持易学习的语义结构。
embedding 或 encoder 把离散序列压缩为向量。若用单个句向量,词序、局部数字或多事实细节可能被弱化。similarity 把两个向量进一步压成一个标量,只回答特定几何度量下的接近程度。最终 task 又通过阈值、排序、分类器或生成器使用这个分数。
因此需要四个独立谓词:语义相关表示主题接近;事实一致表示具体陈述不冲突;实体相同需身份或主键证据;权限相同需访问控制判断。向量检索通常只为第一个提供候选证据,后三个需要解析、来源验证、规则或授权系统。
机制与整合
一页图可在主链下方增加“可能失真”行:normalization 丢符号;tokenization 造成领域碎片;embedding 过度平滑;similarity 忽略否定;top-k 截断遗漏;task 阈值不适配;业务层误把候选当结论。
再增加“补偿机制”行:保留原文与 offsets;特殊字段结构化;lexical+vector 混合;cross-encoder 重排;事实验证;权限过滤;拒答。补偿机制必须放在正确层级,例如权限过滤不能靠调 embedding 相似阈值替代。
表示评估也应分层:token 长度和 round-trip 检查 tokenizer;近邻案例和 retrieval recall 检查表示;事实一致与引用检查下游;权限越界必须做独立安全验证。
最小整理步骤
- 画六节点主链,每个节点写输入、输出和一个失败模式。
- 把 M16 的 BPE、M17 的路线比较、M18 的边界案例放入对应节点。
- 为“禁止转账”与“允许转账”示例逐层说明可能怎样误判。
- 写一个四列表:语义 / 事实 / 实体 / 权限,对应验证方法。
- 选一个仍说不清的箭头加入复习清单。
常见误区
- 把端到端模型当作不存在中间假设。
- tokenizer 可逆就认为下游一定能保留数字和否定意义。
- top-1 相似文档直接作为事实答案,不检查来源和句子。
- 用 embedding 隔离权限域,忽略其不是安全边界。
- 只评估最终回答,无法定位表示链中哪一步出错。
金融、Web3 与文档场景连接
客户问“这笔 0x… 交易是否属于我”时,语义检索可找到交易说明,但地址归属必须由已授权账户映射验证;政策段落相似也不能证明适用于该客户、日期和辖区。分层验证能防止模型把“相关”越级成“有权确认”。
自检问题
- 句向量把整段文本压成一个向量时可能丢失什么?
- 语义相关与事实一致怎样构造反例?
- 权限判断为什么不能由 cosine similarity 承担?
- 每一层最合适的评估信号是什么?
专业课程对齐
- Stanford CS224N:对应从 token、词向量到上下文化编码的表示链,帮助标注每层学习到的假设。
- Hugging Face LLM Course:对应 tokenizer → model → task pipeline,提供实现层的输入输出参照。
- Stanford CS229 Materials:对应监督学习与决策边界,用于把向量表示连接到分类或排序目标,而不是停留在相似度。
深入学习提示
按 CS224N 表示基础、Hugging Face pipeline、CS229 下游任务的顺序精读,并画一张 text → normalize → tokenize → vectorize → score → threshold → action 图。每条边标注可逆性、训练数据、损失目标和一个监控信号。公式观察余弦/点积只是几何分数,经过监督目标、概率映射和阈值后才成为任务决策。反例贯穿全链:规范化合并不同账号、tokenizer 截断否定词、embedding 近似但事实冲突、分类分数校准失真、阈值忽略审核容量。代码层要保存原文、token IDs、截断标记、向量版本和规则版本,使错误可追踪。最终自检不是“模型是否懂文本”,而是能否定位一次错误最早从哪一层出现。
学后填写区
- W3 因果链位置:____
- 四类关系验证表:____
- 最危险的越级推断:____
- 下次复习入口:____
- 实际学习日期与用时:____