返回 M01~M90 教材库
M68 · 预习教材教材已备 ≠ 学习已完成

M68:多模态与文档智能:一页小结

文档智能的完整因果链是 `pixels/layout → fields/relations → evidence → decision`,系统质量取决于每层的可观测性、验证与失败处理,而非单次回答是否流畅。

2026-10-30multimodal-summarylayoutevidencedecisionpipeline-selection

内容类型:预习教材(不代表已完成)
日期:2026-10-30
阶段:P1 · AI Model Engineering 90
周次:W10
节奏:周五一页小结
状态:教材已备;学习未完成
标签multimodal-summary layout evidence decision pipeline-selection

一句话定义

文档智能的完整因果链是 pixels/layout → fields/relations → evidence → decision,系统质量取决于每层的可观测性、验证与失败处理,而非单次回答是否流畅。

学习目标

  1. 用一张图整合本周全部组件与错误传播。
  2. 说明传统 pipeline 何时优于端到端 VLM。
  3. 将字段值、空间关系、证据定位和业务决定分开。
  4. 建立最小可审计输出契约。

核心知识

文档输入不是纯文字。像素承载字形、印章、勾选和图像;layout 承载阅读顺序、键值邻近与表格结构。OCR 把部分视觉转成文字与坐标,layout parser 建立区块和关系,vision encoder/VLM 可以处理更开放的视觉语义。无论采用哪条路线,最终都应回到明确 schema。

字段是规范化事实候选,例如金额、日期、主体;关系描述字段之间的归属,例如某金额属于哪一行;证据是可定位的原文、页面或框;decision 是在业务规则、成本和不确定性下采取的动作。模型可以正确抽取字段但给出错误决定,也可以字段有误却偶然得到正确决定,因此需要分层评估。

何时传统 pipeline 更合适

模板稳定、字段有限、格式约束强、审计要求高、低延迟或本地隐私严格时,OCR+layout+规则往往更合适。其优势不是“绝对更准”,而是错误可定位、约束可执行、变更可控制。发票总额、日期和交易编号等字段常适合这条路线。

何时引入 VLM

模板变化大、视觉关系复杂、文本与图片混合、字段问法快速变化时,VLM 可减少手工规则并处理长尾。引入方式不必是全量替代:可把 VLM 放在未知模板路由、疑难页处理、候选生成或人工辅助位置,再由规则与证据校验收口。

最小输出契约

一个可审计字段至少包含:valuenormalized_valuesource_pagesource_bbox/textstatusvalidationstatus 应能区分 found、missing、unreadable、ambiguous、conflict。系统层还应记录组件版本和文档处理路径,但不能把敏感内容无限留存。

机制与推导

可把系统设计为四个闭环:

  1. 感知闭环:图像质量检测失败时请求重拍或增强。
  2. 抽取闭环:OCR/layout/VLM 生成字段与关系。
  3. 验证闭环:格式、算术、跨字段和外部事实检查。
  4. 决策闭环:根据错误成本自动通过、复核或拒绝。

分层指标对应闭环:图像可读率、OCR/布局指标、字段与关系指标、证据支持率、最终决策损失。平均值之外还应按模板、语言、图像质量和关键字段切片。

最小练习或观察步骤

在一页纸中央写“结构化字段”,向左画输入与抽取,向右画证据、验证和决定:

  1. 标出 OCR、layout parser、VLM 各自可替换位置。
  2. 为每个箭头写一个可能错误。
  3. 圈出最早能检测该错误的层。
  4. 写出何时选择规则、何时升级 VLM、何时转人工。
  5. 最后用两句话说明你的 fixture 不代表真实分布。

常见误区

  • 将字段、证据和决定塞进一个不可解析的自然语言答案。
  • 只在“干净扫描件”上评估。
  • 把 VLM 的语言能力误当成精确视觉读取能力。
  • 用传统 pipeline 的透明度掩盖其模板脆弱性。
  • 没有 missing/ambiguous 状态,所有失败都变成猜测值。
  • 把人工复核当作无限容量的兜底。

金融、Web3 与文档场景连接

贷款材料、发票和支付争议都适合“字段+证据+状态”契约;AML 文档摘要应引用原页,不能把摘要本身当证据。链上交易事实应直接从节点或索引读取,截图/VLM 只协助定位。合同条款的解释可由语言模型辅助,但金额、日期、签名与适用版本要由确定来源验证。

自检问题

  1. pixels/layout、fields/relations、evidence、decision 为何不能合并评估?
  2. 传统 pipeline 适用的四个条件是什么?
  3. VLM 最安全的渐进式引入位置有哪些?
  4. 一个可审计字段的最小输出契约是什么?
  5. 哪些失败状态必须显式保留?

专业课程对齐

  • Hugging Face VLM Course:对应 VLM 的组成、训练与视觉语言接口,用于回看视觉 token、projector 和 LLM 各自能解决与不能保证的问题。
  • Stanford CS231n:对应视觉表征基础,用于巩固分辨率、局部特征、空间结构和图像扰动如何决定文档模型的输入上限。
  • Full Stack Deep Learning:对应从数据到部署的系统选择,用于把本周各环节收束为可测量、可审计、可降级的 document AI 路线。

深入学习提示

按“HF VLM 精读模型连接 → CS231n 选读视觉表示 → FSDL 回看系统生命周期”的顺序完成一页总结。不要再增加新模型,而是把 OCR+规则、layout-aware、VLM 三条路线放进同一决策表:数据规模与版式稳定性、关系推理需求、证据可追溯性、延迟/成本、隐私、拒答与人工复核。为每条路线写最小输出契约,至少含值、规范化值、页码/坐标或片段、置信/状态、模型或规则版本。重点复核四层指标是否分开:pixels/layout、fields/relations、evidence、decision;其中任一层失败都不能被最终文本流畅度掩盖。课程材料用于补理论位置,真正的小结应以本周 fixture、扰动链和路线比较中的已观察证据为核心;未运行部分明确标注待验证。

最后为每条路线保留一个代表性适用样本和一个反例,帮助以后用场景而非模型名快速恢复选择依据。

学后填写区

  • 我的 W10 全景图位置:
  • 我对传统 pipeline 与 VLM 的选择原则:
  • 我设计的字段输出契约:
  • 本周最需要回看的环节:
  • 一条仍不确定的结论:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。