M68:多模态与文档智能:一页小结
文档智能的完整因果链是 `pixels/layout → fields/relations → evidence → decision`,系统质量取决于每层的可观测性、验证与失败处理,而非单次回答是否流畅。
内容类型:预习教材(不代表已完成)
日期:2026-10-30
阶段:P1 · AI Model Engineering 90
周次:W10
节奏:周五一页小结
状态:教材已备;学习未完成
标签:multimodal-summarylayoutevidencedecisionpipeline-selection
一句话定义
文档智能的完整因果链是 pixels/layout → fields/relations → evidence → decision,系统质量取决于每层的可观测性、验证与失败处理,而非单次回答是否流畅。
学习目标
- 用一张图整合本周全部组件与错误传播。
- 说明传统 pipeline 何时优于端到端 VLM。
- 将字段值、空间关系、证据定位和业务决定分开。
- 建立最小可审计输出契约。
核心知识
文档输入不是纯文字。像素承载字形、印章、勾选和图像;layout 承载阅读顺序、键值邻近与表格结构。OCR 把部分视觉转成文字与坐标,layout parser 建立区块和关系,vision encoder/VLM 可以处理更开放的视觉语义。无论采用哪条路线,最终都应回到明确 schema。
字段是规范化事实候选,例如金额、日期、主体;关系描述字段之间的归属,例如某金额属于哪一行;证据是可定位的原文、页面或框;decision 是在业务规则、成本和不确定性下采取的动作。模型可以正确抽取字段但给出错误决定,也可以字段有误却偶然得到正确决定,因此需要分层评估。
何时传统 pipeline 更合适
模板稳定、字段有限、格式约束强、审计要求高、低延迟或本地隐私严格时,OCR+layout+规则往往更合适。其优势不是“绝对更准”,而是错误可定位、约束可执行、变更可控制。发票总额、日期和交易编号等字段常适合这条路线。
何时引入 VLM
模板变化大、视觉关系复杂、文本与图片混合、字段问法快速变化时,VLM 可减少手工规则并处理长尾。引入方式不必是全量替代:可把 VLM 放在未知模板路由、疑难页处理、候选生成或人工辅助位置,再由规则与证据校验收口。
最小输出契约
一个可审计字段至少包含:value、normalized_value、source_page、source_bbox/text、status、validation。status 应能区分 found、missing、unreadable、ambiguous、conflict。系统层还应记录组件版本和文档处理路径,但不能把敏感内容无限留存。
机制与推导
可把系统设计为四个闭环:
- 感知闭环:图像质量检测失败时请求重拍或增强。
- 抽取闭环:OCR/layout/VLM 生成字段与关系。
- 验证闭环:格式、算术、跨字段和外部事实检查。
- 决策闭环:根据错误成本自动通过、复核或拒绝。
分层指标对应闭环:图像可读率、OCR/布局指标、字段与关系指标、证据支持率、最终决策损失。平均值之外还应按模板、语言、图像质量和关键字段切片。
最小练习或观察步骤
在一页纸中央写“结构化字段”,向左画输入与抽取,向右画证据、验证和决定:
- 标出 OCR、layout parser、VLM 各自可替换位置。
- 为每个箭头写一个可能错误。
- 圈出最早能检测该错误的层。
- 写出何时选择规则、何时升级 VLM、何时转人工。
- 最后用两句话说明你的 fixture 不代表真实分布。
常见误区
- 将字段、证据和决定塞进一个不可解析的自然语言答案。
- 只在“干净扫描件”上评估。
- 把 VLM 的语言能力误当成精确视觉读取能力。
- 用传统 pipeline 的透明度掩盖其模板脆弱性。
- 没有 missing/ambiguous 状态,所有失败都变成猜测值。
- 把人工复核当作无限容量的兜底。
金融、Web3 与文档场景连接
贷款材料、发票和支付争议都适合“字段+证据+状态”契约;AML 文档摘要应引用原页,不能把摘要本身当证据。链上交易事实应直接从节点或索引读取,截图/VLM 只协助定位。合同条款的解释可由语言模型辅助,但金额、日期、签名与适用版本要由确定来源验证。
自检问题
- pixels/layout、fields/relations、evidence、decision 为何不能合并评估?
- 传统 pipeline 适用的四个条件是什么?
- VLM 最安全的渐进式引入位置有哪些?
- 一个可审计字段的最小输出契约是什么?
- 哪些失败状态必须显式保留?
专业课程对齐
- Hugging Face VLM Course:对应 VLM 的组成、训练与视觉语言接口,用于回看视觉 token、projector 和 LLM 各自能解决与不能保证的问题。
- Stanford CS231n:对应视觉表征基础,用于巩固分辨率、局部特征、空间结构和图像扰动如何决定文档模型的输入上限。
- Full Stack Deep Learning:对应从数据到部署的系统选择,用于把本周各环节收束为可测量、可审计、可降级的 document AI 路线。
深入学习提示
按“HF VLM 精读模型连接 → CS231n 选读视觉表示 → FSDL 回看系统生命周期”的顺序完成一页总结。不要再增加新模型,而是把 OCR+规则、layout-aware、VLM 三条路线放进同一决策表:数据规模与版式稳定性、关系推理需求、证据可追溯性、延迟/成本、隐私、拒答与人工复核。为每条路线写最小输出契约,至少含值、规范化值、页码/坐标或片段、置信/状态、模型或规则版本。重点复核四层指标是否分开:pixels/layout、fields/relations、evidence、decision;其中任一层失败都不能被最终文本流畅度掩盖。课程材料用于补理论位置,真正的小结应以本周 fixture、扰动链和路线比较中的已观察证据为核心;未运行部分明确标注待验证。
最后为每条路线保留一个代表性适用样本和一个反例,帮助以后用场景而非模型名快速恢复选择依据。
学后填写区
- 我的 W10 全景图位置:
- 我对传统 pipeline 与 VLM 的选择原则:
- 我设计的字段输出契约:
- 本周最需要回看的环节:
- 一条仍不确定的结论: