M66:OCR+规则、Layout-aware 与小 VLM 路线比较
文档 AI 的路线选择不是“模型越新越好”,而是在字段准确性、关系理解、证据可追溯、资源与变化速度之间选择最合适的结构。
内容类型:预习教材(不代表已完成)
日期:2026-10-28
阶段:P1 · AI Model Engineering 90
周次:W10
节奏:周三引导练习
状态:教材已备;学习未完成
标签:ocr-ruleslayout-awarevlmabstentionmodel-selection
一句话定义
文档 AI 的路线选择不是“模型越新越好”,而是在字段准确性、关系理解、证据可追溯、资源与变化速度之间选择最合适的结构。
学习目标
- 能比较 OCR+规则、layout-aware 模型和小 VLM 的信息输入与输出。
- 用同一 fixture、公平 schema 和相同指标做路线对照。
- 观察字段、关系、坐标与拒答,而不只观察最终文本是否“像答案”。
- 能提出混合路由,而不是被迫三选一。
核心知识
1. OCR + 规则
这条路线把文字与坐标显式化,再用关键词、正则、模板和业务约束抽取。优点是成本低、可调试、结果可回链,固定模板和高确定性字段上很强。缺点是模板变化、跨行关系和开放语义会快速增加规则复杂度。规则不是落后技术;当字段定义稳定、错误成本高且审计要求强时,它可能是最优 baseline。
2. Layout-aware 模型
Layout-aware 模型联合文字、位置,有些还结合页面图像。它能学习键值距离、表格行列和区块关系,适合模板有变化但结构规律仍存在的文档。训练与标注成本高于规则,需要覆盖布局分布;若 OCR 上游丢字,它仍会受影响。输出字段与坐标可以较自然地保持对应。
3. 小型 VLM
VLM 直接接收图像和指令,可理解视觉语义、非标准布局和混合内容,也能快速适配新字段问法。它的风险包括幻觉、格式不稳定、细小数字识别不足、证据坐标不精确以及推理成本。小 VLM 受设备内存和图像分辨率限制,缩放图像时可能损失关键细节。
4. 拒答是路线能力的一部分
高质量系统不只比较“答对多少”,还比较“何时知道自己不该答”。可以要求输出 value、evidence、confidence/status,并为证据缺失、多个候选、算术冲突设置拒答。路线若准确率略高却在 OOD 文档上自信编造,未必更适合生产。
机制与推导
公平比较应固定:同一组文档、同一字段 schema、同一规范化函数、同一业务校验和同一错误成本。否则 VLM 输出原始日期、规则输出规范日期,会造成不公平匹配。
可建立对照矩阵:字段精确匹配、关系正确率、证据框覆盖率、无答案时拒答率、单页延迟、内存/调用成本、调试可定位性。小样本只用于学习机制,不用于宣布路线胜负。
混合路线通常更现实:OCR+规则处理稳定字段;layout 模型处理表格;VLM 仅处理未知模板或复杂视觉页;所有路线通过统一 schema 和 verifier;冲突样本转人工。路由条件也应被记录,例如文档类型、OCR 质量、字段重要性和延迟预算。
最小练习或观察步骤
使用 M65 的合成 fixture,任选两条可行路线:
- 写清两条路线各自看到的输入。
- 要求两者输出相同 JSON schema,并携带证据。
- 预先定义 5 个指标:字段、关系、坐标、拒答、资源。
- 添加一个未知字段或轻微布局变化。
- 记录“观察事实”和“可能原因”两个独立栏位。
- 若设备或依赖不允许实际运行,可完成纸上设计,不填写结果。
常见误区
- 给不同路线不同难度的输入或不同规范化规则。
- 用自然语言“看起来差不多”替代字段级指标。
- 忽略无答案样本,迫使系统总是输出。
- 把 prompt 调优时间排除在 VLM 成本之外,却计算规则开发成本。
- 只比较平均准确率,不检查关键金额和地址字段。
- 根据单个样本决定全面迁移架构。
金融、Web3 与文档场景连接
标准银行流水可优先 OCR+模板;多机构 KYC 材料可能需要 layout-aware;支付争议中的截图、照片和手写说明可路由给 VLM,但金额与交易 ID 必须回链并校验。Web3 审计报告的表格与代码片段适合保留原始文本结构;钱包地址从图像识别后必须与结构化链上来源交叉确认。
自检问题
- 三条路线各自利用哪些信息?
- 为什么统一输出 schema 是公平比较的前提?
- 拒答率应怎样和覆盖率、错误成本一起看?
- 哪些场景适合混合路由?
- 证据框不准会怎样影响下游审计?
专业课程对齐
- Hugging Face VLM Course:对应 VLM 的视觉编码、跨模态投影和语言生成路线;重点判断其开放式推理能力换来了哪些可控性、证据定位和格式稳定性成本。
- Stanford CS231n:对应视觉 backbone 与空间表征,为理解 layout-aware 模型为何显式利用坐标、区域和页面结构提供基础。
- Full Stack Deep Learning:对应模型选择、部署和错误分析;用于把 OCR+规则、layout-aware、小 VLM 放到同一输出契约和资源约束下比较。
深入学习提示
先精读 HF VLM 的模型结构,列出小 VLM 直接生成字段时可见的像素与上下文;再选读 CS231n 理解局部视觉特征和空间信息;最后用 FSDL 的端到端方法设计比较。三条路线必须共享同一数据切分、字段 schema、规范化规则、拒答定义与业务成本,不能拿字符准确率和生成式“看起来正确”直接横比。至少同时观察字段 F1、证据定位质量、拒答/覆盖率、延迟、显存或费用,以及冲突样本上的失败方式。若数据量小,可只比较两条路线,但应保留第三条的适用条件。最终选择应说明何时走规则、何时升级 layout/VLM、何时转人工,而不是给出脱离场景的模型排行榜。
还要注明路线切换所需的最低证据条件和失败后的回退目标,使选择表能直接支持后续系统路由。
学后填写区
- 我比较的两条路线:
- 固定的 schema 与指标:
- 实际观察(未运行请注明):
- 可能原因,需如何验证:
- 我的混合路由草案: