返回 M01~M90 教材库
M81 · 预习教材教材已备 ≠ 学习已完成

M81:Financial Model Lab:误差切片与场景限制

误差切片把总体分数拆到类别、长度、语言、噪声、OOD 与成本子群,检验模型在哪些条件下可靠、何时拒答,以及结果能否支持场景动作。

2026-11-12error-analysisslicingoodcostmodel-limitations

内容类型:预习教材(不代表已完成)
日期:2026-11-12
阶段:P1 · AI Model Engineering 90
周次:W12
节奏:周四案例与连接
状态:教材已备;学习未完成
标签error-analysis slicing ood cost model-limitations

一句话定义

误差切片把总体分数拆到类别、长度、语言、噪声、OOD 与成本子群,检验模型在哪些条件下可靠、何时拒答,以及结果能否支持场景动作。

学习目标

  1. 从六类切片中选择与项目最相关的两类。
  2. 区分预先定义切片与看结果后挑选的切片。
  3. 将错误类型映射到业务成本、证据和降级动作。
  4. 写出样本量不足与证据不足的明确结论。

核心知识

1. 六类常用切片

类别:不同文档/风险类型。长度:短文本、长文档、长交易历史。语言:中文、英文、混合、数字格式。噪声:模糊、缺失、异常值。OOD:新模板、新实体、新协议或新时间段。成本:普通字段与关键金额/高损失错误。

切片应由部署风险或机制假设驱动。例如 VLM 可能在小字金额上失败,图模型可能在新钱包冷启动上失败。若看完结果才挑出表现最好切片,会产生叙事偏差。

2. 总体平均会掩盖尾部

数据多数是干净常见样本时,平均准确率可以很高,而少数高金额或 OOD 样本全部错误。应同时看样本数、错误数和代价。小样本切片只能作为案例观察,不能给出稳定率估计。

3. 错误分类比单纯计数更可行动

将失败分为感知/输入错误、关系或特征错误、模型判别错误、校准/阈值错误、证据缺失和数据/标签问题。不同错误对应不同改进:重采集、修 schema、换切分、增加 verifier、调阈值或停止自动化。不能把所有失败都归咎于模型参数。

4. 从模型结果到场景限制

一页案例分析应说明:数据是什么、不能代表什么;模型在哪些切片只可辅助;哪些字段必须规则验证;何时转人工;哪些结论没有证据。可以得出“支持”“反驳”或“证据不足”,三者都有效。

机制与推导

对每个切片建立 n / coverage / correct-or-loss / error type / action 表。若有拒答,分开报告被处理样本与全部样本。把错误成本放在行级别或类别级别,而不是只在最后泛泛讨论。

OOD 不应仅通过模型置信度定义;最好由数据来源、时间、模板或实体是否未见来标记。模型对 OOD 高置信并不罕见,因此需要外部检测和保守路由。

最小练习或观察步骤

  1. 选择两个切片,并写下选择理由。
  2. 为每个样本添加切片标签,不改模型输出。
  3. 建立带样本数与 coverage 的观察表。
  4. 精读最多五个失败,定位最早错误层。
  5. 为每类错误写一个动作:接受、重试、规则验证、人工或不自动化。
  6. 用一页写结论,并明确小样本/合成数据边界。

常见误区

  • 结果出来后只挑表现好或故事性强的切片。
  • 切片样本数极少却报告精确百分比结论。
  • 只分析错误输出,不检查输入与标签。
  • 把低 confidence 等同于 OOD。
  • 没有 coverage,拒答方法看似准确率很高。
  • 从合成 fixture 推广到全部金融业务。

金融、Web3 与文档场景连接

AML 可按新/旧客户、交易类型和标签成熟度切片;支付争议可按证据长度、语言和图像质量;链上钱包可按新地址、链、协议类型和标签时效;文档任务可按模板、扫描质量和关键金额字段。所有风险标签都应被视为带来源和时间的证据,而非永久事实。

自检问题

  1. 我为什么选择这两个切片?
  2. 总体平均可能掩盖什么?
  3. 错误最早发生在哪一层,动作是否匹配?
  4. OOD 应怎样由外部数据定义?
  5. 我的项目结论是支持、反驳还是证据不足?

专业课程对齐

  • Stanford CS329S:对应生产错误分析、分布变化、监控与可靠性;用于从总体指标下钻到可行动切片和场景限制。
  • Stanford CS229:对应评估、泛化和误差来源;用于判断切片差异可能来自样本难度、方差、标签噪声还是模型偏差。
  • Full Stack Deep Learning:对应数据中心的误差分析与迭代;用于把代表性失败样本连接到下一项数据、模型或路由动作。

深入学习提示

先按 CS329S 从部署风险反推切片,优先选择与输入质量、时间、金额/风险等级、客户/钱包冷启动、文档版式或标签成熟度有关的 3~5 个维度;再用 CS229 检查样本量与不确定性,最后按 FSDL 建立错误类型—修复动作表。每个切片同时报告样本数、标签率、主指标和置信区间或至少原始计数,避免对极小样本下结论。把错误分成数据缺失/错标、表示不足、模型混淆、阈值决策、分布外和系统接口六类,并保存一两个脱敏样例。总体平均良好但高代价尾部失败时,场景限制必须优先于“平均可用”。限制应写成可执行规则:哪些输入拒答、何时转人工、哪些群体暂不覆盖、监控什么漂移信号;不要把相关切片直接解释为主体风险或因果特征。

学后填写区

  • 两个切片及预先理由:
  • 观察表或设计位置:
  • 实际错误案例(未运行请注明):
  • 场景限制与降级动作:
  • 结论及证据边界:
学完后,请把自己的理解、练习结果和仍不确定的问题写入文末“学后填写区”,再到唯一进度账本更新状态。预先阅读后续教材不会自动增加完成数。