Calibration / Conformal Prediction:不确定性治理
不确定性治理的核心不是给界面加一个“信心分”,而是把模型分数、置信度、预测集合、覆盖率和分布外信号转化为可执行的系统动作。校准回答“模型给出 80% 时,长期正确率是否接近 80%”;conformal prediction 回答“在合理假设下,预测集合或区间能否达到目标覆盖率”。
Calibration / Conformal Prediction / Uncertainty Governance 解读
配对阅读:本篇的操作手册版(模板/RACI/门禁/runbook)是
docs/AI_UNCERTAINTY_CALIBRATION_CONFORMAL_PREDICTION_PLAYBOOK.md。第一遍读本篇建立原理与架构判断;第二遍做案例时再用 playbook 查表落地,两者不需要重复精读。
Source Anchors
| Source | Link | 读它要抓住什么 |
|---|---|---|
| On Calibration of Modern Neural Networks | https://arxiv.org/abs/1706.04599 | 现代神经网络可能过度自信,temperature scaling 等后处理校准方法为何有用 |
| A Gentle Introduction to Conformal Prediction | https://arxiv.org/abs/2107.07511 | Conformal prediction 的 coverage、prediction set / interval 和 distribution-free 直觉 |
| MAPIE | https://mapie.readthedocs.io/ | 工程化 prediction interval / set 和 model-agnostic conformal workflow |
| Selective Classification | https://papers.nips.cc/paper_files/paper/2017/hash/4a8423d5e91fda00bb7e46540e2b0cf1-Abstract.html | 模型可以选择 abstain,风险和覆盖之间需要权衡 |
| NIST AI RMF | https://www.nist.gov/itl/ai-risk-management-framework | 把可靠性、不确定性、风险路由和持续监控纳入 AI 风险管理 |
核心导读
不确定性治理的核心不是给界面加一个“信心分”,而是把模型分数、置信度、预测集合、覆盖率和分布外信号转化为可执行的系统动作。校准回答“模型给出 80% 时,长期正确率是否接近 80%”;conformal prediction 回答“在合理假设下,预测集合或区间能否达到目标覆盖率”。
系统价值来自把这些信号接入 action router、risk tier、人工复核、拒答、抽检、监控和审计证据。未经校准的 confidence 不能被当作事实;它只有在覆盖率、分布假设、阈值策略和处置路径都清楚时,才适合作为自动化决策的输入。
核心问题
AI 系统经常输出看似精确的分数。
欺诈模型给出 0.87,KYC 文档抽取给出字段 confidence,RAG 助手生成“根据政策可以这样处理”的答案,LLM 语气非常确定。业务方很容易把这些信号理解成“模型有把握”。
但 confidence 不等于 correctness。
一个分类模型输出 0.9,如果在所有输出 0.9 的样本中真实正确率只有 0.7,那么这个分数不能被当作概率使用。一个 LLM 语气坚定,也不代表证据充分。一个 RAG 答案带了引用,也不代表引用真的支持结论。
金融零售中的风险不只是模型错,而是系统在模型不确定时仍然做了错误动作:
- 低置信 KYC 字段被自动通过。
- 未校准欺诈分触发强认证或拒绝。
- 信贷风险概率被当成精确违约概率。
- RAG 合规助手在证据不足时给出确定建议。
- 客服 Agent 在不确定时继续调用高风险工具。
不确定性治理要回答:
当模型不确定、分布外、证据不足或覆盖不可靠时,系统应该做什么?
这不是模型训练后的附加解释,而是产品和架构的核心控制机制。
方法/论文贡献
On Calibration of Modern Neural Networks 的重要贡献,是系统指出现代深度网络虽然准确率高,却可能严重 miscalibrated,尤其是过度自信。论文也展示了 temperature scaling 这种简单后处理方法:不改变分类排序,调整 softmax 分布的“温度”,让输出概率更接近真实正确率。
这个贡献改变了一个常见误解:高 accuracy 不代表概率可用。一个模型可以分类很准,但只要它在错的时候仍然非常自信,就不适合直接驱动高风险自动化。
Conformal prediction 的贡献,是提供一种较少依赖模型形式的 uncertainty wrapper。给定一个训练好的模型和一个 calibration set,它可以构建 prediction set 或 prediction interval,使真实标签长期落入集合/区间的比例接近目标 coverage,例如 90%。
Conformal 的重要直觉是:与其强迫模型每次给一个单点答案,不如在不确定时给更大的集合或区间。集合变大不是失败,而是系统承认“这类样本需要更多证据或人工判断”。
Selective classification / selective prediction 的贡献,是把 abstention 正式纳入预测系统。模型不必对所有样本都自动给最终答案;它可以在高风险或低置信场景中拒绝预测、升级人工或请求更多信息。
这三条线合在一起,形成 uncertainty governance:
calibrated probability
+ prediction set / interval
+ abstention policy
+ risk tier
-> product action
机制原理:Calibration
校准回答的是:
在所有模型预测概率为 p 的样本中,真实正确率是否约为 p?
如果模型对 1000 个样本都输出 0.8,那么其中大约 800 个应该正确。否则这个 0.8 不能被解释成“80% 概率正确”。
常用观察方式是 reliability diagram。把预测置信度分桶,例如 0.0-0.1、0.1-0.2、...、0.9-1.0,然后比较每个桶内平均置信度和实际正确率。
| 指标 | 含义 | 适用 |
|---|---|---|
| Reliability diagram | 可视化置信度和正确率是否一致 | 风险评审和模型诊断 |
| ECE | 分桶置信度和真实正确率差异的加权平均 | release gate 和版本比较 |
| Brier score | 概率预测和真实标签的平方误差 | 风险概率模型、二分类 |
| NLL | 对真实标签分配的负对数概率 | 训练和概率质量比较 |
Temperature scaling 是常见校准方法。它对 logits 做温度调整:
softmax(logits / T)
T 较大时,概率分布更平滑,过度自信会下降。它通常不改变 top-1 prediction,因此不提升 accuracy,而是让概率更可信。
其他方法包括 Platt scaling、isotonic regression、histogram binning、Bayesian calibration、ensemble uncertainty 等。选择方法时要看样本量、任务类型、segment 需求和上线复杂度。
机制原理:Conformal Prediction
Conformal prediction 的目标是生成预测集合或区间,并提供 coverage 保证。
分类场景中,模型不只输出:
label = passport
而可能输出:
prediction set = {passport, national_id}
这表示模型认为这两个标签都有可能。集合越大,说明不确定性越高。
回归场景中,模型不只输出:
PD = 3.2%
而可能输出:
PD interval = [2.1%, 5.8%]
核心流程通常是:
- 训练基础模型。
- 留出 calibration set。
- 定义 conformity score,衡量真实标签和模型预测有多“不一致”。
- 用 calibration set 上的 score 分位数确定阈值。
- 对新样本输出 prediction set 或 interval。
关键假设通常是 exchangeability,也就是 calibration data 和未来样本来自足够相似的分布。这个假设在生产漂移时会变弱,因此 conformal 不能替代 drift monitoring。
Conformal 的产品价值,是把不确定性显性化:
- 预测集合小,且业务风险低,可以自动处理。
- 预测集合大,说明模型不能稳定区分,需要复核或补充证据。
- 区间过宽,说明不应做精细化定价、额度或风险分层。
- 某 segment coverage 下降,说明局部可靠性失效。
机制原理:Selective Prediction 和 Abstention
Selective prediction 允许模型不回答。
if reliable and low risk:
auto action
elif uncertain but recoverable:
ask for more evidence or route to review
else:
abstain, refuse, or escalate
这看似简单,但对产品影响很大。很多 AI 系统失败,是因为它们被设计成必须回答。真正的高可靠系统要允许“不知道”“证据不足”“需要人工确认”“当前不能自动执行”。
动作路由可以按两维设计:
| 模型可靠性 | 业务风险 | 动作 |
|---|---|---|
| 高 | 低 | 自动处理或低摩擦展示 |
| 高 | 高 | 自动建议 + 抽检/审批 |
| 中 | 中 | 补充证据、二次模型、人工抽检 |
| 低 | 低 | 显示限制、请求更多信息 |
| 低 | 高 | 人工复核、拒答、升级或停止 |
| 分布外 | 任意 | 降级、隔离或进入异常流程 |
Abstention 不是体验失败。它是系统对风险边界的尊重。金融零售客户宁愿系统明确提示“需要人工确认”,也不应收到自信但错误的合规、账户或信贷建议。
机制原理:LLM / RAG 的不确定性拆分
LLM 场景不能直接使用模型自报 confidence。模型说“我很确定”没有可靠概率含义。
更稳妥的做法,是把 RAG / LLM 不确定性拆成多个可检测信号:
| 信号 | 问什么 |
|---|---|
| Retrieval confidence | 是否检索到足够相关、权威、最新的资料 |
| Citation support | 引用是否真正支持生成结论 |
| Answer consistency | 多次生成或多个 evaluator 是否一致 |
| Policy risk | 问题是否涉及信贷、费用、投诉、账户限制、监管解释 |
| Permission fit | 用户或员工是否有权限访问相关答案 |
| Freshness | 知识源是否过期,政策版本是否最新 |
| Generation risk | 是否出现 unsupported claim、过度概括或越权建议 |
这些信号不一定都变成一个百分比。更好的产品表达可能是:
- 引用充分,可以回答。
- 证据不足,需要补充资料。
- 该问题涉及高风险政策,需要二线确认。
- 当前知识库没有覆盖,不能回答。
在面向客户的产品中,虚假精确的“92% confidence”常常比没有分数更危险。
为什么有效
校准有效,是因为它把模型分数从排序信号转化为决策信号。很多模型分数本来只适合比较高低,不适合解释为概率。校准让阈值、队列、抽检比例和风险承受度更可管理。
Conformal 有效,是因为它不强迫模型在所有样本上给单点答案。困难样本会得到更大的集合或区间,从而自然进入复核、补证或拒答流程。
Selective prediction 有效,是因为它把覆盖率和错误率显式权衡。系统可以选择只在可靠区域自动化,把不可靠区域交给人工、规则或更多证据。
不确定性治理有效,是因为它让 AI 产品具备“自知之明”。一个知道自己不确定并正确降级的系统,通常比一个平均准确率更高但错时过度自信的系统更适合高风险场景。
局限和误用
第一类误用,是把校准当成提升准确率的方法。校准通常不让模型更会分类,它让概率更可信。如果基础模型本身错误很多,校准不能把坏模型变成好模型。
第二类误用,是只看总体校准。总体 ECE 好可能掩盖少数语言、低收入客群、新地区、薄文件客户、低质量文档或特殊商户类别的严重失准。
第三类误用,是把 conformal coverage 当成个体保证。90% coverage 表示长期频率,不代表某个单独客户的预测一定正确,也不代表所有 segment 都有 90%。
第四类误用,是忽略 exchangeability。生产数据漂移、政策变化、攻击者适应、知识库更新或渠道变化都会削弱 conformal 的覆盖保证。
第五类误用,是用 LLM 自报信心做高风险路由。LLM 的语言风格和概率校准不同,必须依赖外部评测、证据检查、模型校准器、人审和生产 outcome。
第六类误用,是把 abstention 当成体验问题强行压低。如果业务 KPI 只惩罚拒答率,系统会被迫在不确定时回答,最终转化为错误、投诉和监管风险。
架构/产品价值
不确定性治理需要成为模型服务和业务动作之间的一层。
model output
-> calibration layer
-> uncertainty / conformal layer
-> risk and segment policy
-> action router
-> auto / review / abstain / refuse / escalate
-> outcome, override and calibration monitoring
关键组件如下:
| 组件 | 职责 |
|---|---|
| Calibration service | 管理 temperature scaling、isotonic、segment calibration 和版本 |
| Conformal service | 生成 prediction set / interval,跟踪 coverage 和 set size |
| Uncertainty aggregator | 汇总模型置信、证据、漂移、segment 和业务风险信号 |
| Risk tier policy | 定义不同风险等级下允许的自动化动作 |
| Action router | 把不确定性转成自动、抽检、补证、人审、拒答或升级 |
| Confidence UX | 向客户或员工表达限制、证据和下一步,不滥用百分比 |
| Monitoring | 跟踪 ECE、Brier、coverage、abstention、override、segment drift |
| Evidence binder | 保存校准集、版本、门禁、复核、审批和事故记录 |
产品上要避免把所有不确定性压成一个分数。更好的设计是把不确定性和下一步动作绑定:
字段低置信 -> 请客户重新上传或人工复核
引用不足 -> 不回答政策结论,只展示可查证资料
风险分高但校准差 -> 不自动拒绝,进入二线队列
prediction set 过大 -> 要求更多信息或延后自动决策
金融零售系统案例
KYC 文档抽取
KYC 系统要抽取姓名、地址、证件号、有效期、签发国家和文档类型。字段级模型可能对每个字段输出 confidence。
如果 confidence 未校准,系统可能自动通过错误字段。例如 OCR 把证件号中的 O 和 0 混淆,但模型仍给高分。字段错误会影响开户、制裁筛查、税务、反洗钱和客户体验。
更稳妥的设计是:
- 对字段级 confidence 做校准。
- 按文档类型、国家、渠道和图片质量看 segment calibration。
- 对文档类型使用 prediction set,例如 {passport, national_id}。
- 对低置信字段触发重新上传、二次 OCR 或人工复核。
- 对高风险字段,例如姓名、证件号和有效期,设置更严格门禁。
这里的不确定性不是展示给客户的装饰,而是决定上传流程和审核队列的路由信号。
欺诈风险和强认证
欺诈模型输出的概率常被用于阈值决策:放行、强认证、人工复核或拒绝。
如果 0.8 分数在总体上校准,但在某个新商户类别中实际欺诈率只有 0.2,那么自动强认证会造成大量误拦。反过来,如果某个攻击渠道中 0.5 分数实际风险很高,系统会低估损失。
治理要点包括:
- 按商户类别、渠道、地区、设备、金额和客户生命周期看 calibration。
- 对阈值附近样本提高抽检或人审。
- 对校准漂移的 segment 降低自动拒绝能力。
- 用 outcome lag 设计 cohort monitoring,因为 chargeback 标签晚到。
- 把客户投诉、step-up failure 和人工 override 纳入不确定性监控。
欺诈动作的风险不同。强认证通常可逆,拒绝交易影响更大,冻结账户更高风险。相同模型分数在不同动作下需要不同门禁。
RAG 合规助手
合规助手回答政策、费用、投诉、信贷、账户限制和监管流程问题。错误答案可能影响客户权益或员工操作。
不确定性治理可以设计为:
retrieval strong + citation supports answer + low policy risk
-> answer with citations
retrieval weak or citation mismatch
-> ask clarifying question / show limitation / route to human
high policy risk or outdated source
-> refuse final advice and escalate
不要把 LLM 生成的“我不确定”或“我很确定”当作主要信号。要用检索证据、引用一致性、答案可验证性、知识源 freshness 和人工 QA 结果来驱动路由。
学习验证
学习这篇后,可以做一个不确定性治理练习。
- 选择一个场景:KYC 字段抽取、欺诈强认证、信贷风险、RAG 合规助手或 Agent 工具调用。
- 区分模型分数、概率、置信度、预测集合和业务决策。
- 设计 reliability diagram 和 ECE 评估方式。
- 说明校准为什么不等于提高 accuracy。
- 设计 conformal prediction 的 calibration set、score 和目标 coverage。
- 定义 prediction set / interval 过大时的产品动作。
- 画出 uncertainty-to-action matrix。
- 按关键 segment 设计 calibration 和 coverage 监控。
- 说明为什么不能用 LLM 自报 confidence 做高风险路由。
- 设计 abstention、human review、override 和 outcome feedback 的数据闭环。
完成这些任务后,应该能把不确定性从模型指标转化为产品和架构控制。
关键结论
Calibration 让概率更可解释,但通常不提升模型准确率。
Conformal prediction 让系统在不确定时输出集合或区间,而不是强迫单点答案。
Selective prediction 让模型有权 abstain,这是高风险 AI 系统的重要能力,不是体验缺陷。
LLM / RAG 的不确定性要拆成检索、引用、答案一致性、权限、政策风险和知识 freshness,而不是依赖模型自报信心。
金融零售 AI 的成熟做法,是把不确定性接入 action router、human review、monitoring、governance evidence 和 rollback。真正可信的系统,不是永远自信,而是知道什么时候该停下来。
SOTA 状态标注 (2026-07-01)
本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。