M08:从概率分数到可承担的决策
模型分数只有结合真实基准率、校准程度、行动阈值与错误成本,才能转化为有意义的决策。
内容类型:预习教材(不代表已完成)
日期:2026-08-31
阶段:P1 · AI Model Engineering 90
周次:W2 · 概率、经典 ML、校准与决策损失
节奏:周一概念与阅读
状态:教材已备;学习未完成
标签:基准率、条件概率、混淆矩阵、Brier、ECE、阈值、拒答
一句话定义
模型分数只有结合真实基准率、校准程度、行动阈值与错误成本,才能转化为有意义的决策。
学习目标
- 用条件概率解释基准率怎样影响后验概率。
- 会从混淆矩阵计算 precision、recall 与错误数量。
- 区分判别能力、概率校准和阈值决策。
- 理解 abstention 是主动推迟决策,而不是模型失败的同义词。
核心知识
基准率 P(Y=1) 是目标事件在当前人群中的先验比例。在罕见事件中,即使检测器有较高真阳率和较低假阳率,假阳性绝对数量仍可能超过真阳性。贝叶斯公式把先验、似然和证据连接为后验:P(Y=1|X)=P(X|Y=1)P(Y=1)/P(X)。部署人群的基准率改变后,训练环境中的分数解释可能不再成立。
混淆矩阵包含 TP、FP、TN、FN。accuracy 衡量总体正确比例,但在 1% 阳性率时,“全部判阴性”也有 99% accuracy。precision = TP/(TP+FP),回答告警中有多少是真的;recall = TP/(TP+FN),回答真实阳性捕获多少。两者与阈值共同变化。
判别能力关心阳性排序是否高于阴性;校准关心预测 0.7 的样本中是否约有 70% 实际为阳性。Brier score 是概率预测与 0/1 结果的均方误差,兼受校准和分辨率影响。ECE 把分数分箱,比较每箱平均置信度与实际频率,但结果受分箱方法影响,不能作为唯一证据。
机制与推导
假设 10,000 笔交易中欺诈率 1%,即 100 笔阳性。模型召回率 90%,假阳率 5%。则 TP=90、FN=10、FP=0.05×9,900=495、TN=9,405。accuracy 为 94.95%,看似不错;precision 却只有 90/(90+495)≈15.4%。这不是算术悖论,而是低基准率放大了假阳性的绝对数量。
阈值 t 把 score 转为动作。若假阴性成本 C_FN、假阳性成本 C_FP,简单期望成本是 C_FN×FN(t)+C_FP×FP(t),还可加入人工审核成本与延迟。拒答区间可设为 t_low 到 t_high:低于下界自动放行,高于上界自动拦截,中间进入人工或补充证据流程。
最小练习
- 手算上面的混淆矩阵,并把基准率改为 5%,其他条件暂时不变。
- 为 8 个合成分数和标签选两个阈值,分别计算 FP、FN。
- 假设 FN 成本是 FP 的 20 倍,比较两个阈值的简单决策损失。
- 画 score → 自动放行 / 人工复核 / 自动拦截 三段图。
- 明确写出:分数不是概率时,不能直接作频率解释。
常见误区
- 把 AUC 高理解成每个分数都校准良好。
- 只报告比例,不报告 FP、FN 的绝对工作量。
- 在新人群中沿用旧阈值,却不检查基准率和成本变化。
- 把 ECE 低当作模型一定有判别力;恒定输出基准率也可能很校准。
- 把拒答视为逃避,忽略高风险场景中补充证据的价值。
金融场景连接
AML 告警不是最终定罪。模型分数应先进入阈值与工作流,再结合规则、证据和人工判断。校准使资源规划更可解释,例如估计某分数段预计阳性比例;决策损失则把漏报、误报和审核容量放在同一框架中。
自检问题
- 为什么罕见事件中高 accuracy 几乎没有说明力?
- 判别、校准、阈值分别回答什么问题?
- ECE 为什么会受分箱策略影响?
- 何时设置拒答区间比单一阈值更合理?
专业课程对齐
- Stanford CS229 Materials:对应逻辑回归、概率判别模型与决策边界,先建立分数经过 sigmoid 成为条件概率的数学含义。
- MIT 6.S191:对应分类损失与模型输出,观察 logits、概率和类别决策是三个不同层次。
- PyTorch Tutorials:对应二分类训练示例,用于核对 logits、交叉熵与推理阈值在代码中的位置。
深入学习提示
先精读 CS229 的逻辑回归推导,再看 6.S191 的分类流程,最后选读 PyTorch 实现。公式上重点比较 p=σ(z)、对数损失与阈值决策 p≥t:训练损失约束概率质量,阈值才把概率转成行动。画 reliability diagram 时同时看分箱样本量,避免少量样本制造“完美校准”。反例包括准确率相同但一个模型过度自信、AUC 较高却在业务阈值处漏报严重、全体校准良好但关键子群失准。代码观察点是不要对已经过 sigmoid 的概率再次使用接收 logits 的损失;还要区分 calibration、discrimination 和 decision utility,三者不能互相替代。
学后填写区
- 手算类别不平衡例:____
- 我的 score→decision 图:____
- 拟采用的成本假设:____
- 仍不清楚的指标:____
- 实际学习日期与用时:____