M12:判别、校准、阈值与业务决策的一页链路
一个完整的决策链应明确区分“谁风险更高”“分数代表多少风险”“在哪里采取行动”以及“行动后果是否可接受”。
内容类型:预习教材(不代表已完成)
日期:2026-09-04
阶段:P1 · AI Model Engineering 90
周次:W2 · 概率、经典 ML、校准与决策损失
节奏:周五一页小结
状态:教材已备;学习未完成
标签:判别、校准、阈值、业务决策、拒答
一句话定义
一个完整的决策链应明确区分“谁风险更高”“分数代表多少风险”“在哪里采取行动”以及“行动后果是否可接受”。
学习目标
- 用四层图解释 discrimination、calibration、threshold 和 decision。
- 说明模型分数为何不是最终决策。
- 把 W2 的手算、基线和成本案例连接起来。
- 识别仍混淆的一个指标并加入复习清单。
核心知识
第一层是判别:模型是否把阳性总体排在阴性前面。常用 ROC-AUC、PR-AUC 或排序统计,但它们不告诉分数 0.8 是否真有 80% 风险。第二层是校准:相似分数的人群中,预测频率是否接近实际频率。校准依赖人群、时间和数据采样,部署后需要持续重估。
第三层是阈值与策略:根据成本、容量和风险偏好,把连续分数映射为放行、拒答、复核或拦截。第四层是真实决策:策略还可能融合硬规则、客户权限、法规约束和补充证据。模型只提供决策输入,不承担所有制度责任。
这四层可以分别失败:排序差时校准无法创造区分度;排序好但校准差时资源预测不可靠;两者都好但阈值不合适时业务成本仍高;策略合理但执行流程错误时也会产生伤害。诊断必须先定位层级。
机制与整合
建议一页图从左到右绘制:原始特征 → score/ranking → calibrated probability → policy thresholds → action → outcome/cost → monitoring feedback。每个箭头写一个假设:训练与部署分布相近、标签定义稳定、校准集具有代表性、成本可估计、动作执行一致、结果能够回流。
Logistic Regression 可能同时提供排序和概率分数,但并不保证两者都好;MLP 容量更大也不必然更校准;规则可能没有连续概率,却能直接表达禁止条件。W2 的三类基线应在这张链路中各得其所。
拒答也应画入策略层。它把证据不足的样本交给另一条路径,不应和负类混为一谈。覆盖率表示模型自动处理比例,选择性风险表示在已处理样本中的错误,二者通常存在取舍。
最小整理步骤
- 不看资料写下四层的唯一核心问题。
- 用 M10 的三种基线标注它们能直接输出什么。
- 把 M11 的成本矩阵放到 action→outcome 的箭头上。
- 加入基准率漂移对 score→probability 的影响。
- 用 90 秒口述为何“模型分数不是最终决策”。
常见误区
- 用一个综合指标遮蔽四个不同层级的问题。
- 先固定 0.5 阈值,再寻找业务解释。
- 校准后指标改善,就认为因果或公平性问题也解决。
- 把人工复核当作无限容量且零错误的后备系统。
- 一页小结只列术语,没有信息流与反馈环。
金融场景连接
贷款预审批模型可以先排序申请人,再把分数校准为违约概率,随后根据风险偏好和资本成本设定价格或复核区间。但最终决定还受适用法规、可解释理由和客户信息完整性限制,不能只由概率阈值决定。
自检问题
- 一个排序优秀但校准很差的模型还能怎样使用?
- 校准良好但所有人分数相同,为什么仍不实用?
- 拒答覆盖率和选择性风险是什么关系?
- 模型监控应分别为哪几层收集信号?
专业课程对齐
- Stanford CS229 Materials:对应逻辑回归、概率解释与模型选择,为“判别能力不等于概率可信”提供基础。
- MIT 6.S191:对应分类网络、损失与评估,用于串联 logit、概率和预测类别。
- PyTorch Tutorials:对应训练与推理示例,检查模型输出到业务决策之间还缺哪些显式步骤。
深入学习提示
先以 CS229 的概率分类为主线,再看 6.S191 的神经分类流程,PyTorch 只用于对照接口。把整条链拆成四问:排序是否好(discrimination)、概率是否可信(calibration)、何处切分(threshold)、采取什么行动(decision)。公式上分别记录 AUC 所衡量的成对排序、Brier/对数损失对概率误差的惩罚,以及成本矩阵下的期望损失;不要混成一个“综合准确率”。反例包括 AUC 上升但校准恶化、重校准后排序不变、阈值优化后模型参数完全未变、业务容量变化使原阈值失效。建议最后画一页因果链,每层只放输入、输出、假设和一个失败信号,确保讨论模型改进时能指出究竟要改哪一层。
学后填写区
- W2 一页图位置:____
- 90 秒解释中的卡点:____
- 我最易混淆的指标:____
- 下次复习入口:____
- 实际学习日期与用时:____