S67:多指标发布取舍:质量提升、延迟成本、Judge Drift 与 Rollback
多指标发布决策是在质量、安全、延迟、成本、覆盖率、人工容量与证据可靠性之间找可解释工作点,而不是将所有量压成一个可被优化的分数。
内容类型:预习教材(不代表已完成)
日期:2027-01-28
阶段:P2 · AI Systems Engineering 90
总路线:Day 157
周次节奏:W10 · 周四案例与连接
状态:教材已备;学习未完成
一句话定义
多指标发布决策是在质量、安全、延迟、成本、覆盖率、人工容量与证据可靠性之间找可解释工作点,而不是将所有量压成一个可被优化的分数。
学习目标
- 用多指标表表达 quality↑ 但 p95/cost↑ 的发布取舍。
- 识别 judge drift、input drift、outcome lag、selection bias 和 observability gap 的不同信号。
- 设计 promote、hold、limited release、rollback 与 investigate 的非二元决定空间。
核心知识
AI 改动很少只影响一项指标。更强模型可能提高结构完整度,同时增加 TTFT、输出 token 和单位成本;更严格 verifier 可能降低错误放行,也可能提高误拒、人工 backlog 与服务等待。因此每个 metric 都需单位、方向、slice、window、数据新鲜度和 owner。
Judge drift 包含 judge model/version 变化、rubric 变化、prompt template 变化、被评系统学会评分偏好,或数据分布进入 judge 不熟悉区域。当 judge score 上升而 deterministic checks、human sample 或 delayed outcome 不动,不能立即说 candidate 更好;应先对固定 anchor set 并排查 scorer 版本。
Rollback 不只在质量崩溃时使用。成本异常、p99 延迟、tool side effect、PII egress、review queue overload 或无法解释的 scorer drift 都可能导致 hold/rollback。反之,轻微均值退化不一定需要立即全量回滚;可缩小暴露、关闭高风险路径或提高人工复核,同时保留证据。
机制与推导
不必给所有指标加权求和。可使用约束下的 Pareto 思路:先设安全、合规和服务上限,再比较可行候选。
feasible = safety_pass and p95≤budget and unit_cost≤budget and review_load≤capacity
choose among feasible by quality, coverage, uncertainty and reversibility
对 judge 可监控 anchor agreement:drift = disagreement(judge_t, stable_anchor_labels)。这仍只是漂移信号,因为 anchor 可能老化,人工标签也有不确定。outcome lag 要使用 provisional/final 两类证据,避免在真实结果尚未到达时把代理分当成终局。
最小练习或观察
- 构造虚拟案例:candidate 的引用正确率 +4pp,p95 +35%,unit cost +60%,人工升级 +8pp。
- 建一张表:metric、baseline、candidate、delta、不确定性、严重度、slice、证据新鲜度。
- 写三个决定:promote、limited canary、hold/rollback,分别需要什么额外证据。
- 加入 judge-v2 上线时间点,检查分数变化是否与 candidate 并发而无法归因。
- 只写案例推演,不把虚拟数字当作项目运行结果。
常见误区与边界
- 设一个综合分,让高流畅度抵消严重事实错误。
- 只看 p50,忽略 p95/p99 和高风险请求的长尾。
- judge 版本与 candidate 同时改变,却把分数全归因于 candidate。
- 把 rollback 解释为失败,从而迟延可恢复决定。
- 案例表只是决策练习,不是通用阈值、真实 SLO 或经营承诺。
系统 / 金融 / Web3 连接
金融案例中,一个模型可能减少普通案件人工时间,却提高少数高风险案件的误拒;应将风险严重度与 volume 分开。Web3 场景中,更贵的 simulation/provider 可能降低交易失败,但也增加超时和中心化依赖;决策要显示这些系统取舍。
自检问题
- 为什么多指标不应默认加权成一个总分?
- judge drift 与被评系统退化怎样初步区分?
- limited release 比“发/不发”增加了哪些决策空间?
- outcome lag 存在时,哪些只能称为 provisional evidence?
专业课程对齐
- Google SRE Book:精读 SLO、error budget、monitoring 与 canarying releases,用来区分可用性约束与产品质量指标。
- Full Stack Deep Learning:精读 testing、monitoring、continual learning 与 infrastructure 取舍,将模型分数放回系统成本。
- NIST AIRC / AI RMF:选读 Measure/Manage 中的指标限制、人类监督和 residual risk,用于撰写决策的风险语言。
深入学习提示
先按 SRE 设系统底线,再用 FSDL 补模型/数据维度,最后用 NIST 检查决策和剩余风险。每写一个推荐决定,都要补一句“在哪个指标或 slice 上,反方决定会更合理”,以暴露取舍而非寻找唯一正解。
学后填写区
- 案例假设:
- 多指标取舍表:
- judge / data / outcome 漂移信号:
- 决定与反方条件:
- 需要的下一个证据: