返回 S01~S90 教材库
S67 · 总 Day 157教材已备 ≠ 学习已完成

S67:多指标发布取舍:质量提升、延迟成本、Judge Drift 与 Rollback

多指标发布决策是在质量、安全、延迟、成本、覆盖率、人工容量与证据可靠性之间找可解释工作点,而不是将所有量压成一个可被优化的分数。

2027-01-28

内容类型:预习教材(不代表已完成)
日期:2027-01-28
阶段:P2 · AI Systems Engineering 90
总路线:Day 157
周次节奏:W10 · 周四案例与连接
状态:教材已备;学习未完成

一句话定义

多指标发布决策是在质量、安全、延迟、成本、覆盖率、人工容量与证据可靠性之间找可解释工作点,而不是将所有量压成一个可被优化的分数。

学习目标

  1. 用多指标表表达 quality↑ 但 p95/cost↑ 的发布取舍。
  2. 识别 judge drift、input drift、outcome lag、selection bias 和 observability gap 的不同信号。
  3. 设计 promote、hold、limited release、rollback 与 investigate 的非二元决定空间。

核心知识

AI 改动很少只影响一项指标。更强模型可能提高结构完整度,同时增加 TTFT、输出 token 和单位成本;更严格 verifier 可能降低错误放行,也可能提高误拒、人工 backlog 与服务等待。因此每个 metric 都需单位、方向、slice、window、数据新鲜度和 owner。

Judge drift 包含 judge model/version 变化、rubric 变化、prompt template 变化、被评系统学会评分偏好,或数据分布进入 judge 不熟悉区域。当 judge score 上升而 deterministic checks、human sample 或 delayed outcome 不动,不能立即说 candidate 更好;应先对固定 anchor set 并排查 scorer 版本。

Rollback 不只在质量崩溃时使用。成本异常、p99 延迟、tool side effect、PII egress、review queue overload 或无法解释的 scorer drift 都可能导致 hold/rollback。反之,轻微均值退化不一定需要立即全量回滚;可缩小暴露、关闭高风险路径或提高人工复核,同时保留证据。

机制与推导

不必给所有指标加权求和。可使用约束下的 Pareto 思路:先设安全、合规和服务上限,再比较可行候选。

feasible = safety_pass and p95≤budget and unit_cost≤budget and review_load≤capacity

choose among feasible by quality, coverage, uncertainty and reversibility

对 judge 可监控 anchor agreement:drift = disagreement(judge_t, stable_anchor_labels)。这仍只是漂移信号,因为 anchor 可能老化,人工标签也有不确定。outcome lag 要使用 provisional/final 两类证据,避免在真实结果尚未到达时把代理分当成终局。

最小练习或观察

  1. 构造虚拟案例:candidate 的引用正确率 +4pp,p95 +35%,unit cost +60%,人工升级 +8pp。
  2. 建一张表:metric、baseline、candidate、delta、不确定性、严重度、slice、证据新鲜度。
  3. 写三个决定:promote、limited canary、hold/rollback,分别需要什么额外证据。
  4. 加入 judge-v2 上线时间点,检查分数变化是否与 candidate 并发而无法归因。
  5. 只写案例推演,不把虚拟数字当作项目运行结果。

常见误区与边界

  • 设一个综合分,让高流畅度抵消严重事实错误。
  • 只看 p50,忽略 p95/p99 和高风险请求的长尾。
  • judge 版本与 candidate 同时改变,却把分数全归因于 candidate。
  • 把 rollback 解释为失败,从而迟延可恢复决定。
  • 案例表只是决策练习,不是通用阈值、真实 SLO 或经营承诺。

系统 / 金融 / Web3 连接

金融案例中,一个模型可能减少普通案件人工时间,却提高少数高风险案件的误拒;应将风险严重度与 volume 分开。Web3 场景中,更贵的 simulation/provider 可能降低交易失败,但也增加超时和中心化依赖;决策要显示这些系统取舍。

自检问题

  1. 为什么多指标不应默认加权成一个总分?
  2. judge drift 与被评系统退化怎样初步区分?
  3. limited release 比“发/不发”增加了哪些决策空间?
  4. outcome lag 存在时,哪些只能称为 provisional evidence?

专业课程对齐

  • Google SRE Book:精读 SLO、error budget、monitoring 与 canarying releases,用来区分可用性约束与产品质量指标。
  • Full Stack Deep Learning:精读 testing、monitoring、continual learning 与 infrastructure 取舍,将模型分数放回系统成本。
  • NIST AIRC / AI RMF:选读 Measure/Manage 中的指标限制、人类监督和 residual risk,用于撰写决策的风险语言。

深入学习提示

先按 SRE 设系统底线,再用 FSDL 补模型/数据维度,最后用 NIST 检查决策和剩余风险。每写一个推荐决定,都要补一句“在哪个指标或 slice 上,反方决定会更合理”,以暴露取舍而非寻找唯一正解。

学后填写区

  • 案例假设:
  • 多指标取舍表:
  • judge / data / outcome 漂移信号:
  • 决定与反方条件:
  • 需要的下一个证据:
重点主线 · H04 · AI 开发完整工作流本周配套机制实验 · W10 · 发布判断:平均提升掩盖了什么 →详细讲义、离线示例与源码;按需要选读,不新增必交任务。
本页是未来 P2 的预习教材。等 P1 完成并正式进入 P2 后,再填写真实理解、练习结果和不确定项;现在阅读不会改变P1 唯一进度账本