返回 S01~S90 教材库
S68 · 总 Day 158教材已备 ≠ 学习已完成

S68:W10 发布决策小结:Eval、Risk Tier、Evidence、Shadow、Canary 与 Rollback

W10 的主线是将“一个版本分数更高”改写为“一个风险分层的系统变更,在逐步暴露中累积了哪些证据,由谁依何种取舍决定扩大、暂停或回滚”。

2027-01-29

内容类型:预习教材(不代表已完成)
日期:2027-01-29
阶段:P2 · AI Systems Engineering 90
总路线:Day 158
周次节奏:W10 · 周五知识整理
状态:教材已备;学习未完成

一句话定义

W10 的主线是将“一个版本分数更高”改写为“一个风险分层的系统变更,在逐步暴露中累积了哪些证据,由谁依何种取舍决定扩大、暂停或回滚”。

学习目标

  1. 串联 eval contract、release record、risk tier、shadow/canary 与 rollback。
  2. 生成一份轻量发布决策问题清单,而不是巨型 gate。
  3. 用 evidence freshness、independence、coverage、reversibility 和 owner 审视决定质量。

核心知识

一次 release 的最小链条是:change hypothesis→versioned bundle→offline evidence→shadow evidence→limited exposure→decision→observation→rollback/continue。其中任何一步都可返回 investigate,而不需为了流程完整强行 promote。

Risk tier 影响证据和暴露方式。只读摘要、客服建议、可写工单、金融报送、钱包签名的错误严重性与可恢复性不同,不应共用相同的流量比例和观察窗口。高风险不一定意味着更多指标,而是更强的 independent evidence、更小 blast radius、更明确 decision rights 与更快的 safe fallback。

Evidence quality 至少看五点:是否与当前 bundle 对应;是否新鲜;是否覆盖关键 slices;是否与优化信号独立;是否记录失败和缺失。LLM judge 、human review、deterministic verifier、runtime telemetry 和 delayed outcome 可相互补充,但不是数量越多就越独立。

Rollback readiness 要在扩大前回答:回到哪个 bundle;旧 bundle 是否兼容当前 state/schema;已产生副作用怎样 remediation;谁有权停止;如何证明流量真的切回。没有可验证 fallback 的 canary,blast radius 再小也不等于可控。

机制与推导

发布证据可用简化向量表示:

E = (quality, safety, reliability, latency, cost, human_load, coverage, uncertainty)

证据向量不是自动决策。决策也受 risk tier r、exposure x、reversibility v 和 organizational capacity h 影响:D=f(E,r,x,v,h)。这解释了为什么同一质量 delta 在只读摘要中可以 canary,在不可逆交易中可能必须 hold。

最小练习或观察

  1. 画一张 W10 发布路径,将 S64 生命周期、S65 record、S66 比较与 S67 取舍放在对应节点。
  2. 只保留 10 个问题:变更、baseline、evidence、slice、risk、exposure、owner、stop、rollback、outcome。
  3. 用一个低风险和一个高风险案例回答清单,观察哪些条目不同。
  4. 标出每种证据的时间范围与不能回答的问题。
  5. 本日不设考试或通过 gate;模糊点直接留在复习清单。

常见误区与边界

  • 问题清单增长到无法使用,反而掩盖高风险决定。
  • 把 risk tier 当作固定产品标签,不考虑 action、data、用户和可恢复性。
  • 不同证据来自同一 judge 或同一数据,却被当成交叉验证。
  • 将“暂停调查”当作流程失败,强迫所有变更得到二元结论。
  • 本周总结是知识整理,不是生产 release policy 审批文件。

系统 / 金融 / Web3 连接

金融零售中,同一 agent 在知识检索、员工建议、客户通知和自动处置上是不同 risk tier。Web3 中,交易解释、构建 unsigned transaction、请求签名和广播也要逐层增强证据与人类权限;不能因为前一层 canary 成功就自动推导后一层安全。

自检问题

  1. risk tier 怎样改变证据、暴露与 rollback 要求?
  2. evidence freshness 和 independence 分别为什么重要?
  3. 为什么 investigate 应是正常决策状态?
  4. 你的 10 个发布问题是否能在两分钟内读完?

专业课程对齐

  • NIST AIRC / AI RMF:精读 Govern、Map、Measure、Manage 的联系,将 owner、context、evidence 和 residual risk 放进发布问题。
  • Google SRE Book:精读 SLO/error budget、canarying 与 incident response,映射 exposure、stop 与 recovery。
  • DORA:选读 software delivery performance、change failure 与 recovery 相关研究,理解快速学习与可恢复性不是对立目标。

深入学习提示

用 NIST 组织问题,用 SRE 组织运行边界,用 DORA 反思变更与恢复。不要把三套资料合并成大型控制表;每套只提取两个能改善当前发布路径图的问题即可。

学后填写区

  • W10 发布路径图:
  • 10 个决策问题:
  • 低/高 risk tier 差异:
  • 证据缺口与复习项:
  • 下周仍想保留的一个联系:
重点主线 · H04 · AI 开发完整工作流本周配套机制实验 · W10 · 发布判断:平均提升掩盖了什么 →详细讲义、离线示例与源码;按需要选读,不新增必交任务。
本页是未来 P2 的预习教材。等 P1 完成并正式进入 P2 后,再填写真实理解、练习结果和不确定项;现在阅读不会改变P1 唯一进度账本