Online Experimentation / CUPED:AI Release Science
AI Release Science 是把模型、prompt、RAG、agent、tool policy 和推荐排序等变更,从“感觉更好”推进到“在真实流量中有统计证据,并且没有越过风险护栏”。它不是增长实验的同义词,而是生产变更治理系统。
Online Experimentation / CUPED / Release Science 解读
核心问题: AI 产品上线不能只靠离线 eval、主观体验或一次性红队。如何把 A/B、CUPED、guardrail、shadow launch、ramp、champion-challenger 和 release gate 组合成可停止、可回滚、可审计的发布科学?
Source Anchors
| Source | Link | 用途 |
|---|---|---|
| Kohavi et al. online controlled experiments | https://www.exp-platform.com/Pages/OnlineControlledExperiments.aspx | 理解线上受控实验的产品和统计基础 |
| Microsoft ExP platform | https://www.microsoft.com/en-us/research/project/experimentation-platform-exp/ | 理解大规模实验平台的组织和工程形态 |
| CUPED paper | https://www.exp-platform.com/Documents/2013-02-CUPED-ImprovingSensitivityOfControlledExperiments.pdf | 理解用实验前数据降低方差 |
| Trustworthy Online Controlled Experiments | https://www.cambridge.org/core/books/trustworthy-online-controlled-experiments/ | 理解可信实验、陷阱和决策文化 |
| NIST AI RMF | https://www.nist.gov/itl/ai-risk-management-framework | 将实验发布纳入风险测量和治理 |
核心导读
AI Release Science 是把模型、prompt、RAG、agent、tool policy 和推荐排序等变更,从“感觉更好”推进到“在真实流量中有统计证据,并且没有越过风险护栏”。它不是增长实验的同义词,而是生产变更治理系统。
离线 eval 回答样本表现,线上实验回答真实流程表现;shadow 和 ramp 控制影响范围,guardrail 和 stop rule 控制损害,CUPED 等方差降低方法提高低流量场景中的识别能力。高阶能力是把这些机制连成发布链路,而不是孤立使用某个 A/B 工具。
问题定义
AI 系统的发布风险来自多个层面:
- 模型版本变化会改变准确率、延迟、成本和偏差。
- Prompt 或 system instruction 变化可能改变语气、合规边界和拒答行为。
- RAG 的 chunking、embedding、reranker 变化可能提高召回,也可能引入权限泄露和过期引用。
- Agent planner 和 tool policy 变化可能提高自动化率,也可能绕过人工审批。
- 推荐和 next-best-action 变化可能提升转化,也可能伤害适当性、公平性和长期价值。
实验科学要回答的问题不是“新版本是否更先进”,而是:
在预定义人群、随机化单位、指标窗口和风险护栏下,
新版本是否带来可接受的不确定性内的净增量价值?
对金融零售尤其关键的是低频高损害事件。样本量足以判断点击率,不代表足以判断权限泄露、误拒、欺诈漏拦、投诉或监管风险。
核心原理
线上受控实验的基础是随机化、可比性和预先定义的决策规则。
| 原理 | 关键含义 |
|---|---|
| Randomization | 让 treatment/control 在期望上可比,减少选择偏差 |
| Unit of randomization | user、case、employee、team、merchant、branch 的选择决定干扰风险 |
| Primary metric | 用少数主指标判断目标是否达成,避免事后挑指标 |
| Guardrail metrics | 用风险、成本、延迟、投诉、权限和公平性指标限制损害 |
| CUPED | 使用实验前协变量扣除可解释波动,提高灵敏度 |
| Sequential discipline | 分析节奏和停止规则要预定义,避免反复窥探造成误判 |
CUPED 的产品直觉是: 如果实验前的行为能解释实验后的指标,就把这部分可解释波动从 outcome 中扣除,从而更快看到真实 treatment effect。它适合低流量、高成本或波动大的 AI 发布,但不修复随机化错误、埋点错误、选择偏差和处理后变量污染。
AI 发布通常采用分层链路:
offline eval
-> replay / simulation
-> shadow launch
-> limited ramp
-> online experiment
-> decision review
-> rollout / rollback / iterate
系统/架构模型
AI experimentation platform 不是单个实验页面,而是一组生产控制面:
experiment registry
-> model/prompt/config versioning
-> traffic router and feature flags
-> trace and event instrumentation
-> metric pipeline
-> guardrail monitor and stop-rule engine
-> analysis workspace
-> decision log and release gate
关键组件:
| 组件 | 职责 |
|---|---|
| Experiment registry | 记录假设、随机化单位、版本、指标、样本、owner 和审批 |
| Versioning layer | 固定 model、prompt、retrieval、tool policy、UI 和配置版本 |
| Traffic router | 支持 shadow、canary、ramp、A/B、holdout 和 champion-challenger |
| Trace store | 保存 case-level 输入、输出、检索、工具调用、人工 override 和结果 |
| Metric pipeline | 计算主指标、护栏、slice、延迟 reward 和长期指标 |
| Guardrail monitor | 检测权限泄露、投诉、成本、延迟、安全和公平性异常 |
| Release gate | 把实验结果转成 ship、rollback、iterate、extend 或 inconclusive 决策 |
生产实验需要把分析环境和发布环境连接起来。否则团队会出现“实验看起来成功,但上线配置并不是实验配置”的典型断裂。
关键机制与取舍
| 取舍 | 判断方式 |
|---|---|
| Offline eval vs online experiment | 离线适合筛掉明显回归,真实行为和流程影响必须线上验证 |
| User-level vs case-level randomization | user-level 避免同一用户跨版本污染,case-level 更省流量但可能有干扰 |
| Individual vs cluster randomization | 团队、网点、商户存在互相影响时,cluster 更稳但样本更贵 |
| Primary metric vs guardrail | 主指标决定价值,护栏决定是否允许继续 |
| Fixed horizon vs sequential monitoring | 固定窗口简单可信,序贯监控更早止损但统计设计更复杂 |
| CUPED vs raw outcome | CUPED 提高灵敏度,但协变量必须来自实验前且与处理无关 |
| Full A/B vs champion-challenger | 风控、信贷、KYC 等高风险策略更适合 shadow + challenger + 分层 ramp |
AI 实验还要处理 non-stationarity 和 learning system。若模型会从实验反馈中继续学习,就必须记录学习事件,或在实验期冻结关键版本,否则 treatment 本身会随时间漂移。
证据与控制
可信实验的最低证据包:
| 控制项 | 要求 |
|---|---|
| Pre-registration | 假设、主指标、护栏、随机化单位、窗口和停止规则先写清 |
| Instrumentation audit | 确认埋点、trace、版本和指标定义没有偏差 |
| Sample and variance plan | 说明样本量、方差、CUPED 协变量和可检测效果 |
| Guardrail thresholds | 明确哪些事件立即停止,哪些触发降级或人工 review |
| Slice analysis | 按客群、渠道、地区、风险等级、员工队伍、产品分层 |
| Decision memo | 记录效果大小、不确定性、风险、例外和最终发布决定 |
| Rollback evidence | 回滚路径、配置版本和影响范围可追溯 |
Stop rule 示例:
Stop or freeze ramp if:
permission leakage > 0
high-risk tool approval bypass > 0
critical safety incident > 0
complaint rate crosses threshold
p95 latency violates SLO for two consecutive windows
manual review queue exceeds operating capacity
AI产品/金融零售场景
RAG 知识助手升级
offline retrieval eval
-> shadow answer generation
-> employee pilot ramp
-> A/B on task success
-> guardrails: permission leakage, citation freshness, latency, cost
不要只看 retrieval hit rate。真正的发布证据应包括任务完成、引用有效性、权限控制、人工修正率和处理时长。
支付欺诈 Champion-Challenger
新模型先 shadow scoring,比较决策 diff,再对低风险 segment 做小比例 challenger。实验必须按商户、金额、风险分、设备、客户类型分层观察 false positive、fraud capture、manual review queue 和 complaint。
KYC 抽取模型发布
主指标可以是自动化通过率或字段准确率,但护栏必须覆盖 false accept、false reject、人工负担、PII 处理、文档类型 slice 和地区监管差异。抽取模型上线失败常不是平均准确率低,而是某类证件或某个渠道被系统性误伤。
Agent Tool Rollout
发布路径应从 read-only、draft-only、low-risk tool with approval,再到有限自动执行。每一步都监控 tool misuse、policy violation、human override、rollback event、latency 和成本。
反模式
- 用离线 eval 替代线上实验,忽略真实流程、员工行为和客户反应。
- 只看主指标提升,不设置权限、投诉、成本、延迟、公平性和人工负担护栏。
- 实验过程中反复看很多指标,事后挑选“显著”的结论。
- 用处理后变量做 CUPED 协变量,导致估计污染。
- 随机化单位选错,造成同一客户、员工或商户跨组干扰。
- Ramp 没有 stop rule,事故发生后只能手工排查和回滚。
- 实验成功后没有锁定上线版本,导致生产配置偏离实验配置。
最终心智模型
AI Release Science 是“发布即实验,但实验必须受控”。离线 eval、shadow、ramp、A/B、CUPED、guardrail 和 decision memo 各自解决不同问题: 质量筛查、影响隔离、逐步暴露、因果估计、风险止损和治理留证。
成熟系统的判断标准不是实验平台功能多,而是每一次 AI 变更都能回答: 变了什么、影响谁、如何随机化、证据多强、哪些风险未越界、什么时候停止、如何回滚。
SOTA 状态标注 (2026-07-01)
本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。