返回 Papers
AI 底层逻辑 / 经典论文

Online Experimentation / CUPED:AI Release Science

AI Release Science 是把模型、prompt、RAG、agent、tool policy 和推荐排序等变更,从“感觉更好”推进到“在真实流量中有统计证据,并且没有越过风险护栏”。它不是增长实验的同义词,而是生产变更治理系统。

185ai-foundations/papers/44-online-experimentation-cuped-release-science-ai-products.md

Online Experimentation / CUPED / Release Science 解读

核心问题: AI 产品上线不能只靠离线 eval、主观体验或一次性红队。如何把 A/B、CUPED、guardrail、shadow launch、ramp、champion-challenger 和 release gate 组合成可停止、可回滚、可审计的发布科学?


Source Anchors

SourceLink用途
Kohavi et al. online controlled experimentshttps://www.exp-platform.com/Pages/OnlineControlledExperiments.aspx理解线上受控实验的产品和统计基础
Microsoft ExP platformhttps://www.microsoft.com/en-us/research/project/experimentation-platform-exp/理解大规模实验平台的组织和工程形态
CUPED paperhttps://www.exp-platform.com/Documents/2013-02-CUPED-ImprovingSensitivityOfControlledExperiments.pdf理解用实验前数据降低方差
Trustworthy Online Controlled Experimentshttps://www.cambridge.org/core/books/trustworthy-online-controlled-experiments/理解可信实验、陷阱和决策文化
NIST AI RMFhttps://www.nist.gov/itl/ai-risk-management-framework将实验发布纳入风险测量和治理

核心导读

AI Release Science 是把模型、prompt、RAG、agent、tool policy 和推荐排序等变更,从“感觉更好”推进到“在真实流量中有统计证据,并且没有越过风险护栏”。它不是增长实验的同义词,而是生产变更治理系统。

离线 eval 回答样本表现,线上实验回答真实流程表现;shadow 和 ramp 控制影响范围,guardrail 和 stop rule 控制损害,CUPED 等方差降低方法提高低流量场景中的识别能力。高阶能力是把这些机制连成发布链路,而不是孤立使用某个 A/B 工具。

问题定义

AI 系统的发布风险来自多个层面:

  • 模型版本变化会改变准确率、延迟、成本和偏差。
  • Prompt 或 system instruction 变化可能改变语气、合规边界和拒答行为。
  • RAG 的 chunking、embedding、reranker 变化可能提高召回,也可能引入权限泄露和过期引用。
  • Agent planner 和 tool policy 变化可能提高自动化率,也可能绕过人工审批。
  • 推荐和 next-best-action 变化可能提升转化,也可能伤害适当性、公平性和长期价值。

实验科学要回答的问题不是“新版本是否更先进”,而是:

在预定义人群、随机化单位、指标窗口和风险护栏下,
新版本是否带来可接受的不确定性内的净增量价值?

对金融零售尤其关键的是低频高损害事件。样本量足以判断点击率,不代表足以判断权限泄露、误拒、欺诈漏拦、投诉或监管风险。

核心原理

线上受控实验的基础是随机化、可比性和预先定义的决策规则。

原理关键含义
Randomization让 treatment/control 在期望上可比,减少选择偏差
Unit of randomizationuser、case、employee、team、merchant、branch 的选择决定干扰风险
Primary metric用少数主指标判断目标是否达成,避免事后挑指标
Guardrail metrics用风险、成本、延迟、投诉、权限和公平性指标限制损害
CUPED使用实验前协变量扣除可解释波动,提高灵敏度
Sequential discipline分析节奏和停止规则要预定义,避免反复窥探造成误判

CUPED 的产品直觉是: 如果实验前的行为能解释实验后的指标,就把这部分可解释波动从 outcome 中扣除,从而更快看到真实 treatment effect。它适合低流量、高成本或波动大的 AI 发布,但不修复随机化错误、埋点错误、选择偏差和处理后变量污染。

AI 发布通常采用分层链路:

offline eval
  -> replay / simulation
  -> shadow launch
  -> limited ramp
  -> online experiment
  -> decision review
  -> rollout / rollback / iterate

系统/架构模型

AI experimentation platform 不是单个实验页面,而是一组生产控制面:

experiment registry
  -> model/prompt/config versioning
  -> traffic router and feature flags
  -> trace and event instrumentation
  -> metric pipeline
  -> guardrail monitor and stop-rule engine
  -> analysis workspace
  -> decision log and release gate

关键组件:

组件职责
Experiment registry记录假设、随机化单位、版本、指标、样本、owner 和审批
Versioning layer固定 model、prompt、retrieval、tool policy、UI 和配置版本
Traffic router支持 shadow、canary、ramp、A/B、holdout 和 champion-challenger
Trace store保存 case-level 输入、输出、检索、工具调用、人工 override 和结果
Metric pipeline计算主指标、护栏、slice、延迟 reward 和长期指标
Guardrail monitor检测权限泄露、投诉、成本、延迟、安全和公平性异常
Release gate把实验结果转成 ship、rollback、iterate、extend 或 inconclusive 决策

生产实验需要把分析环境和发布环境连接起来。否则团队会出现“实验看起来成功,但上线配置并不是实验配置”的典型断裂。

关键机制与取舍

取舍判断方式
Offline eval vs online experiment离线适合筛掉明显回归,真实行为和流程影响必须线上验证
User-level vs case-level randomizationuser-level 避免同一用户跨版本污染,case-level 更省流量但可能有干扰
Individual vs cluster randomization团队、网点、商户存在互相影响时,cluster 更稳但样本更贵
Primary metric vs guardrail主指标决定价值,护栏决定是否允许继续
Fixed horizon vs sequential monitoring固定窗口简单可信,序贯监控更早止损但统计设计更复杂
CUPED vs raw outcomeCUPED 提高灵敏度,但协变量必须来自实验前且与处理无关
Full A/B vs champion-challenger风控、信贷、KYC 等高风险策略更适合 shadow + challenger + 分层 ramp

AI 实验还要处理 non-stationarity 和 learning system。若模型会从实验反馈中继续学习,就必须记录学习事件,或在实验期冻结关键版本,否则 treatment 本身会随时间漂移。

证据与控制

可信实验的最低证据包:

控制项要求
Pre-registration假设、主指标、护栏、随机化单位、窗口和停止规则先写清
Instrumentation audit确认埋点、trace、版本和指标定义没有偏差
Sample and variance plan说明样本量、方差、CUPED 协变量和可检测效果
Guardrail thresholds明确哪些事件立即停止,哪些触发降级或人工 review
Slice analysis按客群、渠道、地区、风险等级、员工队伍、产品分层
Decision memo记录效果大小、不确定性、风险、例外和最终发布决定
Rollback evidence回滚路径、配置版本和影响范围可追溯

Stop rule 示例:

Stop or freeze ramp if:
  permission leakage > 0
  high-risk tool approval bypass > 0
  critical safety incident > 0
  complaint rate crosses threshold
  p95 latency violates SLO for two consecutive windows
  manual review queue exceeds operating capacity

AI产品/金融零售场景

RAG 知识助手升级

offline retrieval eval
  -> shadow answer generation
  -> employee pilot ramp
  -> A/B on task success
  -> guardrails: permission leakage, citation freshness, latency, cost

不要只看 retrieval hit rate。真正的发布证据应包括任务完成、引用有效性、权限控制、人工修正率和处理时长。

支付欺诈 Champion-Challenger

新模型先 shadow scoring,比较决策 diff,再对低风险 segment 做小比例 challenger。实验必须按商户、金额、风险分、设备、客户类型分层观察 false positive、fraud capture、manual review queue 和 complaint。

KYC 抽取模型发布

主指标可以是自动化通过率或字段准确率,但护栏必须覆盖 false accept、false reject、人工负担、PII 处理、文档类型 slice 和地区监管差异。抽取模型上线失败常不是平均准确率低,而是某类证件或某个渠道被系统性误伤。

Agent Tool Rollout

发布路径应从 read-only、draft-only、low-risk tool with approval,再到有限自动执行。每一步都监控 tool misuse、policy violation、human override、rollback event、latency 和成本。

反模式

  • 用离线 eval 替代线上实验,忽略真实流程、员工行为和客户反应。
  • 只看主指标提升,不设置权限、投诉、成本、延迟、公平性和人工负担护栏。
  • 实验过程中反复看很多指标,事后挑选“显著”的结论。
  • 用处理后变量做 CUPED 协变量,导致估计污染。
  • 随机化单位选错,造成同一客户、员工或商户跨组干扰。
  • Ramp 没有 stop rule,事故发生后只能手工排查和回滚。
  • 实验成功后没有锁定上线版本,导致生产配置偏离实验配置。

最终心智模型

AI Release Science 是“发布即实验,但实验必须受控”。离线 eval、shadow、ramp、A/B、CUPED、guardrail 和 decision memo 各自解决不同问题: 质量筛查、影响隔离、逐步暴露、因果估计、风险止损和治理留证。

成熟系统的判断标准不是实验平台功能多,而是每一次 AI 变更都能回答: 变了什么、影响谁、如何随机化、证据多强、哪些风险未越界、什么时候停止、如何回滚。


SOTA 状态标注 (2026-07-01)

本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。