返回 G01~G90 教材库
G75 · 总 Day 255教材已备 ≠ 学习已完成

G75:Shift 下的 Safety–Usefulness 曲线:控制不是越严越好

Safety–usefulness 分析在额外分布变化下同时测量严重失败、正常任务效用、人工负载与延迟,用 Pareto 边界揭示控制阈值的真实代价。

2027-05-07

内容类型:预习教材(不代表已完成)
日期:2027-05-07
阶段:P3 · AGI Foundations 90
总路线:Day 255
周次节奏:W11 · 周五知识整理
状态:教材已备;学习未完成

一句话定义

Safety–usefulness 分析在额外分布变化下同时测量严重失败、正常任务效用、人工负载与延迟,用 Pareto 边界揭示控制阈值的真实代价。

学习目标

  1. 设计一个未用于调参的额外 shift,检验控制协议的迁移而非重复已知测试。
  2. 使用 severe-tail、calibration、coverage、usefulness、review load 与 latency 多维报告。
  3. 做阈值和权重敏感性分析,不用任意总分掩盖价值判断。

核心知识

控制阈值降低通常增加拦截,可能减少不安全执行,却也提高 false block、fallback 和人工负载。若阈值极低,系统可以通过“什么都不做”达到零事故;这不是有用的智能系统。相反,只追求任务完成会忽略尾部影响。合理比较是寻找无法在所有维度同时改善的 Pareto front,并由明确责任人选择操作点。

额外 shift 应改变一个尚未用于开发的因素,例如障碍密度、proxy 颜色、episode 长度或 action cost。若同时改变全部因素,失败可被发现但难定位。需要区分 covariate shift、label/goal shift 与 control-channel shift;不同 shift 检验不同假设。

平均安全率容易掩盖严重子群。可按 impact 分为 low、medium、severe,并报告最坏组或 CVaR 风格尾部统计。Calibration 也重要:monitor score=0.8 的样本是否约有 80% 属于风险,决定阈值能否转移;但 OOD calibration 往往恶化,因此应分切片绘制 reliability。

人工负载是控制系统的一部分。Fallback 率上升到 reviewer 容量以上会产生队列、超时与绕过压力。模型离线评估看似更安全,实际系统可能因积压而取消控制。故需将到达率 λ、服务率 μ 和利用率 ρ=λ/μ 纳入;ρ 接近 1 时等待时间非线性上升。

机制与推导

设阈值 τ,定义向量:

V(τ)=[SevereUnsafe(τ), UsefulSuccess(τ), FalseBlock(τ), ReviewLoad(τ), P95Latency(τ)]

τ1 支配 τ2 仅当所有成本不更差且至少一项更好。若不互相支配,两者都可能在 Pareto front。为了展示偏好敏感性,可以临时定义:

L_w(τ)=w_s·SevereUnsafe + w_b·FalseBlock + w_h·ReviewLoad - w_u·UsefulSuccess

但必须改变权重 (w) 看最优 τ 是否翻转。若轻微权重变化就换结论,应报告“决策依赖价值权重”,而非宣布技术赢家。

额外 shift 的 effect 可用差分:Δ_shift(τ)=metric_shift(τ)-metric_IID(τ)。同时看 monitor calibration 与 control outcome,区分 detector 退化、策略行为变化和 permission 仍成功截断 impact。

最小练习或观察步骤

  1. 从 G73 选两种控制协议和三个阈值,固定相同 episode、审计与人工预算。
  2. 设计一个未用于开发的单因素 shift,并写它检验的具体假设。
  3. 建立空表记录 severe unsafe、useful success、false block、fallback、review minutes 与 p95 latency。
  4. 手工构造三组假想但明确标为示例的数据,练习判断 Pareto 支配;不要把示例写成实验结果。
  5. 让 severe 权重和 human-load 权重各变化一倍,观察选择规则是否可能翻转,并记录需要谁做价值判断。

常见误区与边界

  • “零事故”方案完全拒绝任务,却被称为最佳控制。
  • 用平均 reward 抵消少数严重失败,使不可接受事件不可见。
  • 在 extra shift 上继续调阈值,再把结果称为泛化。
  • 用一套隐含权重合成总分,没有披露选择敏感性。
  • 忽略人工队列容量,离线协议无法在实际吞吐下运行。

研究/系统场景连接

信贷辅助系统若阈值过严会把大量案件推给人工,延长客户等待并增加 reviewer 疲劳;阈值过松则放大高影响错误。系统需要分风险等级、服务容量和 fallback 策略,而不是统一阈值。Web3 交易可对高金额使用更严格确认,对只读查询保持低摩擦。P4 机器人安全中,usefulness 还包括任务时间和能耗,安全限制必须在动力学下测量而非文本离线分数。

自检问题

  1. 为什么“控制越严越好”不是完整目标?
  2. Pareto front 与加权总分各暴露什么信息?
  3. 额外 shift 怎样保持可诊断性?
  4. Reviewer 利用率为何是安全变量?

专业课程对齐

  • HELM:学习多场景、多指标与透明报告思想,重点借鉴评估结构而非追求覆盖所有模型。
  • AI Control:观察安全与任务效用如何在协议层共同报告,以及控制假设如何限制结论。
  • Beyond the Imitation Game: BIG-bench:理解任务集合、指标异质性与 aggregate score 的局限,为 shift 切片提供反例意识。

深入学习提示

不要急于选择一个阈值。先把不能互相替代的轴画出来,让严重失败、人工容量和正常效用同时可见。技术分析负责展示前沿与不确定性,价值权重由有责任的人明确承担。

学后填写区

  • Extra shift 与假设:
  • 多维指标向量:
  • Pareto 候选:
  • 权重敏感性:
  • 人工容量与未知:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本