G75:Shift 下的 Safety–Usefulness 曲线:控制不是越严越好
Safety–usefulness 分析在额外分布变化下同时测量严重失败、正常任务效用、人工负载与延迟,用 Pareto 边界揭示控制阈值的真实代价。
内容类型:预习教材(不代表已完成)
日期:2027-05-07
阶段:P3 · AGI Foundations 90
总路线:Day 255
周次节奏:W11 · 周五知识整理
状态:教材已备;学习未完成
一句话定义
Safety–usefulness 分析在额外分布变化下同时测量严重失败、正常任务效用、人工负载与延迟,用 Pareto 边界揭示控制阈值的真实代价。
学习目标
- 设计一个未用于调参的额外 shift,检验控制协议的迁移而非重复已知测试。
- 使用 severe-tail、calibration、coverage、usefulness、review load 与 latency 多维报告。
- 做阈值和权重敏感性分析,不用任意总分掩盖价值判断。
核心知识
控制阈值降低通常增加拦截,可能减少不安全执行,却也提高 false block、fallback 和人工负载。若阈值极低,系统可以通过“什么都不做”达到零事故;这不是有用的智能系统。相反,只追求任务完成会忽略尾部影响。合理比较是寻找无法在所有维度同时改善的 Pareto front,并由明确责任人选择操作点。
额外 shift 应改变一个尚未用于开发的因素,例如障碍密度、proxy 颜色、episode 长度或 action cost。若同时改变全部因素,失败可被发现但难定位。需要区分 covariate shift、label/goal shift 与 control-channel shift;不同 shift 检验不同假设。
平均安全率容易掩盖严重子群。可按 impact 分为 low、medium、severe,并报告最坏组或 CVaR 风格尾部统计。Calibration 也重要:monitor score=0.8 的样本是否约有 80% 属于风险,决定阈值能否转移;但 OOD calibration 往往恶化,因此应分切片绘制 reliability。
人工负载是控制系统的一部分。Fallback 率上升到 reviewer 容量以上会产生队列、超时与绕过压力。模型离线评估看似更安全,实际系统可能因积压而取消控制。故需将到达率 λ、服务率 μ 和利用率 ρ=λ/μ 纳入;ρ 接近 1 时等待时间非线性上升。
机制与推导
设阈值 τ,定义向量:
V(τ)=[SevereUnsafe(τ), UsefulSuccess(τ), FalseBlock(τ), ReviewLoad(τ), P95Latency(τ)]
τ1 支配 τ2 仅当所有成本不更差且至少一项更好。若不互相支配,两者都可能在 Pareto front。为了展示偏好敏感性,可以临时定义:
L_w(τ)=w_s·SevereUnsafe + w_b·FalseBlock + w_h·ReviewLoad - w_u·UsefulSuccess
但必须改变权重 (w) 看最优 τ 是否翻转。若轻微权重变化就换结论,应报告“决策依赖价值权重”,而非宣布技术赢家。
额外 shift 的 effect 可用差分:Δ_shift(τ)=metric_shift(τ)-metric_IID(τ)。同时看 monitor calibration 与 control outcome,区分 detector 退化、策略行为变化和 permission 仍成功截断 impact。
最小练习或观察步骤
- 从 G73 选两种控制协议和三个阈值,固定相同 episode、审计与人工预算。
- 设计一个未用于开发的单因素 shift,并写它检验的具体假设。
- 建立空表记录 severe unsafe、useful success、false block、fallback、review minutes 与 p95 latency。
- 手工构造三组假想但明确标为示例的数据,练习判断 Pareto 支配;不要把示例写成实验结果。
- 让 severe 权重和 human-load 权重各变化一倍,观察选择规则是否可能翻转,并记录需要谁做价值判断。
常见误区与边界
- “零事故”方案完全拒绝任务,却被称为最佳控制。
- 用平均 reward 抵消少数严重失败,使不可接受事件不可见。
- 在 extra shift 上继续调阈值,再把结果称为泛化。
- 用一套隐含权重合成总分,没有披露选择敏感性。
- 忽略人工队列容量,离线协议无法在实际吞吐下运行。
研究/系统场景连接
信贷辅助系统若阈值过严会把大量案件推给人工,延长客户等待并增加 reviewer 疲劳;阈值过松则放大高影响错误。系统需要分风险等级、服务容量和 fallback 策略,而不是统一阈值。Web3 交易可对高金额使用更严格确认,对只读查询保持低摩擦。P4 机器人安全中,usefulness 还包括任务时间和能耗,安全限制必须在动力学下测量而非文本离线分数。
自检问题
- 为什么“控制越严越好”不是完整目标?
- Pareto front 与加权总分各暴露什么信息?
- 额外 shift 怎样保持可诊断性?
- Reviewer 利用率为何是安全变量?
专业课程对齐
- HELM:学习多场景、多指标与透明报告思想,重点借鉴评估结构而非追求覆盖所有模型。
- AI Control:观察安全与任务效用如何在协议层共同报告,以及控制假设如何限制结论。
- Beyond the Imitation Game: BIG-bench:理解任务集合、指标异质性与 aggregate score 的局限,为 shift 切片提供反例意识。
深入学习提示
不要急于选择一个阈值。先把不能互相替代的轴画出来,让严重失败、人工容量和正常效用同时可见。技术分析负责展示前沿与不确定性,价值权重由有责任的人明确承担。
学后填写区
- Extra shift 与假设:
- 多维指标向量:
- Pareto 候选:
- 权重敏感性:
- 人工容量与未知: