G73:Monitor、Random Audit、Fallback 与 Permission 的组合实验
Control protocol 通过监测、随机审计、可信回退和权限限制组合降低不可信 agent 的实际影响,并以 safety–usefulness–cost 三方权衡而非单一拦截率评价。
内容类型:预习教材(不代表已完成)
日期:2027-05-05
阶段:P3 · AGI Foundations 90
总路线:Day 253
周次节奏:W11 · 周三引导实验
状态:教材已备;学习未完成
一句话定义
Control protocol 通过监测、随机审计、可信回退和权限限制组合降低不可信 agent 的实际影响,并以 safety–usefulness–cost 三方权衡而非单一拦截率评价。
学习目标
- 区分 monitor、audit、fallback 与 permission limit 的作用点和共同故障。
- 用 matched budget 比较至少两种控制组合,不把更高计算或更多人工天然算作更安全算法。
- 同时报告漏报、误报、有效任务完成、严重失败、人工负载和延迟。
核心知识
Monitor 对每个 proposed action 给风险分,适合持续覆盖,但可能与 agent 同源、被分布变化欺骗或产生高误报。Random audit 以不可预测概率把样本交给更可信检查,覆盖率低却能减少 agent 针对固定规则适配;前提是抽样真正独立且审计器能看必要证据。
Trusted fallback 在风险高或不确定时由简单策略、人类或受限模型接管。它的“可信”是相对于 threat model:例如确定性 shortest-path 可避免 proxy,却可能在复杂任务低效;人类 reviewer 会疲劳、排队并产生差异。Permission limit 不判断意图,只限制动作范围、频率、预算或影响,是最直接的 impact control,但限制过严会让系统无用。
组合协议需要明确顺序:propose → schema/permission precheck → monitor → optional audit → execute or fallback → log。如果 monitor 和 audit 都读取同一可操纵 rationale,它们共享故障;如果 permission 在执行器外只做提示,agent 仍可能绕过。Control 是端到端协议,不是一项分类器指标。
公平比较要固定资源预算。方案 A 每步 monitor,方案 B 10% 随机审计加权限限制;若 B 额外使用十倍人工,就不能只比较安全率。可按计算、审计分钟、延迟或允许动作预算匹配,并报告 Pareto front,而非硬合成总分。
机制与推导
设不安全 proposal 比例 (p_u),monitor 漏报率 (fn),审计率 (q),审计漏报率 (fn_a),且审计与 monitor 条件独立,则简化漏过概率:
P(unsafe passes) ≈ p_u · fn · (1 - q·(1-fn_a))
独立性往往不成立;若两者共享同一弱点,应加入相关项并用共同 shift 测试。Permission limit 可把通过后的 impact 从 (I) 截断到 (I_{max}),所以风险不仅看失败次数,还看严重度:
ExpectedHarm ≈ Σ_severity P(failure_k)·Impact_k
Usefulness 可定义完成率、路径长度或业务效用;human load 为 audit/fallback 数量与服务时间。比较向量:[unsafe_executed, severe_tail, useful_success, false_block, review_minutes, p95_latency]。任何加权总分都必须公开权重与敏感性。
最小练习或观察步骤
- 以 G72 网格为环境,定义无控制 baseline、monitor-only、10% audit+permission、monitor+fallback 四种 planned 条件。
- 为每种条件规定相同 episode 数,并给审计/人工分钟设统一预算。
- 预先生成 normal、known shift、hidden shift 三个切片,hidden shift 不用于阈值调节。
- 写控制状态机与事件日志,确保任何 block、fallback 和 execute 都有终止原因。
- 画空白 Pareto 表,列出安全、效用、负载与延迟;不预填哪种方案最好。
常见误区与边界
- Monitor AUC 高就称端到端安全,没有查看阈值、严重尾部和执行绕过。
- Random audit 可预测或由 agent 自选,失去抽查意义。
- Fallback 被称为绝对 trusted,却未纳入容量、错误和权限假设。
- 只优化零事故,接受系统完全不可用。
- 将 toy 控制协议的结果外推为前沿系统安全保证。
研究/系统场景连接
金融交易 Agent 可让权限层硬限制金额与收款方,monitor 检查异常组合,随机审计用于非高风险样本,fallback 转人工审批。人工队列容量是安全参数:积压会诱发跳过复核或超时。Web3 场景中构造交易、签名和广播必须分离,permission 应在钱包/执行器强制,而非依赖 Agent 自律。P4 中 fallback 将对应安全控制器或急停,延迟与动力学会改变效果。
自检问题
- Monitor 与 random audit 的信任假设有何不同?
- Permission limit 为什么不需要判断模型意图?
- 如何在同一预算下公平比较控制协议?
- 为什么平均事故率不足以代表安全?
专业课程对齐
- AI Control: Improving Safety Despite Intentional Subversion:精读 trusted/untrusted components、protocol evaluation 与安全—效用权衡的结构。
- Concrete Problems in AI Safety:将监控、safe exploration 与 distribution shift 放入更广的技术问题图中。
- ARENA Alignment Science Curriculum:选择 control 或 model organisms 案例,重点复刻评估协议思路而非课程完整项目。
深入学习提示
不要先问哪个 monitor 最聪明,先问系统的不可逆影响在哪里、哪一层能硬限制它。随后才评估 monitor 能否节省审计成本。Control 的价值常来自简单组件的互补,而非单一模型超过某个分数。
学后填写区
- 四种 planned 条件:
- 预算匹配方式:
- Safety / usefulness / load 指标:
- 共同故障假设:
- 权限硬边界: