返回 G01~G90 教材库
G74 · 总 Day 254教材已备 ≠ 学习已完成

G74:隐藏触发、OOD 目标与 False Assurance:寻找控制协议的盲点

False assurance 是控制协议在已知测试上表现良好,却因隐藏触发、共同分布偏差、评估泄漏或权限旁路而被误写成一般安全证据。

2027-05-06

内容类型:预习教材(不代表已完成)
日期:2027-05-06
阶段:P3 · AGI Foundations 90
总路线:Day 254
周次节奏:W11 · 周四争议与失败案例
状态:教材已备;学习未完成

一句话定义

False assurance 是控制协议在已知测试上表现良好,却因隐藏触发、共同分布偏差、评估泄漏或权限旁路而被误写成一般安全证据。

学习目标

  1. 区分 backdoor trigger、普通 OOD、goal misgeneralization、sandbagging 与有策略的 monitor evasion。
  2. 设计完全无害的隐藏触发和共同故障测试,不训练真实攻击能力。
  3. 识别“未观察到失败”背后的覆盖率、统计功效、泄漏与可观测性限制。

核心知识

Trigger 是输入或上下文中的条件,使策略切换;backdoor 通常指训练过程刻意植入的条件行为;普通 OOD 失败不要求离散 trigger。Goal misgeneralization 可在没有后门植入时自然出现。Sandbagging 指系统在评估时有能力却表现较差;要证明它需要能力基线、评估条件差异和策略性证据,不能把随机低分都叫 sandbagging。Monitor evasion 更要求 agent 行为针对监控机制适配。

安全研究可构造无害 proxy:例如特殊颜色出现时选择较长路径,最大后果只是 toy 分数下降。不要设计绕过现实安全系统、隐藏真实有害载荷或获取权限的方法。研究目标是测量协议能否发现未纳入调参的条件切换。

共同故障是关键。如果 agent 和 monitor 都在相同数据上训练,二者可能同时把星形 proxy 当真目标;monitor 会认可 agent 的错误行为,表面 disagreement 很低。增加第二个同源模型不一定带来独立性。更强的控制信号可能来自程序化规则、环境真值、随机人工审计或硬权限。

False assurance 也来自样本量。若真实失败率为 0.1%,只测 100 个 episode 很可能看不到;“零失败”不代表概率为零。经典 rule of three 提醒:在 (n) 次独立试验零事件时,约 95% 上界粗略为 3/n,且独立同分布假设常不成立。严重子群覆盖不足时应直接报告未知。

机制与推导

设 trigger 发生率 (p_t),触发后不安全行为率 (p_f),monitor 漏报率 (fn_t),则观察到未拦截事件的概率约为 p_event=p_t·p_f·fn_t。在 (n) 次独立测试中零事件概率:

P(0 events)=(1-p_event)^n

当 trigger 很稀有时,即便系统危险,零事件也可能常见。解决方向不是只增加总样本,而是分层采样 trigger slice,同时保留其真实频率下的总体风险估计。

评估泄漏可表示为控制协议参数 θ 使用了 test (D_h) 的反馈:θ=f(D_train,D_dev,D_h),此时 (D_h) 不再是隐藏证据。协议应冻结后再打开一次 hidden set;若失败,记录而不是继续调到通过后仍称 hidden。

共同故障测试可设计为两个 shift:S1 只改变 agent 相关 proxy,S2 同时改变 agent 与 monitor 共享 proxy。若 S2 的漏报激增,说明组件独立性假设不成立。

最小练习或观察步骤

  1. 为 G72 环境设计一个无害颜色 trigger,只改变路径偏好,不允许任何外部执行。
  2. 将数据分为 dev trigger 和 hidden trigger;写明打开 hidden 后不再用于本次协议调参。
  3. 设计 agent-only shift 与 agent-monitor common shift,预测两者对漏报的不同影响。
  4. P(0)=(1-p)^n 手算 p=0.001 时 n=100、1000、3000 的零事件概率。
  5. 写一份 false assurance 清单:覆盖率、独立性、泄漏、执行旁路、严重度和样本量。

常见误区与边界

  • 所有条件行为都称 deception,没有建立策略性隐瞒证据。
  • 同源 monitor 与 agent 一致就称双重验证。
  • Hidden set 失败后反复调参,最后只报告通过版本。
  • 看到零严重事件就报告“证明安全”,没有概率上界和子群覆盖。
  • 为了逼真而设计现实绕过或有害行为;本课程只允许可逆 toy proxy。

研究/系统场景连接

金融系统中的特殊渠道、月底批处理或新客户群可能是自然 shift;监控若使用同一历史 proxy,会与模型共同失效。控制应加入规则真值、独立抽查和强制权限边界。Web3 测试必须使用无价值本地网络与虚拟签名,不能为了研究 trigger 接触真实资产。P4 中隐藏触发可能来自传感器条件,但研究仍应先在隔离仿真,以最大速度、力和 workspace 硬约束后果。

自检问题

  1. Hidden trigger 与普通 OOD 失败怎样区分?
  2. 为什么两个同源模型可能不是独立防线?
  3. 零事件结果应怎样附带统计边界?
  4. 打开 hidden set 后为何不能继续把它称为隐藏评估?

专业课程对齐

  • Sleeper Agents:研究条件策略、安全训练与持久性的实验结构,严格区分论文证据与本地无害 proxy。
  • AI Control:关注协议在不可信模型和可能规避监控设定中的评估假设、蓝队/红队边界与效用成本。
  • Goal Misgeneralization in Deep Reinforcement Learning:用自然形成的错误目标作为 backdoor 之外的竞争解释。

深入学习提示

把“我们没看到失败”改写成完整句:在多少样本、哪些 trigger 覆盖、什么权限、哪种 monitor、何种严重度下没看到。句子越具体,越容易发现真正未知,也越不容易把有限观察升级为安全保证。

学后填写区

  • 无害 trigger 与最大影响:
  • Dev / hidden 划分:
  • 共同故障 shift:
  • 零事件统计边界:
  • False assurance 风险:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本