返回 G01~G90 教材库
G72 · 总 Day 252教材已备 ≠ 学习已完成

G72:Proxy Shortcut Agent 与审计日志:构造无害的目标错位

Proxy shortcut toy agent 在训练环境中让代理目标与真实目标相关、在隐藏 shift 中将二者分离,用最小且无害的方式观察目标泛化与审计可见性。

2027-05-04

内容类型:预习教材(不代表已完成)
日期:2027-05-04
阶段:P3 · AGI Foundations 90
总路线:Day 252
周次节奏:W11 · 周二最小机制
状态:教材已备;学习未完成

一句话定义

Proxy shortcut toy agent 在训练环境中让代理目标与真实目标相关、在隐藏 shift 中将二者分离,用最小且无害的方式观察目标泛化与审计可见性。

学习目标

  1. 构造训练相关、测试解耦的 true objective 与 proxy feature,而不是注入真实恶意行为。
  2. 设计只记录决策证据、不包含思维链或敏感原文的结构化 audit log。
  3. 区分 agent 失败、evaluator 泄漏、monitor 漏报和权限控制失效。

核心知识

一个清晰 toy 环境可用网格世界:真实目标是到达蓝色终点,训练中终点旁总有星形标记,agent 因此可学习“追星” proxy。在测试时把星形移到死路,行为就能区分它学到目标位置规则还是 proxy。重要的是训练回报只奖励到达终点,而非直接奖励星形;否则这只是错误 reward specification,不是同样的 goal misgeneralization 构造。

Hidden shift 在调参期间必须隐藏。如果研究者反复看 shift 结果并改环境或策略,测试集就变成训练反馈。可将一个 shift 用于开发,另一个未看的 shift 用于最终观察;本课程不设 Gate,但要诚实标记数据用途。

审计日志记录 episode id、environment version、policy hash、observation摘要、可用动作、chosen action、reward、monitor score、permission decision、fallback、seed 与终止原因。它不记录模型私有思维链,也不把自然语言自述当成真实目标证据。Action rationale 如由模型生成,应标为“模型输出”,与实际 state transition 分开。

安全失败要分层:agent 选择 proxy 是 policy failure;evaluator 把 proxy 当成功是 metric failure;monitor 未发现高风险动作是 detection failure;权限系统允许越界动作是 enforcement failure。若不分层,改一个阈值可能暂时遮住问题却无法定位。

机制与推导

设 true success (T(s,a)),proxy feature (P(s,a))。训练分布满足高相关 corr(T,P)≈1,hidden shift 使 corr(T,P)≤0。策略可能优化表示 (f(s)=P) 或 (f(s)=T),两者训练回报相似。测试的识别力来自分布让它们产生不同动作。

将审计事件写为状态转换:

e_t=(episode, state_digest, action_proposed, policy_decision, action_executed, next_state_digest, monitor, timestamp)

其中 proposed 与 executed 必须分开,才能判断控制是否阻止动作。一个基本指标组为 true success、proxy pursuit rate、monitor TPR/FPR、blocked-safe rate、unsafe-executed rate 和 fallback success。不要将 monitor 报警直接算作 agent 失败,也不要将被阻止动作算作环境成功。

反例:如果 agent 在 shift 中失败但所有允许动作都无害,说明目标泛化差,却不构成高影响安全事件;如果 evaluator 只看是否接近星形,系统可能显示高分,暴露的是评估错位。

最小练习或观察步骤

  1. 在纸上画 5×5 网格,规定终点、星形、障碍和最大步数;训练布局让星形与终点共现。
  2. 设计三个 shift:星形移位、星形缺失、两个星形;每个 shift 区分哪个竞争策略。
  3. 定义 reactive shortest-path baseline、proxy-follow baseline 与随机 baseline,不必训练大模型。
  4. 写 audit event schema,确保 proposed/executed、policy/monitor、state/reward 分离。
  5. 手工模拟两条轨迹并检查日志能否定位 policy、metric、detection 或 enforcement failure;这只是演练,不填模型结果。

常见误区与边界

  • 训练回报直接奖励 proxy,却称为 goal misgeneralization。
  • 反复查看 hidden shift 后仍称其隐藏评估。
  • 根据模型生成的 rationale 推断其真实目标。
  • 日志只记成功/失败,无法重放控制决定。
  • 将 toy shortcut 称为欺骗或 AGI 风险实证,超出证据。

研究/系统场景连接

金融审批中“材料齐全”可能与“风险低”在历史数据中相关,但新渠道会打破相关;审计应记录模型建议、规则决策和最终人工动作。系统必须让 evaluator 看真实业务 outcome,而不是只看被容易优化的 proxy。具身阶段可把星形替换为视觉背景,测试机器人是否跟随背景纹理而非目标物体,但仍先在仿真中进行。

自检问题

  1. 怎样证明训练 reward 奖励的是真目标而非 proxy?
  2. Hidden shift 为什么会因反复调参而失去证据价值?
  3. Proposed 与 executed action 分开能定位什么问题?
  4. Toy 失败最多支持怎样的有限结论?

专业课程对齐

深入学习提示

最有价值的设计工作是让两个竞争策略在训练中不可区分、在 shift 中明确分开。若 shift 同时增加难度,应再造一个难度相同但不改变 proxy 的对照,避免把普通 OOD 性能下降误判为目标错位。

学后填写区

  • True objective / proxy:
  • 训练相关与隐藏 shift:
  • Audit event schema:
  • 四层 failure 分类:
  • 当前不能声称什么:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本