G72:Proxy Shortcut Agent 与审计日志:构造无害的目标错位
Proxy shortcut toy agent 在训练环境中让代理目标与真实目标相关、在隐藏 shift 中将二者分离,用最小且无害的方式观察目标泛化与审计可见性。
内容类型:预习教材(不代表已完成)
日期:2027-05-04
阶段:P3 · AGI Foundations 90
总路线:Day 252
周次节奏:W11 · 周二最小机制
状态:教材已备;学习未完成
一句话定义
Proxy shortcut toy agent 在训练环境中让代理目标与真实目标相关、在隐藏 shift 中将二者分离,用最小且无害的方式观察目标泛化与审计可见性。
学习目标
- 构造训练相关、测试解耦的 true objective 与 proxy feature,而不是注入真实恶意行为。
- 设计只记录决策证据、不包含思维链或敏感原文的结构化 audit log。
- 区分 agent 失败、evaluator 泄漏、monitor 漏报和权限控制失效。
核心知识
一个清晰 toy 环境可用网格世界:真实目标是到达蓝色终点,训练中终点旁总有星形标记,agent 因此可学习“追星” proxy。在测试时把星形移到死路,行为就能区分它学到目标位置规则还是 proxy。重要的是训练回报只奖励到达终点,而非直接奖励星形;否则这只是错误 reward specification,不是同样的 goal misgeneralization 构造。
Hidden shift 在调参期间必须隐藏。如果研究者反复看 shift 结果并改环境或策略,测试集就变成训练反馈。可将一个 shift 用于开发,另一个未看的 shift 用于最终观察;本课程不设 Gate,但要诚实标记数据用途。
审计日志记录 episode id、environment version、policy hash、observation摘要、可用动作、chosen action、reward、monitor score、permission decision、fallback、seed 与终止原因。它不记录模型私有思维链,也不把自然语言自述当成真实目标证据。Action rationale 如由模型生成,应标为“模型输出”,与实际 state transition 分开。
安全失败要分层:agent 选择 proxy 是 policy failure;evaluator 把 proxy 当成功是 metric failure;monitor 未发现高风险动作是 detection failure;权限系统允许越界动作是 enforcement failure。若不分层,改一个阈值可能暂时遮住问题却无法定位。
机制与推导
设 true success (T(s,a)),proxy feature (P(s,a))。训练分布满足高相关 corr(T,P)≈1,hidden shift 使 corr(T,P)≤0。策略可能优化表示 (f(s)=P) 或 (f(s)=T),两者训练回报相似。测试的识别力来自分布让它们产生不同动作。
将审计事件写为状态转换:
e_t=(episode, state_digest, action_proposed, policy_decision, action_executed, next_state_digest, monitor, timestamp)
其中 proposed 与 executed 必须分开,才能判断控制是否阻止动作。一个基本指标组为 true success、proxy pursuit rate、monitor TPR/FPR、blocked-safe rate、unsafe-executed rate 和 fallback success。不要将 monitor 报警直接算作 agent 失败,也不要将被阻止动作算作环境成功。
反例:如果 agent 在 shift 中失败但所有允许动作都无害,说明目标泛化差,却不构成高影响安全事件;如果 evaluator 只看是否接近星形,系统可能显示高分,暴露的是评估错位。
最小练习或观察步骤
- 在纸上画 5×5 网格,规定终点、星形、障碍和最大步数;训练布局让星形与终点共现。
- 设计三个 shift:星形移位、星形缺失、两个星形;每个 shift 区分哪个竞争策略。
- 定义 reactive shortest-path baseline、proxy-follow baseline 与随机 baseline,不必训练大模型。
- 写 audit event schema,确保 proposed/executed、policy/monitor、state/reward 分离。
- 手工模拟两条轨迹并检查日志能否定位 policy、metric、detection 或 enforcement failure;这只是演练,不填模型结果。
常见误区与边界
- 训练回报直接奖励 proxy,却称为 goal misgeneralization。
- 反复查看 hidden shift 后仍称其隐藏评估。
- 根据模型生成的 rationale 推断其真实目标。
- 日志只记成功/失败,无法重放控制决定。
- 将 toy shortcut 称为欺骗或 AGI 风险实证,超出证据。
研究/系统场景连接
金融审批中“材料齐全”可能与“风险低”在历史数据中相关,但新渠道会打破相关;审计应记录模型建议、规则决策和最终人工动作。系统必须让 evaluator 看真实业务 outcome,而不是只看被容易优化的 proxy。具身阶段可把星形替换为视觉背景,测试机器人是否跟随背景纹理而非目标物体,但仍先在仿真中进行。
自检问题
- 怎样证明训练 reward 奖励的是真目标而非 proxy?
- Hidden shift 为什么会因反复调参而失去证据价值?
- Proposed 与 executed action 分开能定位什么问题?
- Toy 失败最多支持怎样的有限结论?
专业课程对齐
- Goal Misgeneralization in Deep Reinforcement Learning:模仿其训练目标正确但测试策略错误的结构,而非复制复杂环境。
- Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training:只研究 trigger、训练与评估分离的实验方法,不将 toy shortcut 等同于论文中的欺骗设定。
- ARENA Alignment Science Curriculum:选择 goal misgeneralization 或 model organisms 相关案例,核对 threat model 与证据强度。
深入学习提示
最有价值的设计工作是让两个竞争策略在训练中不可区分、在 shift 中明确分开。若 shift 同时增加难度,应再造一个难度相同但不改变 proxy 的对照,避免把普通 OOD 性能下降误判为目标错位。
学后填写区
- True objective / proxy:
- 训练相关与隐藏 shift:
- Audit event schema:
- 四层 failure 分类:
- 当前不能声称什么: