G71:Alignment Threat Model:先限定风险主体、能力与边界
Alignment threat model 是对系统可能追求的错误目标、可利用的观察与权限、可能受害资产和可接受剩余风险作有限声明,而不是用“模型可能失控”概括一切。
内容类型:预习教材(不代表已完成)
日期:2027-05-03
阶段:P3 · AGI Foundations 90
总路线:Day 251
周次节奏:W11 · 周一概念与论文
状态:教材已备;学习未完成
一句话定义
Alignment threat model 是对系统可能追求的错误目标、可利用的观察与权限、可能受害资产和可接受剩余风险作有限声明,而不是用“模型可能失控”概括一切。
学习目标
- 区分 outer alignment、goal misgeneralization、reward hacking、deception、deployment control 与 governance。
- 写出 actor、asset、objective、capability、access、trigger、impact 和 control assumption 完整威胁链。
- 将 capability evaluation、safety evaluation 与 control evaluation 分成三个证据面。
核心知识
Outer alignment 关心规定的目标是否表达了人类真正意图;reward hacking 指系统利用目标或测量漏洞获得高回报;goal misgeneralization 指训练行为看似正确,但在新分布中内部策略追求错误特征。Deception 更强,要求系统有理由管理观察者信念或在训练/部署间改变行为;不能从一次不诚实文本直接推断稳定欺骗目标。
Training alignment 试图改变模型本身的行为倾向;deployment control 假设模型仍可能不可靠,通过最小权限、监控、审计、fallback、预算和隔离限制后果;governance 决定谁可部署、接受什么风险、如何问责。它们互补却不等价。一个经过安全训练的模型仍需权限边界,一个严格 sandbox 也不证明模型目标良好。
Capability eval 问系统能否完成任务;safety eval 问在触发、对抗或分布变化下是否出现危险策略;control eval 问即使模型有问题,协议能否发现、限制和恢复。只测前者会把高能力误当安全,只测安全 benchmark 则可能遗漏系统权限与人类流程。
Threat model 必须有限:本课程只用本地无害 toy agent,不提供网络、真实凭证、资金、客户数据或物理执行。研究 hidden trigger、shortcut 或 monitor evasion 时,目标是理解测量结构,不构建真实攻击能力。明确不在范围也很重要,例如不能由 toy 实验判断前沿模型是否欺骗。
机制与推导
把一条风险路径写为:
trigger → latent/learned policy → observable action → permission boundary → asset impact
控制可插在不同位置:输入过滤改变 trigger 暴露,行为 monitor 观察 action,random audit 提供不可预测检查,permission limit 限制 impact,trusted fallback 在不确定时接管。若所有控制依赖同一可被操纵信号,它们并非独立防线。
风险不是单一概率。学习用分解可写:
ResidualRisk ≈ P(trigger)·P(failure|trigger)·Impact·Exposure·(1-ControlCoverage)
这些量通常无法精确估计,公式作用是暴露假设。ControlCoverage 又受 false negative、审计率、响应延迟和 bypass path 影响。一个安全主张应是条件式:在任务族 T、权限集合 A、预算 B、监控协议 C 和观察期 O 下,未观察到某失败;不能写“系统安全”。
最小练习或观察步骤
- 选一个只在本地网格世界行动的 toy agent,定义正常目标和一个无害 proxy shortcut。
- 填 threat model:actor、asset、trigger、错误策略、可用观察、允许动作、最大影响和不在范围。
- 分别列 capability、safety、control 三组指标,确保没有用任务成功率替代安全指标。
- 画两条控制链:普通 monitor→拒绝;random audit→trusted fallback,并找共同故障点。
- 写一条条件式安全陈述和三条它不能推出的结论;未运行时标为 H。
常见误区与边界
- 将所有失败叫 alignment,丢失目标、泛化、权限和治理的区别。
- 看到 OOD 行为错误便直接称 deception,没有策略性隐瞒证据。
- 把 sandbox 当作模型安全证明,或把安全训练当作无需 sandbox。
- 用 aggregate pass rate 掩盖严重但稀有的失败子群。
- 将无害 toy trigger 技术外推到真实威胁主体或前沿模型。
研究/系统场景连接
金融零售 Agent 的资产可以是客户数据、交易指令和监管报告;权限应拆成读取、建议、提交审批和不可逆执行。即便回答质量高,control plane 仍要限制金额、收款方、数据域和时间。研究环境则用虚拟资产与本地 action log,所有“攻击”都应可逆。P4 中 permission boundary 会变成 workspace、速度、力矩和 emergency stop,impact 不再只是错误文本。
自检问题
- Goal misgeneralization 与 reward hacking 的差别是什么?
- Safety eval 和 control eval 为什么不能合并?
- 哪些条件必须写进有限安全陈述?
- 多个控制为何可能只有一个共同故障点?
专业课程对齐
- Concrete Problems in AI Safety:把 reward hacking、safe exploration、distribution shift 等宏观担忧转成可研究问题,并识别论文适用时代与边界。
- Goal Misgeneralization in Deep Reinforcement Learning:关注训练成功但测试目标错误的构造,练习区分能力泛化与目标泛化。
- AI Control: Improving Safety Despite Intentional Subversion:理解 control 研究为何在不信任模型的前提下评估协议,而非假设训练已解决目标问题。
深入学习提示
遇到“模型不安全”时,逐词追问:哪个模型版本、在什么环境、拥有什么权限、面对什么 trigger、造成什么可观察后果、谁能停止。无法回答的部分进入 unknowns ledger,而不是用更强形容词补足。
学后填写区
- Toy 系统与资产:
- Threat path:
- Capability / safety / control 指标:
- 条件式安全陈述:
- 不在范围与未知: