返回 G01~G90 教材库
G76 · 总 Day 256教材已备 ≠ 学习已完成

G76:Alignment Training 与 Deployment Control:两条不同防线

Alignment training 改变模型倾向与行为分布,deployment control 限制一个仍可能失效的模型能观察、决定和执行什么;前者不能替代后者,后者也不证明前者成功。

2027-05-08

内容类型:预习教材(不代表已完成)
日期:2027-05-08
阶段:P3 · AGI Foundations 90
总路线:Day 256
周次节奏:W11 · 周六可选探索
状态:教材已备;学习未完成

一句话定义

Alignment training 改变模型倾向与行为分布,deployment control 限制一个仍可能失效的模型能观察、决定和执行什么;前者不能替代后者,后者也不证明前者成功。

学习目标

  1. 将 SFT、preference optimization、RLHF、constitutional feedback 与 runtime control 放到不同责任层。
  2. 分析训练数据覆盖、reward model、policy shift 与部署权限之间的失效传导。
  3. 设计 defense-in-depth 图,并明确每层的证据、owner 和 residual risk。

核心知识

训练时对齐以数据、反馈或规则改变模型参数,使期望行为概率上升。SFT 模仿示例;preference/RLHF 依据偏好信号优化;constitutional 方法让规则参与 critique 与选择。这些方法受反馈覆盖、奖励代理、标注者差异和分布变化限制,也可能抑制可见行为而不移除条件策略。

部署控制不试图判断模型“内心是否对齐”。它把 model output 视为 proposal,通过 schema、allowlist、最小权限、预算、监控、随机审计、人工批准、fallback、超时和急停决定实际动作。控制层的安全性来自执行器强制边界;只在 prompt 里要求“不要执行”不是 permission control。

两层会相互影响。更好的训练可降低 alert 和人工负载,使控制可运营;更严格的控制可收集失败样本并限制训练未覆盖的后果。但线上日志不能无条件回流训练,否则攻击/偏差会污染下一版;feedback 必须有 provenance、审核与用途限制。

还需分开 evaluation。训练 eval 测行为是否改善,deployment eval 测端到端控制能否阻断,post-deployment monitoring 看新分布和队列。模型通过安全 benchmark 不能授权高风险工具;控制协议通过 toy 测试也不能说明模型目标对齐。

机制与推导

用串联系统表示:

x → aligned_policy π_θ → proposal a → control C(a,x,context) → executed a' → outcome

总体严重失败至少可能来自:policy 生成危险 proposal、control 漏报、权限执行绕过、fallback 失败或 outcome evaluator 漏记。若简化为条件概率:

P(harm)=P(bad proposal)·P(control pass|bad)·P(impact|executed)

Alignment training 主要降低第一项,monitor/audit 降低第二项,permission/sandbox 降低第三项。三项并非独立,但分解能说明投资在哪一层。

Defense-in-depth 表应为每层记录 assumption → control → evidence → bypass → owner → response。例如“签名服务只接受已批准交易 hash”必须由服务端强制并有拒绝日志;模型 prompt 中的金额限制不是同等证据。模型升级时要重新评估第一、二项,权限边界则应默认不随模型能力扩大。

最小练习或观察步骤

  1. 选本地 toy agent,画 training data→policy→proposal→monitor→permission→fallback→outcome。
  2. 给每层写一个失效:反馈偏差、hidden trigger、monitor 漏报、执行旁路、fallback 积压、outcome 延迟。
  3. 将每个指标归入 training eval、control eval 或 monitoring,删除重复和越权结论。
  4. 设计一个模型版本升级场景,列出哪些控制证据失效、哪些硬权限仍应保持。
  5. 写三句边界声明:“行为改善不证明……”“控制成功不证明……”“未观察到失败不证明……”。

常见误区与边界

  • 把拒答率提升写成内部目标已改变或欺骗能力已消失。
  • 将 prompt 规则当作执行器权限,模型输出可直接绕过。
  • Control 成功后放宽权限,却没有新的 impact analysis。
  • 线上反馈自动进入训练,缺少数据谱系和污染检查。
  • 把 defense-in-depth 画成组件堆叠,没有 owner、旁路和响应。

研究/系统场景连接

金融客服模型可通过训练减少不当建议,但账户查询与交易提交仍要由身份、用途和金额权限控制。人工 override 必须区分纠正模型与批准动作。Web3 钱包可让模型构造交易,却由独立模拟、明确预览和用户签名决定执行。进入 P4 后,训练策略与 safety controller 更需分开:学习策略提出动作,经过速度、力矩、碰撞与 workspace 约束后才到 actuator。

自检问题

  1. Alignment training 主要影响风险链哪一项?
  2. 为什么 prompt 中的规则不是硬 permission?
  3. 模型升级后哪些控制假设必须重新验证?
  4. 线上反馈回流训练需要哪些 provenance 边界?

专业课程对齐

  • Constitutional AI:理解规则、self-critique 与反馈训练如何改变行为,同时记录其评估和外推限制。
  • AI Control:将不可信模型前提、trusted components 与 protocol performance 放入部署控制层。
  • ARENA Alignment Science Curriculum:对照 preference training、model organisms 与 control 案例,建立训练—评估—部署三层地图。

深入学习提示

阅读任何安全方法时先问它改变的是参数、输入、监控决定还是执行权限。然后为其写一个绕过路径和一个独立证据。这样能避免把同一层的三个模型过滤器误认为三层防线。

学后填写区

  • Training / control / monitoring 图:
  • 每层假设与旁路:
  • 模型升级影响:
  • Feedback provenance:
  • Residual risk:
本页是未来 P3 的预习教材。等 P1、P2 完成并正式进入 P3 后,再填写真实理解、实验现象与不确定项;现在阅读不会改变P1 唯一进度账本