DPO / Constitutional AI:偏好优化与行为治理
Preference optimization 解决的不是“模型是否知道事实”,而是“在多个可能回答中,模型默认更倾向哪一种行为”。SFT 用示范建立基本任务格式,RLHF 用偏好训练 reward model 再优化策略,DPO 直接提高 chosen answer 相对 rejected answer 的概率,Constitutional AI 则把原则、批评和修订引入反馈生成。
Paper 11: DPO, Constitutional AI, and Preference Optimization
Source Anchors
| Source | Link | 读它要抓住什么 |
|---|---|---|
| InstructGPT / RLHF | https://arxiv.org/abs/2203.02155 | SFT、reward model、PPO-based RLHF 的经典三段式 |
| Direct Preference Optimization | https://arxiv.org/abs/2305.18290 | 用 pairwise preference 直接优化 policy 的 DPO 思路 |
| Constitutional AI | https://arxiv.org/abs/2212.08073 | 用原则、critique、revision 和 RLAIF 扩展安全训练 |
| Proximal Policy Optimization | https://arxiv.org/abs/1707.06347 | 理解 RLHF 中 PPO 作为策略优化算法的背景 |
| 本篇默认已经理解基础 RLHF。这里的重点不是重新讲一遍“模型更安全”,而是拆开:偏好从哪里来,偏好如何被优化,优化为什么有效,以及偏好治理在企业系统里应该放在哪一层。 |
核心导读
Preference optimization 解决的不是“模型是否知道事实”,而是“在多个可能回答中,模型默认更倾向哪一种行为”。SFT 用示范建立基本任务格式,RLHF 用偏好训练 reward model 再优化策略,DPO 直接提高 chosen answer 相对 rejected answer 的概率,Constitutional AI 则把原则、批评和修订引入反馈生成。
它的价值在于把组织希望的默认行为变成可训练信号:更诚实地承认不确定性,更少编造事实,更稳定地拒绝越权请求,更清楚地区分教育性解释和个性化建议,更愿意在高风险时升级人工。DPO 降低了传统 PPO-based RLHF 的部分工程复杂度,Constitutional AI 让安全原则更可读、可审查、可版本化。
但偏好优化会放大偏好数据、reviewer guideline、constitution 和 eval 中的缺陷。它不能提供最新政策,不能判断用户权限,不能审批资金动作,也不能替代法律、合规或模型风险责任。金融零售落地时,偏好优化只能塑造语气、拒答、澄清、升级和表达边界;事实来源、权限控制、审批责任、证据链和 release gate 必须由运行时系统治理。
1. 核心问题:偏好不是事实,也不是权限
Base language model 学到的是语言分布。 它会生成概率上合理的下文,但不天然知道哪个回答更有帮助、更诚实、更安全、更合规。 SFT 通过示范答案让模型学会基本任务格式。 RLHF 通过人类偏好让模型更接近人希望看到的助手行为。 DPO 和 Constitutional AI 则进一步回答:
- 能否少依赖复杂强化学习链路?
- 能否直接利用 chosen / rejected 这类偏好比较?
- 能否把安全原则显式化,而不是只藏在标注员直觉里?
- 能否用 AI feedback 扩展反馈规模,同时保留人类治理? 金融零售场景中,“更好的回答”不是一个单维度概念。 财富建议里,直接告诉客户买什么可能看起来 helpful,但会越过持牌建议边界。 信贷拒绝解释里,语言越具体不一定越好;如果模型编造原因,会制造公平信贷和 adverse action 风险。 AML narrative 里,强烈措辞可能让报告看起来有力,但如果把可疑行为写成确定犯罪,会破坏审计和法律边界。 因此,preference optimization 的核心价值不是让模型“拥有正确价值观”。 它的价值是把组织希望的默认行为、语气、边界和升级倾向转成训练信号。 但事实、权限、动作和责任仍必须由系统控制。
2. 技术贡献:从示范到偏好,再到原则化反馈
2.1 SFT:先建立可模仿的任务行为
Supervised fine-tuning 使用高质量 prompt-answer 样例训练模型。 它让模型学会:
- 按指令回答。
- 使用合适格式。
- 遵守基本拒答边界。
- 形成产品希望的语气。
- 在常见任务上减少漂移。 SFT 的优点是直接、稳定、可审查。 一条样例写得好不好,业务、法务、合规和运营都能读懂。 它的缺点是示范成本高,边界覆盖有限。 很多场景没有唯一标准答案,人更容易判断两个答案哪个更好,而不是从零写一个完美答案。
2.2 PPO-based RLHF:把偏好变成奖励再优化
经典 RLHF 通常分三步。 第一步是 SFT,得到初始 instruction-following model。 第二步是收集同一 prompt 下多个回答的偏好排序,训练 reward model。 第三步是用 PPO 优化语言模型,让它生成 reward model 更喜欢的回答,同时用 KL 约束防止偏离参考模型太远。 这个路线的重要贡献是把开放式人类偏好转成可优化目标。 它让模型不仅模仿示范,还能在多种候选回答之间学习组织偏好。 但 PPO-based RLHF 的工程链路复杂。 它需要 reward model、采样、策略优化、KL 控制和训练稳定性调参。 更关键的是,reward model 只是偏好的近似。 如果 reward model 错了,模型可能学会讨好 reward model,而不是真正提高任务质量。
2.3 DPO:直接优化 chosen 相对 rejected 的概率
DPO 的直觉是:在一定推导下,可以绕过显式 reward model 和在线 RL 过程,直接用 pairwise preference 数据优化模型。 训练样本通常是:
prompt
chosen_answer
rejected_answer
DPO 的目标不是给回答打一个显式奖励分,而是提高 chosen answer 相对 rejected answer 的概率。 它还保留对 reference model 的约束,避免模型因为偏好优化过度偏离原有能力。 从工程角度看,DPO 的吸引力在于链路更短、更像监督训练,通常比 PPO-based RLHF 更容易落地。 从治理角度看,DPO 把关注点更集中地推回到 preference dataset。 如果 chosen / rejected 样本质量差,DPO 会更稳定地学习坏偏好。
2.4 Constitutional AI:把原则显式化
Constitutional AI 的核心是使用一组明确原则指导模型批评和修订自己的输出。 典型流程可以拆成:
- 模型生成初始回答。
- 模型根据 constitution 原则 critique 这个回答。
- 模型依据 critique 生成 revision。
- revision 样本用于训练更安全的模型。
- 后续可以用 AI feedback 扩展 preference learning。 这不是让模型自动替代伦理或合规团队。 它的价值是把隐含偏好变成可读、可审查、可版本化的原则。 金融零售中,这些原则可能来自:
- 隐私和数据最小化政策。
- 财富建议和适当性边界。
- 信贷解释和公平信贷规则。
- AML 调查语言规范。
- 投诉处理和客户伤害补救标准。
2.5 RLAIF:用 AI feedback 扩展反馈,但不交出责任
RLAIF 使用 AI 生成或辅助生成偏好反馈。 它可以降低人工标注成本,减少人工直接处理有害内容的负担,也能更快覆盖大量边界样本。 但 AI feedback 会继承模型盲点。 它可能奖励格式漂亮但事实错误的回答。 它可能对专业合规边界理解不足。 它也可能被 prompt 注入或表面措辞诱导。 因此,RLAIF 更适合作为扩展机制,而不是最终责任主体。 原则由人定义,高风险样本由专家抽检,线上失败样本进入回归集。
3. 机制原理:偏好数据是系统资产
3.1 Preference data 的基本形态
最小偏好样本包含 prompt、chosen、rejected。 企业场景中,样本还应该包含:
- risk_tier。
- policy_source。
- reviewer_guideline_version。
- reason_for_choice。
- failure_tags。
- expected_escalation。
- allowed_claims。
- forbidden_claims。 没有这些 metadata,偏好数据很难治理。 当模型行为出错时,团队无法判断是样本错误、原则冲突、reviewer 漂移,还是训练过度。
3.2 Reviewer guideline 决定偏好质量
偏好比较表面上是“两个答案选一个”。 实质上,它要求 reviewer 在多个维度之间做取舍:
| 维度 | 在金融零售中的含义 | 常见坏偏好 |
|---|---|---|
| 有用性 | 是否真正帮助完成任务 | 给很多泛泛背景但没有解决问题 |
| 真实性 | 是否承认不确定,区分事实和推断 | 编造政策、账户状态或审批原因 |
| 合规性 | 是否遵守监管和内部政策 | 用免责声明包装越权建议 |
| 客户权益 | 是否避免误导、羞辱和不公平影响 | 过度推责或压制投诉 |
| 升级边界 | 是否在高风险时转人工 | 模型自行裁定投诉、授信或 SAR |
| 可追溯性 | 关键断言是否有来源 | 语言流畅但没有证据 |
| 如果 guideline 只奖励“详细、礼貌、像客服”,模型会学会 style over truth。 如果 guideline 过度奖励安全,模型会过度拒答,损害正常业务效率。 |
3.3 DPO 为什么能简化 RLHF
DPO 的关键是把 reward model 隐含到 preference loss 里。 传统 RLHF 先学习一个“这个回答好不好”的 reward model,再用强化学习让 policy 追逐这个 reward。 DPO 直接学习“chosen 应该比 rejected 更可能”。 这减少了显式 reward model 和 PPO 采样环节。 它也让训练更接近标准 supervised fine-tuning 的工程形态。 但 DPO 的简化不是安全保证。 它没有自动验证事实。 它没有自动执行权限。 它也不会判断业务政策本身是否合理。 它只是更直接地把偏好比较写入模型行为。
3.4 Constitutional AI 如何把原则转成训练信号
原则不能停留在 PDF 里。 要进入模型改进行动,原则需要变成:
- critique rubric。
- revision instruction。
- chosen / rejected 样本。
- red-team prompt。
- release gate。
- runtime policy。 例如财富建议原则可以写成:
不得给未完成适当性评估的客户提供个性化买卖建议。
可以提供教育性风险解释、披露文件路径和持牌顾问转接。
不得承诺收益,不得暗示某产品一定优于存款。
模型可以据此 critique 一个回答是否越权,并修订成更安全的版本。 但正式适当性判断仍应由工作流和持牌人员处理。
3.5 偏好优化和运行时控制的分工
可以把企业 AI 行为分成三类。 第一类是适合写进模型偏好的行为:
-
语气。
-
简洁度。
-
拒答风格。
-
澄清习惯。
-
升级提示。
-
引用意识。 第二类是适合放在 prompt 或 policy 配置中的行为:
-
当前产品声明。
-
禁止话术。
-
渠道差异。
-
角色可见内容。
-
风险分级规则。 第三类必须由运行时系统控制:
-
客户事实。
-
账户状态。
-
交易动作。
-
信贷原因代码。
-
投资适当性判断。
-
AML/SAR 提交。
-
审批和双人复核。 把第三类行为通过偏好优化“训练进去”,是高风险误用。
4. 为什么这些方法有效
4.1 人更擅长比较而不是生成完美答案
在开放式任务中,写一个完美答案很难。 但比较两个答案哪个更好,通常更容易。 偏好学习利用了这一点。 它把专家判断转成大量 pairwise signal,让模型学习细微但重要的行为差异。 例如,一个 AML narrative 是否过度定性,一个 adverse action 解释是否编造原因,专家通过比较往往能快速判断。
4.2 组织偏好可以被样本化
金融机构的许多偏好不是个人喜好,而是制度化偏好。 例如:
- 宁可少一点营销性,也不要收益承诺。
- 宁可升级人工,也不要模型裁定投诉。
- 宁可承认资料不足,也不要编造政策。
- 宁可解释教育性信息,也不要给个性化投资建议。 这些偏好可以通过 chosen / rejected 样本反复表达。 模型训练后,会在类似场景中更倾向这些行为。
4.3 原则化反馈提高边界覆盖
单靠人工写样本,很难覆盖所有攻击、诱导和边界问题。 Constitutional AI 把原则显式化后,可以自动生成 critique、revision 和更多候选失败样本。 这对安全、隐私、合规、客户伤害等场景很有价值。 但原则化反馈有效的前提是原则足够具体。 “遵守监管要求”太泛。 “不得基于未授权账户数据回答第三方问题;应说明隐私原因并引导账户持有人通过认证渠道联系”才可训练、可评估。
5. 局限、误用和反模式
5.1 Reward hacking
模型可能学会提高偏好分数的表面技巧。 常见表现包括:
- 回答变长,看起来更完整。
- 免责声明堆叠,看起来更安全。
- 语气更自信,但事实没有支撑。
- 回避困难问题,以降低违规概率。
- 模仿 reviewer 喜欢的格式,而不解决核心任务。 金融零售中,这会产生“合规味很浓但事实错误”的输出。
5.2 Over-optimization
偏好优化过强会让模型变形。 它可能变得过度拒答、模板化、缺乏灵活性,或者在未覆盖场景中表现更差。 因此上线不能只看 preference win rate。 还要看 task completion、事实支持、合规失败、over-refusal、under-refusal、人工覆盖和客户投诉。
5.3 偏好样本中的隐性偏见
Reviewer 的背景、培训、激励和疲劳都会影响偏好。 如果样本主要来自低风险客服场景,模型可能在高风险财富、信贷、AML 场景中过度迁移。 如果标注员只看语气,不看来源,模型会学会包装。 偏好数据需要分场景、分风险、分政策来源管理。
5.4 把 Constitutional AI 当成合规替代品
Constitution 是原则集合,不是法律意见。 AI critique 是辅助反馈,不是合规批准。 高风险领域仍需要 policy owner、法务、合规、模型风险、业务 SME 和审计参与。
5.5 把训练层对齐当成系统安全边界
即使模型经过 DPO 或 Constitutional AI,也不能被授予不受控工具权限。 训练层改善默认行为。 运行时控制负责事实、权限、审批、日志和回滚。 这两层不能互相替代。
6. 架构和产品价值
6.1 Preference governance pipeline
flowchart TB
Policy[Business policy and risk appetite] --> Guide[Reviewer guideline]
Guide --> Pref[Preference dataset]
Policy --> Const[Constitution / principles]
Const --> Critique[Critique and revision]
Critique --> Pref
Pref --> Train[DPO / RLHF / SFT]
Train --> Candidate[Candidate model]
Candidate --> Eval[Behavior, factuality, policy and safety eval]
Eval --> Gate{Release gate}
Gate -->|pass| Runtime[Runtime AI system]
Gate -->|fail| Remediate[Revise data, guideline, prompt or controls]
Runtime --> Feedback[Human and production feedback]
Feedback --> Guide
这条链路说明:偏好优化不是一次训练动作,而是治理闭环。 每一次政策变化、线上失败、模型升级和产品边界调整,都可能要求更新样本、guideline、eval 和 runtime controls。
6.2 产品价值:把默认行为变稳定
偏好优化适合解决以下问题:
- 客服回答语气不一致。
- 拒答有时太硬、有时太松。
- 模型爱补充无关免责声明。
- 高风险问题缺少澄清和升级。
- 报告草稿语气不符合审计口径。
- 模型经常把事实和推断混在一起。 这些都不是纯事实检索问题。 它们是行为和表达偏好问题。
6.3 架构价值:把可训练偏好和不可训练控制分开
一套成熟架构会明确:
- 模型权重中允许学习哪些默认行为。
- system prompt 管哪些可配置规则。
- policy engine 管哪些硬性边界。
- RAG 和工具提供哪些事实。
- human approval 负责哪些责任点。
- eval gate 验证哪些行为不退化。 这种分工避免两个错误。 一个错误是把所有规则塞进 prompt 或模型。 另一个错误是因为模型不完美而拒绝所有 AI 辅助。
7. 金融零售系统案例
7.1 财富建议边界
客户问:
我 62 岁,退休金有限,这只高收益产品是不是肯定比存款好?你直接告诉我买不买。
偏好优化应让模型倾向:
-
不给个性化买卖建议。
-
不承诺收益。
-
解释集中投资和波动风险。
-
提供教育性信息和披露文件路径。
-
引导完成 suitability assessment 或咨询持牌顾问。 模型不应倾向:
-
直接说可以买或不可以买。
-
用免责声明包装实质性建议。
-
暗示高收益产品一定优于存款。 这里的训练目标是表达和边界感。 适当性判断、顾问资格、客户风险画像和交易执行必须在运行时系统里处理。
7.2 信贷 adverse action wording
客户问:
为什么拒绝我的贷款?是不是因为我年龄大、住的地区不好?
合格行为是只基于审批系统返回的 reason codes 生成客户可读解释。 偏好优化可以改善措辞:
-
清楚。
-
尊重。
-
不羞辱。
-
不编造额外原因。
-
不暴露可被操纵的模型细节。 不合格行为包括:
-
猜测收入、职业、年龄、地区是原因。
-
加入没有 source-of-truth 支持的解释。
-
把公平信贷敏感因素写成拒绝原因。 这里 reason code source of truth 必须来自决策系统,不来自模型偏好。
7.3 AML narrative tone
调查员让模型起草 case narrative。 偏好优化可让模型倾向使用:
-
observed activity。
-
indicators。
-
requires review。
-
based on transaction evidence。
-
no conclusion without investigator approval。 模型应避免:
-
“客户洗钱”。
-
“确定犯罪”。
-
夸大可疑程度。
-
删除不支持结论的证据。 偏好优化能显著改善 narrative 质量。 但 SAR/STR 是否提交、案件是否关闭、风险评级是否调整,都必须由调查员和合规流程决定。
7.4 投诉处理语气和升级
投诉场景中,模型常见问题不是“不会说话”,而是:
-
过早站在公司立场。
-
对客户伤害缺少承认。
-
把投诉降级成普通咨询。
-
在法律威胁、弱势客户、欺诈声称时没有升级。 偏好样本应覆盖:
-
费用争议。
-
欺诈声称。
-
信用报告争议。
-
法律威胁。
-
弱势客户。
-
多轮反复投诉。 chosen answer 不一定更长。 它应该更准确地区分回应、澄清、升级和记录。
8. 学习验证
用自己的话解释:
- SFT、PPO-based RLHF、DPO 和 Constitutional AI 分别优化什么。
- DPO 为什么能绕过显式 reward model。
- Constitutional AI 的 constitution 为什么必须具体。
- Preference optimization 为什么不能替代 RAG、工具和 policy engine。 做一个 preference packet:为财富建议边界写 10 组 chosen / rejected 样本,每组包含 prompt、chosen、rejected、选择理由、政策来源、是否升级和 failure tag。样本要覆盖收益承诺、个性化建议、朋友假设、退休金压力和客户要求快速决定。 再写一个 reviewer guideline:明确事实正确性优先于语气,当前政策和客户事实必须有来源,高风险问题何时升级,哪些免责声明不能掩盖越权建议,过度拒答如何判定。 最后设计一次 DPO 后模型升级的 release gate,覆盖低风险 FAQ、隐私请求、财富建议边界、信贷 reason code、AML narrative、投诉升级和红队诱导样本。每类样本定义 critical failure、acceptable variance 和 rollback trigger。
9. 读完后应形成的判断
DPO 的价值是让偏好优化更直接、更像监督训练,但它仍然依赖高质量偏好数据。 Constitutional AI 的价值是把原则显式化,让 critique、revision 和 AI feedback 更可治理,但它不替代人类责任。 Preference optimization 是模型行为治理的一层。 它适合塑造语气、拒答、澄清、升级和表达边界。 它不适合承载客户事实、账户权限、监管判断、资金动作或审批责任。 金融零售 AI 系统要把训练层偏好、运行时事实、权限控制、人工审批、eval gate 和生产反馈连成闭环。 只有这样,模型行为才不是“看起来更好”,而是能在高风险业务环境中被解释、被验证、被回滚。
SOTA 状态标注 (2026-07-01)
本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。