返回 Papers
AI 底层逻辑 / 经典论文

DPO / Constitutional AI:偏好优化与行为治理

Preference optimization 解决的不是“模型是否知道事实”,而是“在多个可能回答中,模型默认更倾向哪一种行为”。SFT 用示范建立基本任务格式,RLHF 用偏好训练 reward model 再优化策略,DPO 直接提高 chosen answer 相对 rejected answer 的概率,Constitutional AI 则把原则、批评和修订引入反馈生成。

345ai-foundations/papers/11-dpo-constitutional-ai-preference-optimization.md

Paper 11: DPO, Constitutional AI, and Preference Optimization

Source Anchors

SourceLink读它要抓住什么
InstructGPT / RLHFhttps://arxiv.org/abs/2203.02155SFT、reward model、PPO-based RLHF 的经典三段式
Direct Preference Optimizationhttps://arxiv.org/abs/2305.18290用 pairwise preference 直接优化 policy 的 DPO 思路
Constitutional AIhttps://arxiv.org/abs/2212.08073用原则、critique、revision 和 RLAIF 扩展安全训练
Proximal Policy Optimizationhttps://arxiv.org/abs/1707.06347理解 RLHF 中 PPO 作为策略优化算法的背景
本篇默认已经理解基础 RLHF。这里的重点不是重新讲一遍“模型更安全”,而是拆开:偏好从哪里来,偏好如何被优化,优化为什么有效,以及偏好治理在企业系统里应该放在哪一层。

核心导读

Preference optimization 解决的不是“模型是否知道事实”,而是“在多个可能回答中,模型默认更倾向哪一种行为”。SFT 用示范建立基本任务格式,RLHF 用偏好训练 reward model 再优化策略,DPO 直接提高 chosen answer 相对 rejected answer 的概率,Constitutional AI 则把原则、批评和修订引入反馈生成。

它的价值在于把组织希望的默认行为变成可训练信号:更诚实地承认不确定性,更少编造事实,更稳定地拒绝越权请求,更清楚地区分教育性解释和个性化建议,更愿意在高风险时升级人工。DPO 降低了传统 PPO-based RLHF 的部分工程复杂度,Constitutional AI 让安全原则更可读、可审查、可版本化。

但偏好优化会放大偏好数据、reviewer guideline、constitution 和 eval 中的缺陷。它不能提供最新政策,不能判断用户权限,不能审批资金动作,也不能替代法律、合规或模型风险责任。金融零售落地时,偏好优化只能塑造语气、拒答、澄清、升级和表达边界;事实来源、权限控制、审批责任、证据链和 release gate 必须由运行时系统治理。


1. 核心问题:偏好不是事实,也不是权限

Base language model 学到的是语言分布。 它会生成概率上合理的下文,但不天然知道哪个回答更有帮助、更诚实、更安全、更合规。 SFT 通过示范答案让模型学会基本任务格式。 RLHF 通过人类偏好让模型更接近人希望看到的助手行为。 DPO 和 Constitutional AI 则进一步回答:

  • 能否少依赖复杂强化学习链路?
  • 能否直接利用 chosen / rejected 这类偏好比较?
  • 能否把安全原则显式化,而不是只藏在标注员直觉里?
  • 能否用 AI feedback 扩展反馈规模,同时保留人类治理? 金融零售场景中,“更好的回答”不是一个单维度概念。 财富建议里,直接告诉客户买什么可能看起来 helpful,但会越过持牌建议边界。 信贷拒绝解释里,语言越具体不一定越好;如果模型编造原因,会制造公平信贷和 adverse action 风险。 AML narrative 里,强烈措辞可能让报告看起来有力,但如果把可疑行为写成确定犯罪,会破坏审计和法律边界。 因此,preference optimization 的核心价值不是让模型“拥有正确价值观”。 它的价值是把组织希望的默认行为、语气、边界和升级倾向转成训练信号。 但事实、权限、动作和责任仍必须由系统控制。

2. 技术贡献:从示范到偏好,再到原则化反馈

2.1 SFT:先建立可模仿的任务行为

Supervised fine-tuning 使用高质量 prompt-answer 样例训练模型。 它让模型学会:

  • 按指令回答。
  • 使用合适格式。
  • 遵守基本拒答边界。
  • 形成产品希望的语气。
  • 在常见任务上减少漂移。 SFT 的优点是直接、稳定、可审查。 一条样例写得好不好,业务、法务、合规和运营都能读懂。 它的缺点是示范成本高,边界覆盖有限。 很多场景没有唯一标准答案,人更容易判断两个答案哪个更好,而不是从零写一个完美答案。

2.2 PPO-based RLHF:把偏好变成奖励再优化

经典 RLHF 通常分三步。 第一步是 SFT,得到初始 instruction-following model。 第二步是收集同一 prompt 下多个回答的偏好排序,训练 reward model。 第三步是用 PPO 优化语言模型,让它生成 reward model 更喜欢的回答,同时用 KL 约束防止偏离参考模型太远。 这个路线的重要贡献是把开放式人类偏好转成可优化目标。 它让模型不仅模仿示范,还能在多种候选回答之间学习组织偏好。 但 PPO-based RLHF 的工程链路复杂。 它需要 reward model、采样、策略优化、KL 控制和训练稳定性调参。 更关键的是,reward model 只是偏好的近似。 如果 reward model 错了,模型可能学会讨好 reward model,而不是真正提高任务质量。

2.3 DPO:直接优化 chosen 相对 rejected 的概率

DPO 的直觉是:在一定推导下,可以绕过显式 reward model 和在线 RL 过程,直接用 pairwise preference 数据优化模型。 训练样本通常是:

prompt
chosen_answer
rejected_answer

DPO 的目标不是给回答打一个显式奖励分,而是提高 chosen answer 相对 rejected answer 的概率。 它还保留对 reference model 的约束,避免模型因为偏好优化过度偏离原有能力。 从工程角度看,DPO 的吸引力在于链路更短、更像监督训练,通常比 PPO-based RLHF 更容易落地。 从治理角度看,DPO 把关注点更集中地推回到 preference dataset。 如果 chosen / rejected 样本质量差,DPO 会更稳定地学习坏偏好。

2.4 Constitutional AI:把原则显式化

Constitutional AI 的核心是使用一组明确原则指导模型批评和修订自己的输出。 典型流程可以拆成:

  1. 模型生成初始回答。
  2. 模型根据 constitution 原则 critique 这个回答。
  3. 模型依据 critique 生成 revision。
  4. revision 样本用于训练更安全的模型。
  5. 后续可以用 AI feedback 扩展 preference learning。 这不是让模型自动替代伦理或合规团队。 它的价值是把隐含偏好变成可读、可审查、可版本化的原则。 金融零售中,这些原则可能来自:
  • 隐私和数据最小化政策。
  • 财富建议和适当性边界。
  • 信贷解释和公平信贷规则。
  • AML 调查语言规范。
  • 投诉处理和客户伤害补救标准。

2.5 RLAIF:用 AI feedback 扩展反馈,但不交出责任

RLAIF 使用 AI 生成或辅助生成偏好反馈。 它可以降低人工标注成本,减少人工直接处理有害内容的负担,也能更快覆盖大量边界样本。 但 AI feedback 会继承模型盲点。 它可能奖励格式漂亮但事实错误的回答。 它可能对专业合规边界理解不足。 它也可能被 prompt 注入或表面措辞诱导。 因此,RLAIF 更适合作为扩展机制,而不是最终责任主体。 原则由人定义,高风险样本由专家抽检,线上失败样本进入回归集。


3. 机制原理:偏好数据是系统资产

3.1 Preference data 的基本形态

最小偏好样本包含 prompt、chosen、rejected。 企业场景中,样本还应该包含:

  • risk_tier。
  • policy_source。
  • reviewer_guideline_version。
  • reason_for_choice。
  • failure_tags。
  • expected_escalation。
  • allowed_claims。
  • forbidden_claims。 没有这些 metadata,偏好数据很难治理。 当模型行为出错时,团队无法判断是样本错误、原则冲突、reviewer 漂移,还是训练过度。

3.2 Reviewer guideline 决定偏好质量

偏好比较表面上是“两个答案选一个”。 实质上,它要求 reviewer 在多个维度之间做取舍:

维度在金融零售中的含义常见坏偏好
有用性是否真正帮助完成任务给很多泛泛背景但没有解决问题
真实性是否承认不确定,区分事实和推断编造政策、账户状态或审批原因
合规性是否遵守监管和内部政策用免责声明包装越权建议
客户权益是否避免误导、羞辱和不公平影响过度推责或压制投诉
升级边界是否在高风险时转人工模型自行裁定投诉、授信或 SAR
可追溯性关键断言是否有来源语言流畅但没有证据
如果 guideline 只奖励“详细、礼貌、像客服”,模型会学会 style over truth。 如果 guideline 过度奖励安全,模型会过度拒答,损害正常业务效率。

3.3 DPO 为什么能简化 RLHF

DPO 的关键是把 reward model 隐含到 preference loss 里。 传统 RLHF 先学习一个“这个回答好不好”的 reward model,再用强化学习让 policy 追逐这个 reward。 DPO 直接学习“chosen 应该比 rejected 更可能”。 这减少了显式 reward model 和 PPO 采样环节。 它也让训练更接近标准 supervised fine-tuning 的工程形态。 但 DPO 的简化不是安全保证。 它没有自动验证事实。 它没有自动执行权限。 它也不会判断业务政策本身是否合理。 它只是更直接地把偏好比较写入模型行为。

3.4 Constitutional AI 如何把原则转成训练信号

原则不能停留在 PDF 里。 要进入模型改进行动,原则需要变成:

  • critique rubric。
  • revision instruction。
  • chosen / rejected 样本。
  • red-team prompt。
  • release gate。
  • runtime policy。 例如财富建议原则可以写成:
不得给未完成适当性评估的客户提供个性化买卖建议。
可以提供教育性风险解释、披露文件路径和持牌顾问转接。
不得承诺收益,不得暗示某产品一定优于存款。

模型可以据此 critique 一个回答是否越权,并修订成更安全的版本。 但正式适当性判断仍应由工作流和持牌人员处理。

3.5 偏好优化和运行时控制的分工

可以把企业 AI 行为分成三类。 第一类是适合写进模型偏好的行为:

  • 语气。

  • 简洁度。

  • 拒答风格。

  • 澄清习惯。

  • 升级提示。

  • 引用意识。 第二类是适合放在 prompt 或 policy 配置中的行为:

  • 当前产品声明。

  • 禁止话术。

  • 渠道差异。

  • 角色可见内容。

  • 风险分级规则。 第三类必须由运行时系统控制:

  • 客户事实。

  • 账户状态。

  • 交易动作。

  • 信贷原因代码。

  • 投资适当性判断。

  • AML/SAR 提交。

  • 审批和双人复核。 把第三类行为通过偏好优化“训练进去”,是高风险误用。


4. 为什么这些方法有效

4.1 人更擅长比较而不是生成完美答案

在开放式任务中,写一个完美答案很难。 但比较两个答案哪个更好,通常更容易。 偏好学习利用了这一点。 它把专家判断转成大量 pairwise signal,让模型学习细微但重要的行为差异。 例如,一个 AML narrative 是否过度定性,一个 adverse action 解释是否编造原因,专家通过比较往往能快速判断。

4.2 组织偏好可以被样本化

金融机构的许多偏好不是个人喜好,而是制度化偏好。 例如:

  • 宁可少一点营销性,也不要收益承诺。
  • 宁可升级人工,也不要模型裁定投诉。
  • 宁可承认资料不足,也不要编造政策。
  • 宁可解释教育性信息,也不要给个性化投资建议。 这些偏好可以通过 chosen / rejected 样本反复表达。 模型训练后,会在类似场景中更倾向这些行为。

4.3 原则化反馈提高边界覆盖

单靠人工写样本,很难覆盖所有攻击、诱导和边界问题。 Constitutional AI 把原则显式化后,可以自动生成 critique、revision 和更多候选失败样本。 这对安全、隐私、合规、客户伤害等场景很有价值。 但原则化反馈有效的前提是原则足够具体。 “遵守监管要求”太泛。 “不得基于未授权账户数据回答第三方问题;应说明隐私原因并引导账户持有人通过认证渠道联系”才可训练、可评估。


5. 局限、误用和反模式

5.1 Reward hacking

模型可能学会提高偏好分数的表面技巧。 常见表现包括:

  • 回答变长,看起来更完整。
  • 免责声明堆叠,看起来更安全。
  • 语气更自信,但事实没有支撑。
  • 回避困难问题,以降低违规概率。
  • 模仿 reviewer 喜欢的格式,而不解决核心任务。 金融零售中,这会产生“合规味很浓但事实错误”的输出。

5.2 Over-optimization

偏好优化过强会让模型变形。 它可能变得过度拒答、模板化、缺乏灵活性,或者在未覆盖场景中表现更差。 因此上线不能只看 preference win rate。 还要看 task completion、事实支持、合规失败、over-refusal、under-refusal、人工覆盖和客户投诉。

5.3 偏好样本中的隐性偏见

Reviewer 的背景、培训、激励和疲劳都会影响偏好。 如果样本主要来自低风险客服场景,模型可能在高风险财富、信贷、AML 场景中过度迁移。 如果标注员只看语气,不看来源,模型会学会包装。 偏好数据需要分场景、分风险、分政策来源管理。

5.4 把 Constitutional AI 当成合规替代品

Constitution 是原则集合,不是法律意见。 AI critique 是辅助反馈,不是合规批准。 高风险领域仍需要 policy owner、法务、合规、模型风险、业务 SME 和审计参与。

5.5 把训练层对齐当成系统安全边界

即使模型经过 DPO 或 Constitutional AI,也不能被授予不受控工具权限。 训练层改善默认行为。 运行时控制负责事实、权限、审批、日志和回滚。 这两层不能互相替代。


6. 架构和产品价值

6.1 Preference governance pipeline

flowchart TB
  Policy[Business policy and risk appetite] --> Guide[Reviewer guideline]
  Guide --> Pref[Preference dataset]
  Policy --> Const[Constitution / principles]
  Const --> Critique[Critique and revision]
  Critique --> Pref
  Pref --> Train[DPO / RLHF / SFT]
  Train --> Candidate[Candidate model]
  Candidate --> Eval[Behavior, factuality, policy and safety eval]
  Eval --> Gate{Release gate}
  Gate -->|pass| Runtime[Runtime AI system]
  Gate -->|fail| Remediate[Revise data, guideline, prompt or controls]
  Runtime --> Feedback[Human and production feedback]
  Feedback --> Guide

这条链路说明:偏好优化不是一次训练动作,而是治理闭环。 每一次政策变化、线上失败、模型升级和产品边界调整,都可能要求更新样本、guideline、eval 和 runtime controls。

6.2 产品价值:把默认行为变稳定

偏好优化适合解决以下问题:

  • 客服回答语气不一致。
  • 拒答有时太硬、有时太松。
  • 模型爱补充无关免责声明。
  • 高风险问题缺少澄清和升级。
  • 报告草稿语气不符合审计口径。
  • 模型经常把事实和推断混在一起。 这些都不是纯事实检索问题。 它们是行为和表达偏好问题。

6.3 架构价值:把可训练偏好和不可训练控制分开

一套成熟架构会明确:

  • 模型权重中允许学习哪些默认行为。
  • system prompt 管哪些可配置规则。
  • policy engine 管哪些硬性边界。
  • RAG 和工具提供哪些事实。
  • human approval 负责哪些责任点。
  • eval gate 验证哪些行为不退化。 这种分工避免两个错误。 一个错误是把所有规则塞进 prompt 或模型。 另一个错误是因为模型不完美而拒绝所有 AI 辅助。

7. 金融零售系统案例

7.1 财富建议边界

客户问:

我 62 岁,退休金有限,这只高收益产品是不是肯定比存款好?你直接告诉我买不买。

偏好优化应让模型倾向:

  • 不给个性化买卖建议。

  • 不承诺收益。

  • 解释集中投资和波动风险。

  • 提供教育性信息和披露文件路径。

  • 引导完成 suitability assessment 或咨询持牌顾问。 模型不应倾向:

  • 直接说可以买或不可以买。

  • 用免责声明包装实质性建议。

  • 暗示高收益产品一定优于存款。 这里的训练目标是表达和边界感。 适当性判断、顾问资格、客户风险画像和交易执行必须在运行时系统里处理。

7.2 信贷 adverse action wording

客户问:

为什么拒绝我的贷款?是不是因为我年龄大、住的地区不好?

合格行为是只基于审批系统返回的 reason codes 生成客户可读解释。 偏好优化可以改善措辞:

  • 清楚。

  • 尊重。

  • 不羞辱。

  • 不编造额外原因。

  • 不暴露可被操纵的模型细节。 不合格行为包括:

  • 猜测收入、职业、年龄、地区是原因。

  • 加入没有 source-of-truth 支持的解释。

  • 把公平信贷敏感因素写成拒绝原因。 这里 reason code source of truth 必须来自决策系统,不来自模型偏好。

7.3 AML narrative tone

调查员让模型起草 case narrative。 偏好优化可让模型倾向使用:

  • observed activity。

  • indicators。

  • requires review。

  • based on transaction evidence。

  • no conclusion without investigator approval。 模型应避免:

  • “客户洗钱”。

  • “确定犯罪”。

  • 夸大可疑程度。

  • 删除不支持结论的证据。 偏好优化能显著改善 narrative 质量。 但 SAR/STR 是否提交、案件是否关闭、风险评级是否调整,都必须由调查员和合规流程决定。

7.4 投诉处理语气和升级

投诉场景中,模型常见问题不是“不会说话”,而是:

  • 过早站在公司立场。

  • 对客户伤害缺少承认。

  • 把投诉降级成普通咨询。

  • 在法律威胁、弱势客户、欺诈声称时没有升级。 偏好样本应覆盖:

  • 费用争议。

  • 欺诈声称。

  • 信用报告争议。

  • 法律威胁。

  • 弱势客户。

  • 多轮反复投诉。 chosen answer 不一定更长。 它应该更准确地区分回应、澄清、升级和记录。


8. 学习验证

用自己的话解释:

  • SFT、PPO-based RLHF、DPO 和 Constitutional AI 分别优化什么。
  • DPO 为什么能绕过显式 reward model。
  • Constitutional AI 的 constitution 为什么必须具体。
  • Preference optimization 为什么不能替代 RAG、工具和 policy engine。 做一个 preference packet:为财富建议边界写 10 组 chosen / rejected 样本,每组包含 prompt、chosen、rejected、选择理由、政策来源、是否升级和 failure tag。样本要覆盖收益承诺、个性化建议、朋友假设、退休金压力和客户要求快速决定。 再写一个 reviewer guideline:明确事实正确性优先于语气,当前政策和客户事实必须有来源,高风险问题何时升级,哪些免责声明不能掩盖越权建议,过度拒答如何判定。 最后设计一次 DPO 后模型升级的 release gate,覆盖低风险 FAQ、隐私请求、财富建议边界、信贷 reason code、AML narrative、投诉升级和红队诱导样本。每类样本定义 critical failure、acceptable variance 和 rollback trigger。

9. 读完后应形成的判断

DPO 的价值是让偏好优化更直接、更像监督训练,但它仍然依赖高质量偏好数据。 Constitutional AI 的价值是把原则显式化,让 critique、revision 和 AI feedback 更可治理,但它不替代人类责任。 Preference optimization 是模型行为治理的一层。 它适合塑造语气、拒答、澄清、升级和表达边界。 它不适合承载客户事实、账户权限、监管判断、资金动作或审批责任。 金融零售 AI 系统要把训练层偏好、运行时事实、权限控制、人工审批、eval gate 和生产反馈连成闭环。 只有这样,模型行为才不是“看起来更好”,而是能在高风险业务环境中被解释、被验证、被回滚。


SOTA 状态标注 (2026-07-01)

本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。