返回 Papers
AI 底层逻辑 / 经典论文

Differential Privacy / DP-SGD:隐私预算与 AI 数据保护

Differential Privacy 不是匿名化、脱敏或 hash ID。它提供的是可量化保证: 限制单个个体是否出现在数据集中对发布结果或模型参数的影响。

233ai-foundations/papers/40-differential-privacy-dpsgd-ai-data-protection.md

Differential Privacy / DP-SGD 解读

Source Anchors

SourceLink用途
The Algorithmic Foundations of Differential Privacyhttps://www.cis.upenn.edu/~aaroth/Papers/privacybook.pdf理解差分隐私的理论基础和 epsilon 语义
TensorFlow Privacy guidehttps://www.tensorflow.org/responsible_ai/privacy/guide理解 DP-SGD 在模型训练中的工程用途
TensorFlow Privacy GitHubhttps://github.com/tensorflow/privacy理解隐私优化器和 privacy accounting 工具
DP-SGD paperhttps://arxiv.org/abs/1607.00133理解深度学习中差分隐私训练的核心方法
NIST Privacy Frameworkhttps://www.nist.gov/privacy-framework用隐私风险管理语言组织控制和证据
NIST AI RMFhttps://www.nist.gov/itl/ai-risk-management-framework把隐私保护纳入 AI 风险管理

核心导读

Differential Privacy 不是匿名化、脱敏或 hash ID。它提供的是可量化保证: 限制单个个体是否出现在数据集中对发布结果或模型参数的影响。

DP 的机制价值在于把隐私风险从“感觉上安全”转成可预算、可累计、可审批、可审计的控制面。但它必然带来效用损失,也可能对小群体和稀有模式产生不均衡影响。金融零售中不能只声称“用了 DP”,必须说明 privacy unit、epsilon、delta、composition、效用影响和客户权益边界。

问题定义

传统隐私处理通常包括:

  • 删除姓名、证件号、手机号。
  • hash 客户 ID。
  • 字段脱敏。
  • 聚合到群体统计。
  • 只发布匿名数据集。

这些控制并不等同于隐私保证:

  • 高维行为数据很容易被重新识别。
  • 外部数据集可以做 linkage attack。
  • 小群体统计可能暴露个体。
  • 模型可能记住训练样本。
  • 攻击者可能通过 membership inference 判断某人是否在训练集中。

DP 要解决的问题是:

Whether one individual is included in the dataset
should have only a bounded effect
on the output distribution.

这对客户分析、AI trace 数据集、信贷模型训练、欺诈模型训练、员工行为分析和跨团队报表发布都很关键。

核心原理

DP 的核心参数是 epsilon 和 delta:

概念含义
epsilon隐私损失上界的主要参数,越小保护越强
delta极小概率下保证失效的余量
privacy unit被保护的单位,可能是记录、客户、账户、家庭、设备、组织
privacy budget一个数据集、用户群或用途可承受的累计隐私损失
composition多次查询、训练或发布会累计消耗预算
sensitivity单个个体改变对查询结果最大可能影响

产品和架构上最容易犯错的是 privacy unit。记录级 DP 保护单条记录,客户级 DP 保护一个客户的多条记录,二者风险含义完全不同。金融客户通常跨账户、渠道和时间有多条记录,如果只做记录级保护,可能无法覆盖真实客户暴露风险。

DP-SGD 的训练流程:

per-example gradients
  -> clip each gradient to bound individual influence
  -> add calibrated noise
  -> update model
  -> account cumulative privacy loss

机制价值:

  • clipping 限制单条样本对模型更新的最大影响。
  • noise addition 让个体是否存在更难被推断。
  • privacy accounting 记录训练过程消耗了多少预算。

但 DP-SGD 不是普通训练的无痛替换。它通常增加训练成本,降低模型效用,尤其可能削弱小样本群体和稀有模式。

系统/架构模型

DP 应作为隐私控制面的一部分,而不是单独存在:

Data source
  -> data minimization
  -> purpose and consent check
  -> access control
  -> approved query / training job
  -> DP mechanism
       -> sensitivity analysis
       -> clipping or noise calibration
       -> privacy accounting
       -> budget ledger
  -> utility and slice evaluation
  -> release evidence
  -> monitoring and budget stop rules

用于统计发布:

approved query template
  -> cohort threshold
  -> sensitivity calculation
  -> noise addition
  -> budget deduction
  -> release review

用于模型训练:

training dataset
  -> privacy unit definition
  -> DP optimizer / DP-SGD
  -> privacy accountant
  -> non-DP vs DP utility comparison
  -> slice and customer impact evaluation
  -> model release evidence

DP 不替代访问控制。未经授权的人不能因为输出加了噪声就获得访问权;不合规的数据用途也不会因为 DP 自动变合规。

关键机制与取舍

机制价值取舍
Smaller epsilon更强隐私保护更多噪声,效用和稳定性下降
User-level DP更贴近客户保护成本和噪声通常高于记录级
Composition tracking防止多次发布累计泄露需要预算 ledger 和停止规则
Minimum cohort threshold降低小群体暴露牺牲细分分析能力
DP-SGD clipping限制单样本影响梯度裁剪可能损害稀有模式学习
Noise addition降低成员推断风险影响模型精度、校准和解释稳定性
DP in federation增强本地更新隐私可能与 secure aggregation 一起增加调试难度
Synthetic data with DP降低原始数据暴露不能假设合成数据天然安全或有业务效用

隐私、效用和公平常形成三角关系:

stronger privacy
  -> more noise
  -> lower utility in some slices
  -> possible higher manual review or error cost

对于欺诈、AML、信贷和投诉等稀有事件,DP 噪声可能掩盖关键少数模式。总体 AUC 变化不大,也可能意味着某些小群体、地区或产品线显著退化。

证据与控制

DP evidence pack 应包含:

证据说明
Privacy unit保护对象是记录、客户、账户、设备、家庭还是组织
MechanismLaplace/Gaussian mechanism、DP-SGD、federated DP 等
Parametersepsilon、delta、clipping norm、noise multiplier、sampling rate
Composition ledger查询、模型、报表和发布的累计预算
Sensitivity analysis查询或训练机制如何界定单个个体最大影响
Utility evaluation非 DP 与 DP 输出/模型的任务指标差异
Slice evaluation小群体、受保护群体、地区、产品、渠道表现
Attack evaluationmembership inference 或 reconstruction proxy
Access and purpose controls与权限、用途、保留、最小化控制的组合
Stop and rollback rules预算耗尽、效用退化、客户影响异常时如何停止

发布门禁不能只写“epsilon = x”。更完整的问题是:

  • 这个 epsilon 保护的是谁。
  • 这个预算覆盖哪些发布和训练。
  • 多次查询如何累计。
  • 加噪后业务指标是否仍可用。
  • 哪些切片退化。
  • 客户权益影响是否可接受。
  • 谁批准预算消耗。

AI产品/金融零售场景

客户分析报表:

marketing / strategy query
  -> approved metric and cohort
  -> minimum cohort threshold
  -> DP noise
  -> privacy budget ledger
  -> report release

适合用 DP 控制单个客户对聚合结果的影响,但仍需目的限制、角色权限和数据保留策略。

信贷模型训练:

  • DP-SGD 可以降低训练样本暴露风险。
  • 必须比较非 DP 与 DP 模型的审批质量、校准、reason code 稳定性、公平借贷切片和人工复核负担。
  • 如果 DP 导致某些群体误拒或误批增加,需要调整用途或进入保守决策路径。

客服 Copilot trace 数据集:

  • Trace 通常包含客户问题、员工操作、模型输出、工具结果和敏感上下文。
  • 先做数据最小化、PII 处理、权限和目的审查。
  • 对统计发布、eval 数据抽样或训练过程考虑 DP。
  • 保存预算、数据版本、过滤逻辑和评估证据。

联邦学习:

  • Secure aggregation 限制协调方看到单个参与方更新。
  • DP 限制单个样本或用户对更新的影响。
  • 二者互补,但会降低调试可见性和模型效用。

反模式

  • 把去标识化、hash ID 或脱敏宣传成差分隐私。
  • 声称使用 DP,却没有 epsilon、delta、privacy unit 和 composition ledger。
  • 只看总体模型指标,不看小群体、稀有事件和客户影响。
  • 让 DP 替代访问控制、数据最小化、目的限制或保留策略。
  • 在小 cohort 上反复发布加噪统计,忽略预算累计和重识别风险。
  • DP-SGD 上线后没有比较 reason code、校准和人工复核负担。
  • 把 DP 当成合规结论,而不是风险控制证据之一。
  • 没有预算 owner 和停止规则,导致隐私预算被多个团队无意识消耗。

最终心智模型

Differential Privacy 是“限制个体影响”的数学控制面。它把隐私风险变成可声明、可预算、可累计、可审计的参数化承诺。

正确的心智模型是: DP 降低个体从输出中被推断的风险,但不替代授权、最小化、用途限制、模型解释、公平评估和人工复核。隐私预算是产品和架构决策,不是研究参数。


SOTA 状态标注 (2026-07-01)

本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。