Differential Privacy / DP-SGD:隐私预算与 AI 数据保护
Differential Privacy 不是匿名化、脱敏或 hash ID。它提供的是可量化保证: 限制单个个体是否出现在数据集中对发布结果或模型参数的影响。
Differential Privacy / DP-SGD 解读
Source Anchors
| Source | Link | 用途 |
|---|---|---|
| The Algorithmic Foundations of Differential Privacy | https://www.cis.upenn.edu/~aaroth/Papers/privacybook.pdf | 理解差分隐私的理论基础和 epsilon 语义 |
| TensorFlow Privacy guide | https://www.tensorflow.org/responsible_ai/privacy/guide | 理解 DP-SGD 在模型训练中的工程用途 |
| TensorFlow Privacy GitHub | https://github.com/tensorflow/privacy | 理解隐私优化器和 privacy accounting 工具 |
| DP-SGD paper | https://arxiv.org/abs/1607.00133 | 理解深度学习中差分隐私训练的核心方法 |
| NIST Privacy Framework | https://www.nist.gov/privacy-framework | 用隐私风险管理语言组织控制和证据 |
| NIST AI RMF | https://www.nist.gov/itl/ai-risk-management-framework | 把隐私保护纳入 AI 风险管理 |
核心导读
Differential Privacy 不是匿名化、脱敏或 hash ID。它提供的是可量化保证: 限制单个个体是否出现在数据集中对发布结果或模型参数的影响。
DP 的机制价值在于把隐私风险从“感觉上安全”转成可预算、可累计、可审批、可审计的控制面。但它必然带来效用损失,也可能对小群体和稀有模式产生不均衡影响。金融零售中不能只声称“用了 DP”,必须说明 privacy unit、epsilon、delta、composition、效用影响和客户权益边界。
问题定义
传统隐私处理通常包括:
- 删除姓名、证件号、手机号。
- hash 客户 ID。
- 字段脱敏。
- 聚合到群体统计。
- 只发布匿名数据集。
这些控制并不等同于隐私保证:
- 高维行为数据很容易被重新识别。
- 外部数据集可以做 linkage attack。
- 小群体统计可能暴露个体。
- 模型可能记住训练样本。
- 攻击者可能通过 membership inference 判断某人是否在训练集中。
DP 要解决的问题是:
Whether one individual is included in the dataset
should have only a bounded effect
on the output distribution.
这对客户分析、AI trace 数据集、信贷模型训练、欺诈模型训练、员工行为分析和跨团队报表发布都很关键。
核心原理
DP 的核心参数是 epsilon 和 delta:
| 概念 | 含义 |
|---|---|
| epsilon | 隐私损失上界的主要参数,越小保护越强 |
| delta | 极小概率下保证失效的余量 |
| privacy unit | 被保护的单位,可能是记录、客户、账户、家庭、设备、组织 |
| privacy budget | 一个数据集、用户群或用途可承受的累计隐私损失 |
| composition | 多次查询、训练或发布会累计消耗预算 |
| sensitivity | 单个个体改变对查询结果最大可能影响 |
产品和架构上最容易犯错的是 privacy unit。记录级 DP 保护单条记录,客户级 DP 保护一个客户的多条记录,二者风险含义完全不同。金融客户通常跨账户、渠道和时间有多条记录,如果只做记录级保护,可能无法覆盖真实客户暴露风险。
DP-SGD 的训练流程:
per-example gradients
-> clip each gradient to bound individual influence
-> add calibrated noise
-> update model
-> account cumulative privacy loss
机制价值:
- clipping 限制单条样本对模型更新的最大影响。
- noise addition 让个体是否存在更难被推断。
- privacy accounting 记录训练过程消耗了多少预算。
但 DP-SGD 不是普通训练的无痛替换。它通常增加训练成本,降低模型效用,尤其可能削弱小样本群体和稀有模式。
系统/架构模型
DP 应作为隐私控制面的一部分,而不是单独存在:
Data source
-> data minimization
-> purpose and consent check
-> access control
-> approved query / training job
-> DP mechanism
-> sensitivity analysis
-> clipping or noise calibration
-> privacy accounting
-> budget ledger
-> utility and slice evaluation
-> release evidence
-> monitoring and budget stop rules
用于统计发布:
approved query template
-> cohort threshold
-> sensitivity calculation
-> noise addition
-> budget deduction
-> release review
用于模型训练:
training dataset
-> privacy unit definition
-> DP optimizer / DP-SGD
-> privacy accountant
-> non-DP vs DP utility comparison
-> slice and customer impact evaluation
-> model release evidence
DP 不替代访问控制。未经授权的人不能因为输出加了噪声就获得访问权;不合规的数据用途也不会因为 DP 自动变合规。
关键机制与取舍
| 机制 | 价值 | 取舍 |
|---|---|---|
| Smaller epsilon | 更强隐私保护 | 更多噪声,效用和稳定性下降 |
| User-level DP | 更贴近客户保护 | 成本和噪声通常高于记录级 |
| Composition tracking | 防止多次发布累计泄露 | 需要预算 ledger 和停止规则 |
| Minimum cohort threshold | 降低小群体暴露 | 牺牲细分分析能力 |
| DP-SGD clipping | 限制单样本影响 | 梯度裁剪可能损害稀有模式学习 |
| Noise addition | 降低成员推断风险 | 影响模型精度、校准和解释稳定性 |
| DP in federation | 增强本地更新隐私 | 可能与 secure aggregation 一起增加调试难度 |
| Synthetic data with DP | 降低原始数据暴露 | 不能假设合成数据天然安全或有业务效用 |
隐私、效用和公平常形成三角关系:
stronger privacy
-> more noise
-> lower utility in some slices
-> possible higher manual review or error cost
对于欺诈、AML、信贷和投诉等稀有事件,DP 噪声可能掩盖关键少数模式。总体 AUC 变化不大,也可能意味着某些小群体、地区或产品线显著退化。
证据与控制
DP evidence pack 应包含:
| 证据 | 说明 |
|---|---|
| Privacy unit | 保护对象是记录、客户、账户、设备、家庭还是组织 |
| Mechanism | Laplace/Gaussian mechanism、DP-SGD、federated DP 等 |
| Parameters | epsilon、delta、clipping norm、noise multiplier、sampling rate |
| Composition ledger | 查询、模型、报表和发布的累计预算 |
| Sensitivity analysis | 查询或训练机制如何界定单个个体最大影响 |
| Utility evaluation | 非 DP 与 DP 输出/模型的任务指标差异 |
| Slice evaluation | 小群体、受保护群体、地区、产品、渠道表现 |
| Attack evaluation | membership inference 或 reconstruction proxy |
| Access and purpose controls | 与权限、用途、保留、最小化控制的组合 |
| Stop and rollback rules | 预算耗尽、效用退化、客户影响异常时如何停止 |
发布门禁不能只写“epsilon = x”。更完整的问题是:
- 这个 epsilon 保护的是谁。
- 这个预算覆盖哪些发布和训练。
- 多次查询如何累计。
- 加噪后业务指标是否仍可用。
- 哪些切片退化。
- 客户权益影响是否可接受。
- 谁批准预算消耗。
AI产品/金融零售场景
客户分析报表:
marketing / strategy query
-> approved metric and cohort
-> minimum cohort threshold
-> DP noise
-> privacy budget ledger
-> report release
适合用 DP 控制单个客户对聚合结果的影响,但仍需目的限制、角色权限和数据保留策略。
信贷模型训练:
- DP-SGD 可以降低训练样本暴露风险。
- 必须比较非 DP 与 DP 模型的审批质量、校准、reason code 稳定性、公平借贷切片和人工复核负担。
- 如果 DP 导致某些群体误拒或误批增加,需要调整用途或进入保守决策路径。
客服 Copilot trace 数据集:
- Trace 通常包含客户问题、员工操作、模型输出、工具结果和敏感上下文。
- 先做数据最小化、PII 处理、权限和目的审查。
- 对统计发布、eval 数据抽样或训练过程考虑 DP。
- 保存预算、数据版本、过滤逻辑和评估证据。
联邦学习:
- Secure aggregation 限制协调方看到单个参与方更新。
- DP 限制单个样本或用户对更新的影响。
- 二者互补,但会降低调试可见性和模型效用。
反模式
- 把去标识化、hash ID 或脱敏宣传成差分隐私。
- 声称使用 DP,却没有 epsilon、delta、privacy unit 和 composition ledger。
- 只看总体模型指标,不看小群体、稀有事件和客户影响。
- 让 DP 替代访问控制、数据最小化、目的限制或保留策略。
- 在小 cohort 上反复发布加噪统计,忽略预算累计和重识别风险。
- DP-SGD 上线后没有比较 reason code、校准和人工复核负担。
- 把 DP 当成合规结论,而不是风险控制证据之一。
- 没有预算 owner 和停止规则,导致隐私预算被多个团队无意识消耗。
最终心智模型
Differential Privacy 是“限制个体影响”的数学控制面。它把隐私风险变成可声明、可预算、可累计、可审计的参数化承诺。
正确的心智模型是: DP 降低个体从输出中被推断的风险,但不替代授权、最小化、用途限制、模型解释、公平评估和人工复核。隐私预算是产品和架构决策,不是研究参数。
SOTA 状态标注 (2026-07-01)
本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。