AI Synthetic Data Governance:隐私-效用-保真度架构
合成数据不是“假数据所以安全”, 也不是把真实客户数据丢给生成器后自动得到可共享资产。对金融零售 AI 来说, synthetic data 是一种受治理的数据产品: 它有来源许可、生成方法、隐私攻击面、效用边界、保真度限制、适用场景、发布门禁和持续监控。
AI 合成数据治理架构:Synthetic Data Governance / Privacy-Utility-Fidelity Architecture
配对阅读:本篇的操作手册版(模板/RACI/门禁/runbook)是
docs/AI_SYNTHETIC_DATA_GOVERNANCE_PRIVACY_UTILITY_FIDELITY_PLAYBOOK.md。第一遍读本篇建立原理与架构判断;第二遍做案例时再用 playbook 查表落地,两者不需要重复精读。
Source Anchors
| Source | Link | 用途 |
|---|---|---|
| UK ICO synthetic data guidance | https://ico.org.uk/about-the-ico/research-reports-impact-and-evaluation/research-and-reports/technology-and-innovation/synthetic-data/ | 作为 synthetic data privacy risk、utility、governance 和误用风险的锚点 |
| NIST Privacy Framework | https://www.nist.gov/privacy-framework | 用 privacy risk management 思维组织 source permission、privacy attack testing、控制和证据 |
| NIST AI RMF | https://www.nist.gov/itl/ai-risk-management-framework | 用 Govern / Map / Measure / Manage 组织 AI synthetic data 风险治理和 release gate |
| ISO/IEC 42001 | https://www.iso.org/standard/81230.html | 用 AI management system 思维设计 roles、operation、performance evaluation、internal audit 和持续改进 |
| ISO/IEC 23894 | https://www.iso.org/standard/77304.html | 用 AI risk management lifecycle 思维组织 risk identification、analysis、treatment 和 monitoring |
| W3C PROV | https://www.w3.org/TR/prov-overview/ | 用 entity / activity / agent 模型描述 synthetic data provenance、生成活动和责任主体 |
核心导读
合成数据不是“假数据所以安全”, 也不是把真实客户数据丢给生成器后自动得到可共享资产。对金融零售 AI 来说, synthetic data 是一种受治理的数据产品: 它有来源许可、生成方法、隐私攻击面、效用边界、保真度限制、适用场景、发布门禁和持续监控。
成熟治理要同时处理 privacy、utility、fidelity 三角。隐私越强, 细节可能越少; 保真度越高, 重识别和成员推断风险可能越高; 效用越强, 可能只对某些任务成立。没有明确 allowed-use 和证据包的 synthetic data, 不能因为“synthetic”这个标签就进入模型训练、测试、供应商共享或外部演示。
问题定义
金融零售场景需要大量数据来训练模型、测试流程、压测系统、验证边界案例和支持供应商协作, 但真实数据受到隐私、保密、合规、客户信任和数据最小化约束。Synthetic data 看似解决矛盾, 实际引入新的治理问题:
- 生成数据可能泄露真实客户记录或罕见组合。
- 数据看似合理, 但破坏关键统计关系, 导致模型或测试结论失真。
- 数据适合演示, 不适合训练; 适合 UI 测试, 不适合风控评估。
- 生成过程没有 lineage, 事后无法解释来源、参数、过滤和版本。
- 外部共享后被用于未批准目的, 或与其他数据结合重识别。
- 合成数据中的偏差、缺失和边界样本被误认为真实世界分布。
因此, synthetic data governance 的核心不是“能不能生成”, 而是“基于什么真实来源、为哪个用途、在什么隐私风险下、保留哪些统计属性、禁止哪些使用、如何证明和复审”。
核心原理/方法
Allowed-use first 先定义用途, 再生成数据。用途可以是 UI demo、测试自动化、模型预训练、异常样本扩充、供应商沙盒、隐私保护分析或压力测试。不同用途对隐私、效用和保真度的要求完全不同。
Source permission and minimization 合成数据仍然继承真实来源数据的治理义务。必须记录真实数据来源、授权用途、字段敏感度、保留规则、客户群范围和生成前最小化处理。不能用未经批准的生产数据生成“看似脱敏”的资产。
Privacy attack testing 合成数据发布前需要测试 membership inference、attribute inference、nearest-neighbor leakage、outlier memorization、linkage risk 和 small-cell disclosure。特别是高净值客户、欺诈样本、罕见疾病、极端交易和投诉文本等稀有样本, 更容易被记忆。
Utility by task, not in general 效用不是全局属性。某个合成数据集可能适合测试 KYC 表单校验, 但不适合训练 AML 模型; 可能适合展示客服流程, 但不适合估计客户投诉率。每个数据集必须绑定任务和验证指标。
Fidelity with boundaries 保真度要说明保留了哪些结构: 分布、相关性、时间序列、长尾、类别比例、文本意图、业务规则、异常模式。也要说明没有保留什么。否则使用者会把合成数据当成真实世界替代品。
系统/架构模型
参考架构
Source data registry
-> Permission and minimization gate
-> Generation design
-> Synthetic data generator
-> Privacy attack lab
-> Utility and fidelity evaluation
-> Allowed-use release gate
-> Synthetic data catalog
-> Consumption monitoring
-> Retirement / regeneration
核心组件
| 组件 | 职责 | 关键控制 |
|---|---|---|
| Source data registry | 记录真实数据来源、用途许可、敏感等级和保留要求 | 未登记或未授权来源不得生成 |
| Use-case classifier | 定义合成数据用途、风险等级、使用者和共享范围 | 用途决定隐私和效用门槛 |
| Minimization pipeline | 过滤字段、稀有值、直接标识符和非必要历史 | 生成前降低泄露面 |
| Generation engine | 使用规则、统计模型、生成模型或混合方法生成数据 | 参数、版本和随机种子可追溯 |
| Privacy attack lab | 执行重识别、成员推断、属性推断和邻近样本测试 | 发布前必须通过阈值 |
| Utility evaluator | 按目标任务评估可用性 | 不允许用泛化指标替代任务验证 |
| Fidelity profiler | 比较分布、相关性、时间结构和长尾模式 | 标明保留和失真边界 |
| Release gate | 决定允许、限制、内部使用、外部共享或拒绝发布 | 输出 release evidence pack |
| Synthetic data catalog | 管理数据集版本、用途、限制、有效期和所有者 | 使用者必须看到 allowed-use |
| Consumption monitor | 监控访问、下载、共享、模型训练和用途漂移 | 防止数据集被二次误用 |
| Regeneration workflow | 源数据、模型、规则或用途变化后再生成 | 避免旧合成数据长期漂移 |
Synthetic data card
dataset_id: synth-kyc-2026-06-v3
source_lineage:
source_domains: [digital_onboarding, document_review]
source_period: 2025-10_to_2026-05
source_permission: internal_testing_only
generation:
method: hybrid_rules_plus_generative_model
generator_version: synthgen-v7
parameters_version: kyc-profile-v3
allowed_use:
permitted: [workflow_testing, training_sandbox, edge_case_demo]
prohibited: [credit_model_training, external_public_release, customer_impacting_decision]
privacy:
attack_tests: [membership_inference, nearest_neighbor, small_cell]
residual_risk: low_for_internal_sandbox
utility:
validated_tasks: [form_validation, exception_routing_test]
not_validated_tasks: [fraud_detection, approval_rate_estimation]
fidelity:
preserved: [document_type_distribution, missing_field_patterns]
distorted: [rare_country_combinations, high_risk_outliers]
governance:
owner: data_governance_kyc
expires_on: 2026-12-31
review_trigger: source_schema_change_or_new_external_use
关键机制与取舍
隐私 vs 效用 强隐私保护可能削弱罕见模式、长尾组合和异常行为, 但这些恰恰是金融风控和合规测试关心的部分。解决方式不是盲目提高保真度, 而是按用途选择方法: UI 测试可以牺牲统计精度, 模型验证则需要更严格任务效用和隐私测试。
保真度 vs 泄露风险 越像真实数据, 越可能记住真实客户或罕见记录。高保真数据集要重点测试最近邻距离、孤立样本、小单元和文本片段复现。文本合成尤其要防止生成真实客户语句、地址、账号、投诉内容或员工备注。
规则生成 vs 模型生成 规则生成可控、可解释, 适合流程测试和边界样本; 模型生成更自然, 适合复杂分布和文本场景, 但更难证明未记忆。混合方法通常更稳: 规则生成关键边界, 模型补充自然变体。
内部沙盒 vs 外部共享 内部使用不等于无风险, 但外部共享显著提高再识别和误用风险。外部共享需要更严格字段限制、攻击测试、使用协议、水印或访问控制, 并重新评估 allowed-use。
一次性发布 vs 持续数据产品 合成数据会随源数据、业务规则、产品流程和客户行为变化而过期。把它作为长期数据产品管理, 才能处理版本、退役、再生成和使用漂移。
证据与控制
Release gate
| 门禁 | 必须证明 | 典型证据 |
|---|---|---|
| Source permission | 真实来源允许用于该合成目的 | source registry、用途批准、字段清单 |
| Minimization | 生成前已移除非必要敏感信息 | 字段裁剪、稀有值处理、数据保留说明 |
| Privacy risk | 重识别和推断风险在阈值内 | attack test report、nearest-neighbor analysis |
| Utility | 对目标任务有足够可用性 | task benchmark、测试通过率、模型性能差异 |
| Fidelity | 关键统计和业务结构被合理保留 | distribution profile、correlation comparison |
| Bias and fairness | 没有制造不可接受偏差或掩盖真实差异 | subgroup analysis、long-tail coverage |
| Allowed-use | 使用范围、禁止用途和有效期明确 | data card、catalog policy、access control |
| Monitoring | 能追踪访问、复制、训练和外部共享 | audit log、usage telemetry、retirement plan |
Privacy attack set
- Membership inference: 判断某真实记录是否进入源训练集。
- Attribute inference: 从合成记录推断真实敏感属性。
- Nearest-neighbor leakage: 合成记录与真实记录过近。
- Outlier memorization: 稀有高风险客户或极端交易被复制。
- Linkage risk: 与外部数据或内部其他表连接后可重识别。
- Text regurgitation: 合成文本复现真实投诉、备注、地址或身份片段。
Utility and fidelity evidence
效用证据应按任务组织:
- 流程测试: 字段格式、状态迁移、异常路径、规则覆盖。
- 模型开发: baseline 性能、特征关系、子群稳定性、长尾表现。
- 压力测试: 数据量、峰值模式、失败路径和系统容量。
- 演示培训: 语义合理性、无真实客户信息、场景覆盖。
- 供应商沙盒: 接口契约、数据范围、访问审计和禁止再训练条款。
保真度证据应说明保留和扭曲边界, 不只给一个相似度分数。特别要说明长尾、罕见事件和异常模式是否被保留, 因为这些通常决定金融 AI 的风险价值。
金融零售/AI产品场景
KYC onboarding 测试数据 适合用合成数据覆盖证件类型、地址格式、缺失字段、补件路径和异常状态。不能因此推断真实客户放弃率或审批通过率, 除非效用验证专门覆盖这些目标。
欺诈模型开发 欺诈长尾和罕见组合很重要, 但高保真合成会提高泄露风险。可用规则生成边界样本、模型生成背景样本, 并明确哪些结果只能用于 robustness testing, 不能用于最终性能证明。
AML typology simulation 合成交易网络可用于训练调查流程和测试图算法, 但 typology 可能敏感。需要控制共享范围, 防止把机构监测逻辑暴露给不应访问的人。
Contact center transcript sandbox 合成对话可用于训练和测试回复助手。文本生成必须避免复现真实客户投诉、姓名、地址、账号和员工评论。还要保留足够的情绪、歧义和政策边界样本。
供应商 PoC 数据 合成数据常用于外部供应商评估。发布前要明确禁止再训练、禁止外部复用、访问期限、删除证明和结果回传范围。外部沙盒数据不应默认可用于生产模型选择。
开放创新或公开样例 公开数据集要求最高的隐私和误用控制。通常应大幅降低保真度, 移除长尾和敏感组合, 并把用途限制为接口演示或教育, 不能让外部误以为代表真实客户分布。
反模式
| 反模式 | 风险 | 替代做法 |
|---|---|---|
| “synthetic 所以没有隐私风险” | 可能记忆或推断真实客户 | privacy attack testing |
| 先生成再找用途 | 数据质量和风险门槛无法定义 | allowed-use first |
| 用一个相似度分数证明保真 | 掩盖长尾、相关性和业务规则失真 | task-based utility + fidelity profile |
| 把演示数据用于模型训练 | 任务效用不匹配, 结论失真 | data card 明确 permitted/prohibited use |
| 忽略来源许可 | 合成数据继承真实数据约束 | source permission gate |
| 外部共享无访问监控 | 二次使用和重识别不可控 | catalog、access control、audit log |
| 合成数据长期不更新 | 与业务流程和客户分布脱节 | expiry、review trigger、regeneration workflow |
最终心智模型
合成数据的治理问题不是“它是不是真数据”, 而是“它从哪些真实来源派生, 为哪个任务保留了哪些结构, 为降低隐私风险扭曲了哪些结构, 谁可以用, 不能用于什么, 证据是否足以支持发布”。
可用的 synthetic data 是有边界的数据产品。它必须同时带着 lineage、allowed-use、privacy attack results、utility evidence、fidelity profile 和 retirement plan。缺少这些证据时, 合成数据只是在隐私、安全和模型质量之间制造了一种新的不透明风险。
SOTA 状态标注 (2026-07-01)
本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。