返回 Papers
AI 底层逻辑 / 经典论文

AI Synthetic Data Governance:隐私-效用-保真度架构

合成数据不是“假数据所以安全”, 也不是把真实客户数据丢给生成器后自动得到可共享资产。对金融零售 AI 来说, synthetic data 是一种受治理的数据产品: 它有来源许可、生成方法、隐私攻击面、效用边界、保真度限制、适用场景、发布门禁和持续监控。

211ai-foundations/papers/173-ai-synthetic-data-governance-privacy-utility-fidelity-architecture.md

AI 合成数据治理架构:Synthetic Data Governance / Privacy-Utility-Fidelity Architecture

配对阅读:本篇的操作手册版(模板/RACI/门禁/runbook)是 docs/AI_SYNTHETIC_DATA_GOVERNANCE_PRIVACY_UTILITY_FIDELITY_PLAYBOOK.md。第一遍读本篇建立原理与架构判断;第二遍做案例时再用 playbook 查表落地,两者不需要重复精读。

Source Anchors

SourceLink用途
UK ICO synthetic data guidancehttps://ico.org.uk/about-the-ico/research-reports-impact-and-evaluation/research-and-reports/technology-and-innovation/synthetic-data/作为 synthetic data privacy risk、utility、governance 和误用风险的锚点
NIST Privacy Frameworkhttps://www.nist.gov/privacy-framework用 privacy risk management 思维组织 source permission、privacy attack testing、控制和证据
NIST AI RMFhttps://www.nist.gov/itl/ai-risk-management-framework用 Govern / Map / Measure / Manage 组织 AI synthetic data 风险治理和 release gate
ISO/IEC 42001https://www.iso.org/standard/81230.html用 AI management system 思维设计 roles、operation、performance evaluation、internal audit 和持续改进
ISO/IEC 23894https://www.iso.org/standard/77304.html用 AI risk management lifecycle 思维组织 risk identification、analysis、treatment 和 monitoring
W3C PROVhttps://www.w3.org/TR/prov-overview/用 entity / activity / agent 模型描述 synthetic data provenance、生成活动和责任主体

核心导读

合成数据不是“假数据所以安全”, 也不是把真实客户数据丢给生成器后自动得到可共享资产。对金融零售 AI 来说, synthetic data 是一种受治理的数据产品: 它有来源许可、生成方法、隐私攻击面、效用边界、保真度限制、适用场景、发布门禁和持续监控。

成熟治理要同时处理 privacy、utility、fidelity 三角。隐私越强, 细节可能越少; 保真度越高, 重识别和成员推断风险可能越高; 效用越强, 可能只对某些任务成立。没有明确 allowed-use 和证据包的 synthetic data, 不能因为“synthetic”这个标签就进入模型训练、测试、供应商共享或外部演示。

问题定义

金融零售场景需要大量数据来训练模型、测试流程、压测系统、验证边界案例和支持供应商协作, 但真实数据受到隐私、保密、合规、客户信任和数据最小化约束。Synthetic data 看似解决矛盾, 实际引入新的治理问题:

  • 生成数据可能泄露真实客户记录或罕见组合。
  • 数据看似合理, 但破坏关键统计关系, 导致模型或测试结论失真。
  • 数据适合演示, 不适合训练; 适合 UI 测试, 不适合风控评估。
  • 生成过程没有 lineage, 事后无法解释来源、参数、过滤和版本。
  • 外部共享后被用于未批准目的, 或与其他数据结合重识别。
  • 合成数据中的偏差、缺失和边界样本被误认为真实世界分布。

因此, synthetic data governance 的核心不是“能不能生成”, 而是“基于什么真实来源、为哪个用途、在什么隐私风险下、保留哪些统计属性、禁止哪些使用、如何证明和复审”。

核心原理/方法

Allowed-use first 先定义用途, 再生成数据。用途可以是 UI demo、测试自动化、模型预训练、异常样本扩充、供应商沙盒、隐私保护分析或压力测试。不同用途对隐私、效用和保真度的要求完全不同。

Source permission and minimization 合成数据仍然继承真实来源数据的治理义务。必须记录真实数据来源、授权用途、字段敏感度、保留规则、客户群范围和生成前最小化处理。不能用未经批准的生产数据生成“看似脱敏”的资产。

Privacy attack testing 合成数据发布前需要测试 membership inference、attribute inference、nearest-neighbor leakage、outlier memorization、linkage risk 和 small-cell disclosure。特别是高净值客户、欺诈样本、罕见疾病、极端交易和投诉文本等稀有样本, 更容易被记忆。

Utility by task, not in general 效用不是全局属性。某个合成数据集可能适合测试 KYC 表单校验, 但不适合训练 AML 模型; 可能适合展示客服流程, 但不适合估计客户投诉率。每个数据集必须绑定任务和验证指标。

Fidelity with boundaries 保真度要说明保留了哪些结构: 分布、相关性、时间序列、长尾、类别比例、文本意图、业务规则、异常模式。也要说明没有保留什么。否则使用者会把合成数据当成真实世界替代品。

系统/架构模型

参考架构

Source data registry
  -> Permission and minimization gate
  -> Generation design
  -> Synthetic data generator
  -> Privacy attack lab
  -> Utility and fidelity evaluation
  -> Allowed-use release gate
  -> Synthetic data catalog
  -> Consumption monitoring
  -> Retirement / regeneration

核心组件

组件职责关键控制
Source data registry记录真实数据来源、用途许可、敏感等级和保留要求未登记或未授权来源不得生成
Use-case classifier定义合成数据用途、风险等级、使用者和共享范围用途决定隐私和效用门槛
Minimization pipeline过滤字段、稀有值、直接标识符和非必要历史生成前降低泄露面
Generation engine使用规则、统计模型、生成模型或混合方法生成数据参数、版本和随机种子可追溯
Privacy attack lab执行重识别、成员推断、属性推断和邻近样本测试发布前必须通过阈值
Utility evaluator按目标任务评估可用性不允许用泛化指标替代任务验证
Fidelity profiler比较分布、相关性、时间结构和长尾模式标明保留和失真边界
Release gate决定允许、限制、内部使用、外部共享或拒绝发布输出 release evidence pack
Synthetic data catalog管理数据集版本、用途、限制、有效期和所有者使用者必须看到 allowed-use
Consumption monitor监控访问、下载、共享、模型训练和用途漂移防止数据集被二次误用
Regeneration workflow源数据、模型、规则或用途变化后再生成避免旧合成数据长期漂移

Synthetic data card

dataset_id: synth-kyc-2026-06-v3
source_lineage:
  source_domains: [digital_onboarding, document_review]
  source_period: 2025-10_to_2026-05
  source_permission: internal_testing_only
generation:
  method: hybrid_rules_plus_generative_model
  generator_version: synthgen-v7
  parameters_version: kyc-profile-v3
allowed_use:
  permitted: [workflow_testing, training_sandbox, edge_case_demo]
  prohibited: [credit_model_training, external_public_release, customer_impacting_decision]
privacy:
  attack_tests: [membership_inference, nearest_neighbor, small_cell]
  residual_risk: low_for_internal_sandbox
utility:
  validated_tasks: [form_validation, exception_routing_test]
  not_validated_tasks: [fraud_detection, approval_rate_estimation]
fidelity:
  preserved: [document_type_distribution, missing_field_patterns]
  distorted: [rare_country_combinations, high_risk_outliers]
governance:
  owner: data_governance_kyc
  expires_on: 2026-12-31
  review_trigger: source_schema_change_or_new_external_use

关键机制与取舍

隐私 vs 效用 强隐私保护可能削弱罕见模式、长尾组合和异常行为, 但这些恰恰是金融风控和合规测试关心的部分。解决方式不是盲目提高保真度, 而是按用途选择方法: UI 测试可以牺牲统计精度, 模型验证则需要更严格任务效用和隐私测试。

保真度 vs 泄露风险 越像真实数据, 越可能记住真实客户或罕见记录。高保真数据集要重点测试最近邻距离、孤立样本、小单元和文本片段复现。文本合成尤其要防止生成真实客户语句、地址、账号、投诉内容或员工备注。

规则生成 vs 模型生成 规则生成可控、可解释, 适合流程测试和边界样本; 模型生成更自然, 适合复杂分布和文本场景, 但更难证明未记忆。混合方法通常更稳: 规则生成关键边界, 模型补充自然变体。

内部沙盒 vs 外部共享 内部使用不等于无风险, 但外部共享显著提高再识别和误用风险。外部共享需要更严格字段限制、攻击测试、使用协议、水印或访问控制, 并重新评估 allowed-use。

一次性发布 vs 持续数据产品 合成数据会随源数据、业务规则、产品流程和客户行为变化而过期。把它作为长期数据产品管理, 才能处理版本、退役、再生成和使用漂移。

证据与控制

Release gate

门禁必须证明典型证据
Source permission真实来源允许用于该合成目的source registry、用途批准、字段清单
Minimization生成前已移除非必要敏感信息字段裁剪、稀有值处理、数据保留说明
Privacy risk重识别和推断风险在阈值内attack test report、nearest-neighbor analysis
Utility对目标任务有足够可用性task benchmark、测试通过率、模型性能差异
Fidelity关键统计和业务结构被合理保留distribution profile、correlation comparison
Bias and fairness没有制造不可接受偏差或掩盖真实差异subgroup analysis、long-tail coverage
Allowed-use使用范围、禁止用途和有效期明确data card、catalog policy、access control
Monitoring能追踪访问、复制、训练和外部共享audit log、usage telemetry、retirement plan

Privacy attack set

  • Membership inference: 判断某真实记录是否进入源训练集。
  • Attribute inference: 从合成记录推断真实敏感属性。
  • Nearest-neighbor leakage: 合成记录与真实记录过近。
  • Outlier memorization: 稀有高风险客户或极端交易被复制。
  • Linkage risk: 与外部数据或内部其他表连接后可重识别。
  • Text regurgitation: 合成文本复现真实投诉、备注、地址或身份片段。

Utility and fidelity evidence

效用证据应按任务组织:

  • 流程测试: 字段格式、状态迁移、异常路径、规则覆盖。
  • 模型开发: baseline 性能、特征关系、子群稳定性、长尾表现。
  • 压力测试: 数据量、峰值模式、失败路径和系统容量。
  • 演示培训: 语义合理性、无真实客户信息、场景覆盖。
  • 供应商沙盒: 接口契约、数据范围、访问审计和禁止再训练条款。

保真度证据应说明保留和扭曲边界, 不只给一个相似度分数。特别要说明长尾、罕见事件和异常模式是否被保留, 因为这些通常决定金融 AI 的风险价值。

金融零售/AI产品场景

KYC onboarding 测试数据 适合用合成数据覆盖证件类型、地址格式、缺失字段、补件路径和异常状态。不能因此推断真实客户放弃率或审批通过率, 除非效用验证专门覆盖这些目标。

欺诈模型开发 欺诈长尾和罕见组合很重要, 但高保真合成会提高泄露风险。可用规则生成边界样本、模型生成背景样本, 并明确哪些结果只能用于 robustness testing, 不能用于最终性能证明。

AML typology simulation 合成交易网络可用于训练调查流程和测试图算法, 但 typology 可能敏感。需要控制共享范围, 防止把机构监测逻辑暴露给不应访问的人。

Contact center transcript sandbox 合成对话可用于训练和测试回复助手。文本生成必须避免复现真实客户投诉、姓名、地址、账号和员工评论。还要保留足够的情绪、歧义和政策边界样本。

供应商 PoC 数据 合成数据常用于外部供应商评估。发布前要明确禁止再训练、禁止外部复用、访问期限、删除证明和结果回传范围。外部沙盒数据不应默认可用于生产模型选择。

开放创新或公开样例 公开数据集要求最高的隐私和误用控制。通常应大幅降低保真度, 移除长尾和敏感组合, 并把用途限制为接口演示或教育, 不能让外部误以为代表真实客户分布。

反模式

反模式风险替代做法
“synthetic 所以没有隐私风险”可能记忆或推断真实客户privacy attack testing
先生成再找用途数据质量和风险门槛无法定义allowed-use first
用一个相似度分数证明保真掩盖长尾、相关性和业务规则失真task-based utility + fidelity profile
把演示数据用于模型训练任务效用不匹配, 结论失真data card 明确 permitted/prohibited use
忽略来源许可合成数据继承真实数据约束source permission gate
外部共享无访问监控二次使用和重识别不可控catalog、access control、audit log
合成数据长期不更新与业务流程和客户分布脱节expiry、review trigger、regeneration workflow

最终心智模型

合成数据的治理问题不是“它是不是真数据”, 而是“它从哪些真实来源派生, 为哪个任务保留了哪些结构, 为降低隐私风险扭曲了哪些结构, 谁可以用, 不能用于什么, 证据是否足以支持发布”。

可用的 synthetic data 是有边界的数据产品。它必须同时带着 lineage、allowed-use、privacy attack results、utility evidence、fidelity profile 和 retirement plan。缺少这些证据时, 合成数据只是在隐私、安全和模型质量之间制造了一种新的不透明风险。


SOTA 状态标注 (2026-07-01)

本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。