Federated Learning / FedAvg:跨域协作 AI
Federated Learning 解决的是“数据不能或不应集中,但多个数据持有方仍需要协作建模”的问题。FedAvg 的核心是把模型发送到本地训练,再聚合本地更新,而不是把原始数据搬到同一个训练环境。
Federated Learning / FedAvg 解读
Source Anchors
| Source | Link | 用途 |
|---|---|---|
| FedAvg paper | https://arxiv.org/abs/1602.05629 | 理解 Federated Averaging 和 decentralized training 的基本问题 |
| Google Research publication | https://research.google/pubs/communication-efficient-learning-of-deep-networks-from-decentralized-data/ | 理解通信效率和分布式客户端训练的背景 |
| TensorFlow Federated | https://www.tensorflow.org/federated | 理解 federated computation 的工程抽象 |
| TensorFlow Federated GitHub | https://github.com/tensorflow/federated | 理解 TFF 作为开源实验框架的边界 |
| NIST AI RMF | https://www.nist.gov/itl/ai-risk-management-framework | 把联邦学习纳入风险、测量、治理和监控 |
核心导读
Federated Learning 解决的是“数据不能或不应集中,但多个数据持有方仍需要协作建模”的问题。FedAvg 的核心是把模型发送到本地训练,再聚合本地更新,而不是把原始数据搬到同一个训练环境。
它的机制价值在于减少原始数据移动、支持跨组织或跨设备协作、为数据主权和隐私控制提供技术基础。但它不是隐私、合规和安全的自动豁免。模型更新、标签口径、参与方行为、客户影响和责任边界仍然需要完整治理。
从架构角度看,联邦学习不是单个训练算法,而是 federation operating model:参与方准入、数据契约、批准代码、更新聚合、隐私预算、本地评估和退出规则共同决定系统能否用于生产。评估证据也不能只看全局模型指标,必须同时看本地切片、少数群体、标签延迟、异常更新和部署后的客户影响。
治理边界在于:FedAvg 可以改变数据协作方式,但不能消除隐私披露、poisoning、责任归属和监管适用性。高影响金融决策仍要经过本地验证、模型风险审批、政策约束和人工例外路径;“数据不出本地”不是上线充分条件。
问题定义
金融零售中的高价值模型经常跨数据边界:
- 欺诈团伙跨银行、商户和支付网络迁移,单家机构样本不足。
- 集团内银行、保险、财富、零售子公司不能随意合并客户数据。
- 不同国家或地区有 data residency 和监管边界。
- 合作方、商户、渠道拥有本地行为数据,但不愿共享原始数据。
- 移动端设备有行为信号,但上传原始明细会带来隐私和带宽成本。
传统集中训练假设:
all raw data -> central data lake -> training -> shared model
联邦学习改成:
coordinator sends current model
-> participants train locally
-> participants send model updates
-> coordinator aggregates updates
-> shared model improves
问题边界要讲清楚: 联邦学习减少数据移动,不等于没有数据披露风险;它改变协作对象,从“共享原始数据”变成“共享模型更新和评估证据”。
核心原理
FedAvg 的基本循环:
initialize global model
-> select participants
-> send model weights
-> local training for multiple steps
-> return weight/gradient updates
-> aggregate updates, often weighted by local data size
-> repeat communication rounds
机制含义:
| 机制 | 价值 | 需要控制的问题 |
|---|---|---|
| Local training | 原始样本留在本地 | 本地代码、数据质量和标签口径是否可信 |
| Model update sharing | 协作对象更小 | 更新仍可能泄露训练信息 |
| Weighted aggregation | 大数据方贡献被体现 | 大机构可能主导模型,少数参与方效果变差 |
| Client sampling | 降低通信和计算成本 | 抽样偏差会影响模型稳定性 |
| Communication rounds | 支持分布式训练 | 网络、延迟、参与方可用性成为系统约束 |
Cross-device 与 cross-silo 的差别很重要:
| 类型 | 参与方 | 主要挑战 | 金融零售映射 |
|---|---|---|---|
| Cross-device | 大量个人设备 | 设备可用性、电量、网络、用户级隐私 | 移动银行个性化、设备侧欺诈信号 |
| Cross-silo | 少量组织或数据域 | 合同、治理、schema、标签、责任 | 银行联盟欺诈、集团内信贷/KYC |
金融零售更常见的是 cross-silo。参与方少但每方数据量大,技术难点从设备可用性转向数据契约、参与方治理、模型所有权、审计和责任分配。
非独立同分布数据是核心挑战。各参与方客户结构、渠道、地区、产品、欺诈类型和标签延迟不同,简单平均可能得到一个总体看似更好、局部明显变差的模型。
系统/架构模型
Cross-silo FL 可组织为:
Federation governance
-> participant onboarding and attestation
-> data and label contract
-> approved training code/container
-> coordinator
-> model version
-> participant selection
-> secure aggregation
-> update validation
-> privacy accounting
-> participant runtime
-> local feature pipeline
-> local training
-> local validation
-> update submission
-> global model registry
-> local deployment or fine-tuning
-> audit evidence and monitoring
关键组件:
| 组件 | 责任 |
|---|---|
| Coordinator | 分发模型、组织训练轮次、聚合更新、保存版本 |
| Participant runtime | 在本地执行批准代码、训练和验证 |
| Secure aggregation | 限制协调方观察单个参与方更新 |
| Privacy accountant | 记录差分隐私参数和累计预算 |
| Update validation | 检测异常、poisoning、漂移和低质量更新 |
| Data contract | 定义 schema、标签、时间窗口、质量阈值 |
| Model registry | 管理全局模型、本地模型、版本和评估结果 |
| Audit log | 记录训练轮次、参与方、更新摘要、隐私参数和审批 |
共享模型不一定统一部署。常见模式有:
- 训练一个全局初始模型,各方本地 fine-tune。
- 聚合共享表示层,本地保留决策头。
- 只共享 embedding 或特征表示,不共享最终审批模型。
- 全局模型只作为辅助信号,正式决策仍由本地模型和规则完成。
关键机制与取舍
| 机制 | 价值 | 取舍 |
|---|---|---|
| Local epochs | 减少通信轮次 | 本地训练太多会加剧参与方漂移 |
| Weighted averaging | 简单高效,反映样本规模 | 可能牺牲小参与方和小群体表现 |
| Secure aggregation | 降低单方更新暴露 | 增加调试、异常定位和系统复杂度 |
| Differential privacy | 限制单个样本影响 | 降低效用,稀有欺诈模式可能被噪声淹没 |
| Participant attestation | 确认运行批准环境和代码 | 需要可信执行、运维和证书体系 |
| Update anomaly detection | 防 poisoning 和质量问题 | 需要定义异常,不应泄露过多参与方信息 |
| Global vs local model | 全球协作与本地适配平衡 | 责任和客户影响归属更复杂 |
| Exit handling | 支持参与方退出 | 已贡献更新对模型的影响难以完全移除 |
联邦学习最容易被误解的取舍是隐私和效用。Secure aggregation 可以让协调方只看聚合结果,不看单方更新;差分隐私可以限制样本级影响;但二者都不是免费控制,会影响可观测性、调试能力和模型质量。
证据与控制
联邦学习的证据链要覆盖训练前、训练中和部署后:
| 阶段 | 控制 |
|---|---|
| Before federation | 参与方资格、合同、用途、数据边界、模型所有权、退出规则 |
| Data alignment | schema、标签定义、时间窗口、质量阈值、缺失规则 |
| Runtime assurance | 批准代码、环境 attestation、密钥管理、通信安全 |
| Training rounds | 参与方列表、轮次、模型版本、隐私参数、聚合摘要 |
| Update validation | 异常更新、poisoning signal、漂移、贡献质量 |
| Evaluation | 全局指标、本地指标、客户群体切片、地区切片、误判成本 |
| Deployment | 本地验证、模型风险审批、fallback、rollback |
| Audit | 训练证据包、政策审批、事故复盘、监管问询材料 |
关键评估不能只看 global AUC。必须同时看:
- 每个参与方本地表现。
- 少数客户群体和地区切片。
- false positive / false negative 成本。
- 标签延迟对训练和评估的影响。
- 更新异常和参与方漂移。
- 模型输出是否直接影响客户权益。
金融零售场景映射
跨机构欺诈模型:
bank A local fraud data
bank B local fraud data
bank C local fraud data
-> local training
-> secure aggregated updates
-> shared fraud representation/model
-> local validation and deployment
核心问题不是算法能否跑通,而是欺诈标签是否一致、确认延迟如何处理、低质量或恶意更新如何发现、误拒客户责任如何分配、模型是否作为拦截依据还是辅助评分。
集团内信贷模型:
- 子公司或地区共享模式,但客户数据不能集中。
- 可训练共享表示或初始模型。
- 正式信贷决策仍需要本地验证、公平评估、原因码和 adverse action 边界。
- 本地政策、监管和产品差异不能被全局平均抹平。
KYC 文档模型:
- 不同地区证件和材料样式不同。
- 联邦学习可提升文档类型识别、OCR 质量和缺失检测。
- 文档包含高敏 PII,必须结合本地保留、权限、审计和人工复核。
移动端个性化:
- 设备侧学习可减少行为明细上传。
- 需要客户同意、设备条件、模型大小、差分隐私和 secure aggregation。
- 不适合把高影响客户决策完全下放到设备侧。
反模式
- 说“数据不出本地,所以一定合规”,没有隐私、法律和模型风险评估。
- 只统一模型结构,不统一标签定义、时间窗口和数据质量。
- 让大数据参与方通过加权平均支配模型,却不看小参与方和小群体表现。
- 没有 secure aggregation 或异常更新检测,无法防泄露和 poisoning。
- 全局指标提升后直接部署到所有参与方,不做本地验证。
- 参与方退出、模型所有权、客户投诉和责任分配没有预先约定。
- 把联邦模型输出直接用于拒绝、冻结、拦截等高影响动作,没有本地控制和人工路径。
- 没有保存训练轮次、参数、参与方、隐私预算和评估证据。
最终心智模型
Federated Learning 是“模型到数据那里去”的协作架构。它减少原始数据移动,但把复杂度转移到参与方治理、数据契约、更新安全、隐私预算、局部评估和责任分配。
正确的心智模型是: FedAvg 提供协作训练机制,secure aggregation 和差分隐私提供部分隐私控制,数据契约和本地评估保证模型可用,治理协议决定能否用于真实客户影响场景。
SOTA 状态标注 (2026-07-01)
本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。