返回 Papers
AI 底层逻辑 / 经典论文

Federated Learning / FedAvg:跨域协作 AI

Federated Learning 解决的是“数据不能或不应集中,但多个数据持有方仍需要协作建模”的问题。FedAvg 的核心是把模型发送到本地训练,再聚合本地更新,而不是把原始数据搬到同一个训练环境。

227ai-foundations/papers/39-federated-learning-fedavg-cross-silo-ai.md

Federated Learning / FedAvg 解读

Source Anchors

SourceLink用途
FedAvg paperhttps://arxiv.org/abs/1602.05629理解 Federated Averaging 和 decentralized training 的基本问题
Google Research publicationhttps://research.google/pubs/communication-efficient-learning-of-deep-networks-from-decentralized-data/理解通信效率和分布式客户端训练的背景
TensorFlow Federatedhttps://www.tensorflow.org/federated理解 federated computation 的工程抽象
TensorFlow Federated GitHubhttps://github.com/tensorflow/federated理解 TFF 作为开源实验框架的边界
NIST AI RMFhttps://www.nist.gov/itl/ai-risk-management-framework把联邦学习纳入风险、测量、治理和监控

核心导读

Federated Learning 解决的是“数据不能或不应集中,但多个数据持有方仍需要协作建模”的问题。FedAvg 的核心是把模型发送到本地训练,再聚合本地更新,而不是把原始数据搬到同一个训练环境。

它的机制价值在于减少原始数据移动、支持跨组织或跨设备协作、为数据主权和隐私控制提供技术基础。但它不是隐私、合规和安全的自动豁免。模型更新、标签口径、参与方行为、客户影响和责任边界仍然需要完整治理。

从架构角度看,联邦学习不是单个训练算法,而是 federation operating model:参与方准入、数据契约、批准代码、更新聚合、隐私预算、本地评估和退出规则共同决定系统能否用于生产。评估证据也不能只看全局模型指标,必须同时看本地切片、少数群体、标签延迟、异常更新和部署后的客户影响。

治理边界在于:FedAvg 可以改变数据协作方式,但不能消除隐私披露、poisoning、责任归属和监管适用性。高影响金融决策仍要经过本地验证、模型风险审批、政策约束和人工例外路径;“数据不出本地”不是上线充分条件。

问题定义

金融零售中的高价值模型经常跨数据边界:

  • 欺诈团伙跨银行、商户和支付网络迁移,单家机构样本不足。
  • 集团内银行、保险、财富、零售子公司不能随意合并客户数据。
  • 不同国家或地区有 data residency 和监管边界。
  • 合作方、商户、渠道拥有本地行为数据,但不愿共享原始数据。
  • 移动端设备有行为信号,但上传原始明细会带来隐私和带宽成本。

传统集中训练假设:

all raw data -> central data lake -> training -> shared model

联邦学习改成:

coordinator sends current model
  -> participants train locally
  -> participants send model updates
  -> coordinator aggregates updates
  -> shared model improves

问题边界要讲清楚: 联邦学习减少数据移动,不等于没有数据披露风险;它改变协作对象,从“共享原始数据”变成“共享模型更新和评估证据”。

核心原理

FedAvg 的基本循环:

initialize global model
  -> select participants
  -> send model weights
  -> local training for multiple steps
  -> return weight/gradient updates
  -> aggregate updates, often weighted by local data size
  -> repeat communication rounds

机制含义:

机制价值需要控制的问题
Local training原始样本留在本地本地代码、数据质量和标签口径是否可信
Model update sharing协作对象更小更新仍可能泄露训练信息
Weighted aggregation大数据方贡献被体现大机构可能主导模型,少数参与方效果变差
Client sampling降低通信和计算成本抽样偏差会影响模型稳定性
Communication rounds支持分布式训练网络、延迟、参与方可用性成为系统约束

Cross-device 与 cross-silo 的差别很重要:

类型参与方主要挑战金融零售映射
Cross-device大量个人设备设备可用性、电量、网络、用户级隐私移动银行个性化、设备侧欺诈信号
Cross-silo少量组织或数据域合同、治理、schema、标签、责任银行联盟欺诈、集团内信贷/KYC

金融零售更常见的是 cross-silo。参与方少但每方数据量大,技术难点从设备可用性转向数据契约、参与方治理、模型所有权、审计和责任分配。

非独立同分布数据是核心挑战。各参与方客户结构、渠道、地区、产品、欺诈类型和标签延迟不同,简单平均可能得到一个总体看似更好、局部明显变差的模型。

系统/架构模型

Cross-silo FL 可组织为:

Federation governance
  -> participant onboarding and attestation
  -> data and label contract
  -> approved training code/container
  -> coordinator
       -> model version
       -> participant selection
       -> secure aggregation
       -> update validation
       -> privacy accounting
  -> participant runtime
       -> local feature pipeline
       -> local training
       -> local validation
       -> update submission
  -> global model registry
  -> local deployment or fine-tuning
  -> audit evidence and monitoring

关键组件:

组件责任
Coordinator分发模型、组织训练轮次、聚合更新、保存版本
Participant runtime在本地执行批准代码、训练和验证
Secure aggregation限制协调方观察单个参与方更新
Privacy accountant记录差分隐私参数和累计预算
Update validation检测异常、poisoning、漂移和低质量更新
Data contract定义 schema、标签、时间窗口、质量阈值
Model registry管理全局模型、本地模型、版本和评估结果
Audit log记录训练轮次、参与方、更新摘要、隐私参数和审批

共享模型不一定统一部署。常见模式有:

  • 训练一个全局初始模型,各方本地 fine-tune。
  • 聚合共享表示层,本地保留决策头。
  • 只共享 embedding 或特征表示,不共享最终审批模型。
  • 全局模型只作为辅助信号,正式决策仍由本地模型和规则完成。

关键机制与取舍

机制价值取舍
Local epochs减少通信轮次本地训练太多会加剧参与方漂移
Weighted averaging简单高效,反映样本规模可能牺牲小参与方和小群体表现
Secure aggregation降低单方更新暴露增加调试、异常定位和系统复杂度
Differential privacy限制单个样本影响降低效用,稀有欺诈模式可能被噪声淹没
Participant attestation确认运行批准环境和代码需要可信执行、运维和证书体系
Update anomaly detection防 poisoning 和质量问题需要定义异常,不应泄露过多参与方信息
Global vs local model全球协作与本地适配平衡责任和客户影响归属更复杂
Exit handling支持参与方退出已贡献更新对模型的影响难以完全移除

联邦学习最容易被误解的取舍是隐私和效用。Secure aggregation 可以让协调方只看聚合结果,不看单方更新;差分隐私可以限制样本级影响;但二者都不是免费控制,会影响可观测性、调试能力和模型质量。

证据与控制

联邦学习的证据链要覆盖训练前、训练中和部署后:

阶段控制
Before federation参与方资格、合同、用途、数据边界、模型所有权、退出规则
Data alignmentschema、标签定义、时间窗口、质量阈值、缺失规则
Runtime assurance批准代码、环境 attestation、密钥管理、通信安全
Training rounds参与方列表、轮次、模型版本、隐私参数、聚合摘要
Update validation异常更新、poisoning signal、漂移、贡献质量
Evaluation全局指标、本地指标、客户群体切片、地区切片、误判成本
Deployment本地验证、模型风险审批、fallback、rollback
Audit训练证据包、政策审批、事故复盘、监管问询材料

关键评估不能只看 global AUC。必须同时看:

  • 每个参与方本地表现。
  • 少数客户群体和地区切片。
  • false positive / false negative 成本。
  • 标签延迟对训练和评估的影响。
  • 更新异常和参与方漂移。
  • 模型输出是否直接影响客户权益。

金融零售场景映射

跨机构欺诈模型:

bank A local fraud data
bank B local fraud data
bank C local fraud data
  -> local training
  -> secure aggregated updates
  -> shared fraud representation/model
  -> local validation and deployment

核心问题不是算法能否跑通,而是欺诈标签是否一致、确认延迟如何处理、低质量或恶意更新如何发现、误拒客户责任如何分配、模型是否作为拦截依据还是辅助评分。

集团内信贷模型:

  • 子公司或地区共享模式,但客户数据不能集中。
  • 可训练共享表示或初始模型。
  • 正式信贷决策仍需要本地验证、公平评估、原因码和 adverse action 边界。
  • 本地政策、监管和产品差异不能被全局平均抹平。

KYC 文档模型:

  • 不同地区证件和材料样式不同。
  • 联邦学习可提升文档类型识别、OCR 质量和缺失检测。
  • 文档包含高敏 PII,必须结合本地保留、权限、审计和人工复核。

移动端个性化:

  • 设备侧学习可减少行为明细上传。
  • 需要客户同意、设备条件、模型大小、差分隐私和 secure aggregation。
  • 不适合把高影响客户决策完全下放到设备侧。

反模式

  • 说“数据不出本地,所以一定合规”,没有隐私、法律和模型风险评估。
  • 只统一模型结构,不统一标签定义、时间窗口和数据质量。
  • 让大数据参与方通过加权平均支配模型,却不看小参与方和小群体表现。
  • 没有 secure aggregation 或异常更新检测,无法防泄露和 poisoning。
  • 全局指标提升后直接部署到所有参与方,不做本地验证。
  • 参与方退出、模型所有权、客户投诉和责任分配没有预先约定。
  • 把联邦模型输出直接用于拒绝、冻结、拦截等高影响动作,没有本地控制和人工路径。
  • 没有保存训练轮次、参数、参与方、隐私预算和评估证据。

最终心智模型

Federated Learning 是“模型到数据那里去”的协作架构。它减少原始数据移动,但把复杂度转移到参与方治理、数据契约、更新安全、隐私预算、局部评估和责任分配。

正确的心智模型是: FedAvg 提供协作训练机制,secure aggregation 和差分隐私提供部分隐私控制,数据契约和本地评估保证模型可用,治理协议决定能否用于真实客户影响场景。


SOTA 状态标注 (2026-07-01)

本篇属于第二、三遍深读池(参考架构/深读笔记),未列入 12 周主线必读。时效基线为写作时点;引用前请按 CLAUDE.md 全局时效性硬规则复查最新进展。模块级 SOTA 对照见 docs/AI_SYSTEMATIC_LEARNING_ROADMAP_2026.md 各周「2026 SOTA 对照」行与文末「SOTA 检查」。