联邦学习(Federated Learning, FL)

联邦学习(Federated Learning, FL)核心定义

联邦学习是一种分布式机器学习框架,核心原则是「数据不出本地,模型协同训练」:多个数据持有方(客户端)在不共享原始训练数据的前提下,共同训练一个全局模型;训练过程中仅在客户端与中央服务器之间传输模型更新(参数、梯度或适配器),由服务器完成聚合迭代,最终所有客户端共享一个统一的全局模型。

它本质上是为了解决数据孤岛隐私合规两大痛点而生的------医疗、金融、政务、端侧设备等场景的数据因法律限制、商业壁垒无法集中汇总,联邦学习提供了在数据不动的前提下挖掘数据价值的解决方案。


一、核心思想与典型训练流程

最经典的联邦学习算法是FedAvg(联邦平均),以横向联邦为例,完整训练流程如下:

  1. 全局初始化:中央服务器初始化一个基础模型(比如预训练大模型),下发给所有参与训练的客户端。
  2. 本地训练:每个客户端用自己的私有数据,在本地对模型进行微调训练,得到本地的模型更新量(可以是全量参数更新、梯度,也可以是LoRA适配器)。
  3. 更新上传:客户端仅将训练得到的模型更新量上传到中央服务器,原始数据全程保留在本地。
  4. 全局聚合:服务器对所有客户端上传的更新量进行加权聚合(通常按本地数据量占比加权),得到全局更新。
  5. 模型下发:服务器将聚合后的全局更新下发给所有客户端,客户端更新本地模型。
  6. 迭代循环:重复步骤2~5,直到模型收敛或达到预设训练轮次。

二、三大主流分类

根据数据划分方式的不同,联邦学习分为三类,其中横向联邦学习是大模型微调场景的绝对主流

1. 横向联邦学习(Horizontal FL)
  • 数据划分:各客户端的特征空间一致,但样本空间不同(按样本维度划分数据)。比如不同医院都有电子病历,字段相同但病人不同;不同手机用户都有文本输入数据,特征空间一致但内容不同。
  • 核心场景:跨机构大模型微调、端侧个性化训练,也是联邦LoRA的默认场景。
  • 特点:所有客户端共享同一模型结构,聚合逻辑相对简单,核心挑战是数据非独立同分布(Non-IID)、通信开销与隐私泄露。
2. 纵向联邦学习(Vertical FL)
  • 数据划分:各客户端的样本空间一致,但特征空间不同(按特征维度划分数据)。比如同一家企业的用户,电商部门有行为数据,金融部门有征信数据,用户重叠但特征不同。
  • 核心场景:跨机构联合风控、用户画像,通常用于传统机器学习,很少用于大模型微调。
3. 联邦迁移学习(Federated Transfer Learning)
  • 当客户端的样本空间和特征空间差异都较大时,结合迁移学习实现协同训练,适用场景更小众。

三、核心优势

  1. 隐私合规:原始数据无需出域,符合GDPR、数据安全法等隐私法规,从根源上规避了数据泄露风险。
  2. 数据价值最大化:打破机构间的数据壁垒,多方数据共同赋能模型,无需数据交易即可实现价值共享。
  3. 分布式算力利用:训练计算分散在各客户端本地,服务器仅负责聚合,大幅降低中心算力压力,可利用海量端侧设备算力。
  4. 泛化性更强:多源数据联合训练的模型通常比单源数据模型泛化能力更好,能覆盖更多场景。

四、核心挑战(也是你的研究切入点)

联邦学习的落地瓶颈主要集中在隐私、效率、异构性三个方面。

1. 隐私泄露风险

虽然不传输原始数据,但上传的模型梯度、参数仍然携带训练数据信息。攻击者可以通过梯度反演攻击(如DAGER)、成员推断攻击等,从模型更新中还原出客户端的本地训练文本、图像甚至标签信息。

  • 对应解决方案:安全聚合、同态加密、差分隐私、秘密共享等隐私技术,也就是SHE-LoRA的核心研究内容。
2. 通信与计算开销巨大

大模型时代,全参数微调的参数量高达几十亿到上千亿,每轮上传下载全量参数的通信成本极高,端侧设备完全无法承载。

  • 对应解决方案:以LoRA为代表的参数高效微调(PEFT),将更新参数量压缩几个数量级,让联邦大模型微调具备落地可行性。
3. 客户端异构性

真实场景中各客户端差异极大:

  • 数据异构:各客户端数据分布不一致(Non-IID),直接平均聚合会导致模型精度下降、收敛变慢;
  • 设备异构:算力、内存、网络带宽差异大,弱设备无法承担高秩LoRA、全同态加密等高开销操作。
  • 对应解决方案:异构LoRA聚合算法、自适应加密预算,也就是SHE-LoRA中重点解决的异构适配问题。
4. 系统鲁棒性与恶意攻击

客户端可能掉线、退出,也可能存在恶意节点上传毒化参数破坏全局模型,需要鲁棒的聚合协议与防御机制。

相关推荐
Zzj_tju4 小时前
CLIP 图文对齐:先核对正样本,再相信检索分数
人工智能·深度学习·语言模型·自然语言处理
Zzj_tju6 小时前
VLM 读图评测:先审计评分器,再判断读错还是算错
人工智能·深度学习·机器学习·语言模型
夜瞬14 小时前
Merge、Ensemble 与 Cooperate:一文读懂大语言模型协同
人工智能·深度学习·语言模型
一技安身1 天前
【大模型】Win11 部署 DeepSeek+ RAGFlow0.27.2 (Ollama方案,断网可用)
docker·ai·语言模型
顾城猿1 天前
LoRA基础
语言模型
余槐i1 天前
使用Ollama本地部署和测试Kimi、GLM等多款大语言模型实战
人工智能·语言模型·自然语言处理·大模型·api
AI 思录1 天前
AI生造词、乱用术语怎么治?一份防“词汇污染“的Prompt约束模板
人工智能·语言模型·prompt·ai写作·用户体验·ai合规
喵喵爱自由1 天前
Deepseek Harness镜像离线部署
docker·ai·语言模型
一技安身1 天前
【信创】Ollama 手动提取 deepseek-r1:1.5b模型迁移到内网机器
服务器·docker·语言模型