前言
本文主要记录了 Wenhao Jiang 等人发表在 archive 上的论文《Federated Large Language Models: Feasibility, Robustness, Security and Future Directions》。文章主要从可行性、鲁棒性、安全性三个角度总结了现有的联邦大模型微调方法:

- 可行性 :FLLM 面临巨大的通信和计算开销,现有方法通过联邦参数高效微调(FedPEFT) 方法解决,包括全参数微调、参数高效微调、提示调优等。
- 鲁棒性 :聚焦于联邦学习中资源、数据、任务等多种异构场景的挑战。
- 安全性 :聚焦于联邦学习的隐私风险(数据重建、成员推理攻击)与安全隐患(投毒、后门、对抗攻击)。
推荐另一个专门讲解联邦大模型微调的博客:https://blog.csdn.net/2401_89384928/article/details/150702047
文章目录
- 前言
- 一、可行性
-
- [1. 全量微调](#1. 全量微调)
- [2. 参数高效微调](#2. 参数高效微调)
- [3. 提示词微调](#3. 提示词微调)
- [4. 其他](#4. 其他)
- 二、鲁棒性
-
- [1. 资源异构性](#1. 资源异构性)
- [2. 数据异构性](#2. 数据异构性)
- [3. 任务异构性](#3. 任务异构性)
- 三、安全性
-
- [1. 隐私风险](#1. 隐私风险)
-
- [1.1. 攻击](#1.1. 攻击)
-
- [1.1.1. 成员推理攻击(Membership Inference Attack,MIA)](#1.1.1. 成员推理攻击(Membership Inference Attack,MIA))
- [1.1.2. 数据重构攻击(Data Reconstruction Attack,DRA)](#1.1.2. 数据重构攻击(Data Reconstruction Attack,DRA))
- [1.1.3. 越狱攻击(Jailbreaking Attack,JA)](#1.1.3. 越狱攻击(Jailbreaking Attack,JA))
- [1.1.4. 提示词注入(Prompt Injection,PI)](#1.1.4. 提示词注入(Prompt Injection,PI))
- [1.1.5. 长尾数据泄露(Long-Tailed Data Leakage,LTLD)](#1.1.5. 长尾数据泄露(Long-Tailed Data Leakage,LTLD))
- [1.2. 防御](#1.2. 防御)
- [2. 安全隐患](#2. 安全隐患)
-
- [2.1. 攻击](#2.1. 攻击)
-
- [2.1.1. 数据投毒攻击(Data Poisoning Attack,DPA)](#2.1.1. 数据投毒攻击(Data Poisoning Attack,DPA))
- [2.1.2. 模型投毒攻击(Model Poisoning Attack,MPA)](#2.1.2. 模型投毒攻击(Model Poisoning Attack,MPA))
- [2.1.3. 后门攻击(Backdoor Attack,BA)](#2.1.3. 后门攻击(Backdoor Attack,BA))
- [2.2. 防御](#2.2. 防御)
- 四、未来方向
一、可行性
传统的 LLM 训练过程主要分为预训练与微调两个阶段,而当前的 FLLM 研究主要聚焦于微调阶段。在计算成本方面,反向传播对算力的巨大需求,使得客户端难以独立完成 LLM 的微调。在通信成本方面,FLLM 需要共享模型梯度或聚合模型参数,而客户端有限的网络带宽与大规模参数的频繁传输,容易在客户端与服务器之间形成通信瓶颈。现有方法主要分为全量微调、参数高效微调、提示词微调三类,不同方法的训练方式可见下图。

- 全量微调:微调大模型的所有参数。
- 参数高效微调:微调大模型的部分参数,包括冻结部分参数、插入额外的可训练参数两种方式。
- 提示词微调:不改变大模型参数,而是微调提示词。
- 其他方法:模型压缩、拆分学习、零阶优化
1. 全量微调
全参数微调是指在私有数据集上继续训练预训练LLM的全部参数,模型架构不变,仅优化已有参数以适应下游任务。此类方法适应性强、资源充足时性能最优、适用广泛,但对通信和硬件要求高,小数据下易过拟合,导致泛化能力下降。现有方法聚焦于领域适配和通信成本的压缩上,但由于无法从根本上解决高昂的计算、存储和通信开销问题,因此独立研究较少,通常仅作为其他方法的参考和对比基准。
2. 参数高效微调
为进一步降低计算和通信开销,部分参数微调、LoRA 微调、Adapter 微调等方法被引入联邦联邦微调流程中。
- 部分参数微调:仅更新大模型中的部分参数,如偏置参数、梯度变化最大的参数、中间参数。
- Adapter 微调 :客户端训练完后上传 Adapter 参数至服务器聚合,再广播回客户端进行下一轮。适合多任务、异构数据,性能接近全模型微调,但通信开销较高。现有方法主要聚焦于动态配置 Adapter 的深度和宽度,以及对分布外、异构等复杂场景的适配上。
- LoRA 微调 :客户端上传训练好的两个子矩阵,服务器聚合后广播。适合NLP任务、同质数据、低通信需求场景,但复杂任务中表达能力可能受限。现有方法聚焦于通过剪枝、动态调整秩、前向微分、重要性识别等技术降低内存开销。
Adapter 和 LoRA 均冻结整个预训练LLM,在模型不同位置引入可训练的小模块,大幅减少训练参数。特别的,Adapter 以串行方式插入,会带来额外推理延迟。LoRA 以并行方式插入,不引入额外推理延迟。
3. 提示词微调
提示词微调利用模型的嵌入层生成可训练的提示向量,与任务输入组合后,通过梯度下降等优化方法调整提示嵌入,使其更好地适配特定任务。由于提示嵌入的参数量远小于全模型参数,更新效率极高,在一定程度上可以保证用户数据的隐私性,适合资源受限设备。具体而言,每个客户端针对本地数据生成并微调自己的提示向量,然后仅将更新后的提示上传至服务器进行聚合。

4. 其他
除了上述常见的方法外,还有如下方法可以降低 FLLM 的资源需求:
- 模型压缩:利用知识蒸馏、量化、剪枝等方法减少模型大小和推理开销,客户端更易部署。
- 拆分学习:将模型拆分为两部分,客户端负责浅层计算,服务器负责深层计算,从而大幅降低客户端的计算和内存负担。
- 零阶优化:在前向传播过程中,基于随机扰动近似真实梯度,以提升训练效率。
二、鲁棒性
由于客户端具有不同的标签分布、样本大小以及不同的设备和网络环境,传统 FL 已经面临资源异质性和数据异质性的挑战。由于 LLM 的参数规模庞大,FLLM 则进一步加剧了资源异质性问题。此外,由于 LLM 具有强大的语义理解能力,可以应用于广泛的任务,导致不同的客户端具有不同的任务,如问题回答、分类、文本生成和翻译,从而引入了任务异构性这个新问题。
1. 资源异构性
FLLM 系统通常由软硬件环境各异的设备组成,导致客户端在计算平台、算力、存储空间、通信带宽、训练效率等方面存在差异,进而影响训练过程和聚合策略。资源异构是 FLLM 异构性问题中研究最广泛的方向,现有方法多基于 LoRA 和 Adapter 来应对。
- 模型剪枝:客户端基于私有数据在本地剪枝模型,服务器根据资源异构性随机采样部分模型层,确保各客户端在其能力范围内有效参与训练。
- 拆分学习:将完整模型划分为子模型,客户端根据自身资源选择运行浅层部分,服务器负责运行剩余深层部分,使资源受限客户端仅处理轻量部分。
- LoRA :各客户端插入小型 LoRA 模块,服务器聚合 LoRA 以实现知识共享。现有的方法聚焦于如何根据客户端资源动态调整本地 LoRA 秩或更新参数量,从而使资源丰富的客户端可采用更高秩,贡献更多通用的、与任务无关的知识,避免因最弱客户端限制而浪费其他客户端资源的问题。

2. 数据异构性
数据异构是指各客户端之间的数据分布不均衡、数据量不等且数据非独立同分布,这种差异容易引发本地模型更新的漂移。由于不同客户端的更新方向差异显著,服务器聚合得到的全局模型往往不够稳定,难以从局部数据中提炼出全局有效的特征,进而削弱全局模型的泛化能力,使其通常难以达到最优性能。针对这一问题,FDLoRA 令每个客户端维护两个 LoRA 模块 ,一个在所有客户端间聚合,学习通用知识;一个保留在本地,学习特定领域知识,不参与聚合。
3. 任务异构性
LLM 具备强大的语义理解能力,可应用于多种不同任务,导致不同客户端可能承担不同类型的任务。任务类型差异使各客户端模型的收敛方向显著不同,这与传统FL中所有客户端通常训练同一任务的情况有本质区别。目前该方向研究相对有限,现有方法多通过设置全局和局部等多个 Adapter 来扩展模型规模以适应不同任务。
三、安全性
由于 FLLM 的新兴性质,目前的研究过度关注如何实现 FLLM 的高效微调,而对系统的隐私和安全性分析不足。
1. 隐私风险

1.1. 攻击
1.1.1. 成员推理攻击(Membership Inference Attack,MIA)
成员推理攻击的核心目标在于判断某个特定样本是否存在于某个参与方的训练集中,现有的攻击方法可分为基于更新与基于趋势两类。对一系列 LLM 的大规模评估表明,MIA 在大多数情况下仅略优于随机猜测,这与传统机器学习模型上的结论形成鲜明对比。究其原因,LLM 在海量数据上训练,泛化能力强,难以对训练数据过拟合;同时其训练过程通常仅略多于一个轮次,模型难以区分训练数据与非训练数据。
- 基于更新的方法:恶意服务器可精心设计模型结构,嵌入恶意参数,当目标成员参与训练时激活,从而泄露成员信息。例如,针对目标 token 设计特殊的权重与偏置。然而,该方法假设攻击者能完全控制全局模型并操纵其架构,在实际应用中可能不完全成立。
- 基于趋势的方法:利用多轮模型输出或参数的变化轨迹来推断成员信息。侧重长期行为模式的分析,而非单次或局部的梯度特征,对攻击者而言成本极低。
1.1.2. 数据重构攻击(Data Reconstruction Attack,DRA)
数据重构攻击的核心目标在于从梯度或其他信息中重构原始训练数据。在 FLLM 场景下,攻击者试图恢复用户的输入文本,而文本的离散性增加了数据重构的难度。现有方法聚焦于从中间嵌入、注意力结构等不同模型结构的输出或梯度恢复文本数据。
- 优化型攻击:随机初始化虚拟数据特征及标签,使其梯度逼近真实私有训练数据,从而实现重构。
- 分析型攻击:通过求解线性方程组直接获得原始私有数据,精度更高,但仅适用于较小模型。
1.1.3. 越狱攻击(Jailbreaking Attack,JA)
数据重构攻击的核心目标在于绕过或突破模型的安全与审查功能,执行未授权操作或输出不合规内容。在 FLLM 场景下,训练过程涉及多个参与者,每个参与者都可能成为攻击目标。攻击者可通过向训练集中注入恶意数据或构造恶意提示词,从全局模型中窃取其他用户隐私。早期"越狱提示词"主要手动设计,在可读性和流畅性方面存在局限;后续工作逐步改进"越狱提示词"的生成方式,在显著提高攻击成功率的同时,优化了提示词的流畅性与多样性。
1.1.4. 提示词注入(Prompt Injection,PI)
提示注入是一种将恶意指令作为输入提示的一部分,以操纵语言模型输出的技术。该攻击类似于数据库安全中的 SQL 注入攻击,通过精心构造的输入,绕过模型的正常处理流程,实现未授权数据访问、执行恶意代码或生成有害输出。现有方法可以分为以下两类:
- 直接注入:在用户输入中直接添加恶意指令。
- 间接注入:将恶意指令隐藏在可能被模型检索或摄取的文档中,更具隐蔽性。
1.1.5. 长尾数据泄露(Long-Tailed Data Leakage,LTLD)
长尾数据泄露是指模型对少数参与方的稀有数据产生过度记忆的现象。由于 LLM 拥有大量参数和多层注意力机制,具备极强的数据表示能力,即使面对极少量样本,模型仍可能通过梯度更新的细微变化准确记忆数据细节。同时,为了降低全局聚合时产生的高昂通信开销,客户端可能会减少聚合频率,这进一步加剧了本地模型对长尾数据的过拟合。然而,针对FLLM中长尾隐私泄露风险的研究尚处起步阶段。
1.2. 防御
近期研究者提出了多种隐私保护方案,涵盖量化技术、部分更新、个性化本地适配器、差分隐私等多个方向,核心目标是在隐私保护与模型性能之间取得平衡。
2. 安全隐患

2.1. 攻击
2.1.1. 数据投毒攻击(Data Poisoning Attack,DPA)
数据投毒攻击发生在客户端数据收集阶段,攻击者修改原始数据以训练投毒后的本地模型,上传后参与聚合,损害全局模型的可用性或完整性。由于 LLM 具有更高的复杂性和更强的拟合能力,能捕捉数据中的细微特征,包括恶意篡改的标签信息,因此标签翻转攻击对 LLM 的影响可能更为显著。然而,专门针对FLLM的DPA研究尚未出现。
- 干净标签数据投毒:利用模型在训练过程中对数据的记忆,通过修改样本特征来操纵模型在测试时的行为。
- 标签翻转攻击:攻击者修改数据集标签而非样本特征来生成投毒模型。
2.1.2. 模型投毒攻击(Model Poisoning Attack,MPA)
模型投毒攻击发生在客户端训练阶段,攻击者直接修改本地模型,以破坏全局训练为目标。由于联邦微调通常基于客户端本地数据,对预训练模型参数进行少量更新。攻击者可篡改这些更新,直接影响全局模型的微调过程。然而,专门针对 FLLM 的 MPA 研究尚未出现。
2.1.3. 后门攻击(Backdoor Attack,BA)
后门攻击通过注入特定攻击信息或数据操纵模型行为,使模型在遇到特定触发器时产生攻击者预设的错误输出,同时不影响正常样本上的表现。
2.2. 防御
现有的防御方法分基于距离和特征分析、以及基于分布建模、知识蒸馏和距离优化两类。
四、未来方向
- Few-shot learning:少样本学习技术在降低标注数据需求方面已取得显著进展,其效果依赖于模型从上下文中学习的能力。然而,FL 的分布式特性可能导致客户端之间的知识迁移不足,从而影响 FSL 的实际效果。因此,如何在联邦框架内高效生成并充分利用少量标注数据以提升模型性能,仍是亟待解决的关键问题。
- FLLM Unlearning:FL 和 LLM 中已有大量机器遗忘研究,但 FLLM 中新兴的数据遗忘问题仍存在空白。当前联邦遗忘方法对于 LLM 而言计算和通信开销过大,且难以适配 LoRA 和 Adapter 等主流高效微调架构;更关键的是,FLLM 遗忘面临独特挑战------当客户端请求删除数据时,服务器不仅需从全局模型中擦除贡献,还需确保其他客户端的历史模型也遗忘该数据,而这一目标只能通过多轮迭代缓慢实现,同时还要避免灾难性遗忘,这使得现有方法在效率、架构兼容性和遗忘彻底性方面均难以满足FLLM的实际需求,构成了亟待突破的研究方向。
- IP Protection:目前专门面向 FLLM 场景的 IP 保护方案仍极为匮乏。 LLM 庞大的参数规模和复杂的 Transformer 架构虽为水印嵌入提供了更多空间,但 FL 的分布式训练和异构客户端环境使得水印在聚合和个性化模型传递过程中容易被破坏或丢失;此外,如何在联邦微调中确保水印的鲁棒性、隐蔽性和完整性,如何防止恶意客户端在本地微调时移除或篡改水印,以及如何在不影响LLM性能的前提下实现高效的所有权验证,均缺乏系统性的研究,这些空白严重制约了FLLM在实际部署中的版权保护和合法授权管理。
