[论文学习]隐藏不再:针对私有第三方LLM推理的攻击与防御

Hidden No More: Attacking and Defending Private Third-Party LLM Inference

📖 概述

论文是Rahul Thomas等人在ICML 2025上发表的关于第三方大语言模型隐私推理安全性的突破性研究。论文首次提出了一种能够从模型隐藏状态中以近乎完美精度重建原始提示词的新型攻击方法,并针对现有基于置换和噪声的隐私保护方案的安全性假设提出了根本性质疑。为应对这些漏洞,作者提出了Cascade,一种基于序列维度分片的多方推理协议,在保持计算和通信效率的同时提供了可靠的隐私保护。

🔍 核心研究

问题定义

大语言模型的参数量持续增长,使得模型推理的计算资源需求超出了大多数个人和中小型组织的承受能力,第三方推理服务因此日益普及。然而,将用户提示词交由第三方处理引发了严重的隐私担忧。

现有解决方案中,安全多方计算(SMPC)等加密方法虽然具有可证明的安全性,但其速度比标准未加密推理慢数千倍,无法扩展至现代大规模LLM。为此,研究者提出了基于统计混淆的快速方案------特别是向第三方揭示置换后的隐藏状态 ,并声称难以逆转回未置换状态。本文的核心问题是:这些基于置换的隐私方案是否真正安全?

创新方法

  1. 新型提示词重建攻击 :作者提出了一种概念简单但此前未被描述或实践验证的重建技术,能够从LLM的隐藏状态中恢复原始提示词。该攻击利用了单向注意力机制在隐藏状态元素上赋予位置标记这一关键洞察。

  2. 置换逆向攻击扩展:作者进一步展示了其攻击的扩展版本能够以近乎完美的效果逆转LLM的置换隐藏状态,成功攻破了三种近期提出的隐私方案。

  3. Cascade防御协议 :作为应对方案,作者提出了Cascade------一种在序列维度上对提示词进行分片的多方推理协议,通过将输入分散到多个节点来保护用户隐私。

关键结果

  • 攻击在多种最先进的开源LLM上实现了近乎完美的提示词重建准确率
  • 攻击对各类置换和基于噪声的防御仍然有效,推翻了此前方案的安全性假设
  • Cascade经过理论分析和实证评估,证明能够抵御本文攻击及此前所有已知攻击方法
  • Cascade在保持安全性的同时,计算和通信效率远高于现有方案

实际意义

本研究强调了在大模型隐私推理中进行严格安全分析的重要性,为以下场景提供了直接指导:

  • 需要部署第三方LLM服务的企业和机构
  • 设计隐私保护推理协议的密码学和ML研究者
  • 构建LLM应用时需要考虑用户数据隐私的开发者

🛠️ 技术细节

方法概述

攻击方法的核心原理

本文攻击的核心洞察在于LLM的单向注意力机制 。在Transformer架构中,由于每个token只能关注其之前的token,这种单向性在隐藏状态元素上留下了可识别的位置标记------即使隐藏状态经过了置换。攻击者通过分析这些位置标记的统计特征,可以重建原始的token顺序,从而恢复完整的提示词内容。

作者进一步发现,LLM的隐藏状态强烈满足多种形式的**"非碰撞"性质**,这使得攻击能够实现高成功率。更重要的是,该攻击对现有的置换和噪声防御同样有效------这些防御措施要么无法彻底消除位置标记,要么引入的噪声不足以破坏重建所需的统计信息。

Cascade防御协议

Cascade采用了一种截然不同的隐私保护思路------序列维度分片(sharding in the sequence dimension)。具体而言:

  • 用户的提示词被分割成多个片段
  • 每个片段由不同的计算节点独立处理
  • 任何单一节点都无法获得完整的输入信息
  • 通过理论分析证明,即使攻击者控制了部分节点,也无法重建原始提示词

这种方法放弃了SMPC的强加密保证,换取了数量级级别的性能提升 ,同时通过信息分散的方式实现了实用层面的隐私保护。

研究设定

  • 攻击评估 :在多个最先进的开源LLM上进行测试
  • 防御评估 :针对多种置换和噪声防御方案进行攻击测试
  • Cascade验证 :通过理论分析实证评估双重验证安全性
  • 效率对比:与现有SMPC方案进行计算和通信开销的对比

📊 主要发现

  1. 置换方案的脆弱性:此前被广泛认为"难以逆转"的置换隐藏状态,实际上可以通过精心设计的攻击以近乎完美的精度还原。

  2. 理论证明的缺陷:作者深入剖析了此前关于置换安全性的理论证明中存在的漏洞,解释了攻击能够成功的原因。

  3. Cascade的有效性:通过将提示词在序列维度上分片,Cascade能够有效抵御本文提出的攻击以及其他已知攻击方法。

  4. 效率与安全的权衡:研究表明,通过合理的设计可以在不牺牲实用效率的前提下实现有意义的隐私保护------Cascade比现有加密方案快数个数量级。

💡 深度洞察

洞察一:隐私保护中"可证明安全"与"实用安全"的张力

本文揭示了一个深层次的矛盾:SMPC等加密方法提供了数学上可证明的安全性 ,但计算开销过大而无法实用;基于置换的统计混淆方案虽然效率高 ,但其安全性建立在未经严格检验的假设之上。本文的攻击表明,"看起来难以逆转"不等于"实际上无法逆转" ------这是一个对密码学和ML安全社区的重要警示。

洞察二:架构特性可能成为安全漏洞

LLM的核心设计选择------单向注意力 ------虽然在语言建模中至关重要,却意外地成为了隐私攻击的"帮凶"。这种设计在隐藏状态中留下了系统性的位置信息痕迹。这提醒我们:模型的性能优化特性可能同时引入安全漏洞,安全分析必须深入模型的底层实现细节。

洞察三:安全评估需要"红队思维"

本文的工作方式------先攻击再防御------体现了红队测试 的核心方法论。作者没有接受现有方案的安全性声明,而是主动寻找并成功发现了漏洞。这种思维方式对于LLM安全领域至关重要:只有通过严格的攻击实验,才能建立真正可靠的防御

洞察四:分片策略作为实用的隐私保护范式

Cascade提出的序列维度分片策略代表了一种有前景的实用隐私保护范式。它不追求绝对的加密保证,而是通过信息分散 使得任何单一攻击者都无法获取完整信息。这种思路在性能敏感的现实部署场景中可能比纯加密方案更具可行性。

🎯 實踐應用

对于LLM服务提供商

  1. 重新评估现有隐私方案:如果当前使用基于置换或统计混淆的隐私保护方案,应立即进行安全审计
  2. 考虑采用Cascade:作为一种高效且经实证验证的替代方案,Cascade值得在部署中认真考虑
  3. 建立持续的安全测试流程:隐私攻击技术不断演进,需要建立常态化的安全评估机制

对于AI安全研究者

  1. 关注隐藏状态的泄露风险:本研究表明,模型内部表示可能泄露远比预期更多的信息
  2. 在设计隐私方案时进行攻击驱动的研究:先尝试攻破自己的方案,再声称安全性
  3. 重新审视"统计混淆"的安全性假设:不要仅凭直觉或简化分析就认为某种混淆"足够安全"

对于LLM应用开发者

  1. 避免自行实现隐私保护方案:隐私保护是一个专业性极强的领域,应优先采用经过同行评审的方案
  2. 在使用第三方API时评估隐私风险:即使API声称提供隐私保护,也应了解其具体机制和局限性
  3. 考虑数据最小化原则:在可能的情况下,尽量减少发送给第三方的敏感信息

📚 參考資料來源

  • 原始论文 : Thomas, R.K., Zahran, L., Choi, E., Potti, A., Goldblum, M. & Pal, A. (2025). Hidden No More: Attacking and Defending Private Third-Party LLM Inference. Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:59434-59469
  • arXiv预印本(攻击篇) : arXiv:2505.18332
  • arXiv预印本(Cascade篇) : arXiv:2507.05228