总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894

https://arxiv.org/pdf/2608.09867v1
Claude思维链被自家模型套出 720美元套走上万条 GPT和Gemini也逃不过
arxiv 2026 | LLM加密推理链跨模型解密漏洞与隐私泄露
📄 背景
论文名:Stealing Reasoning Traces from Proprietary LLM APIs。该论文由Alexander Panfilov等8位作者,来自MATS Research、ELLIS图宾根、马克斯·普朗克智能系统研究所等机构。
🔍 痛点
不少LLM API把思维链封装成客户端保存、回传的加密块。该论文发现,这些块可能跨会话、跨用户甚至跨模型兼容:人看不懂,不代表别的模型不能"读懂"。
🛠️ 方法
该论文提出可扩展解密越狱:把强模型的加密推理块交给同厂商中更弱的兼容模型,让后者充当"模糊解码器",输出隐藏推理,无需直接攻破强模型。
💡 例子:
像一份密封档案。攻击者不撬保险柜,而把密封袋拿到同公司的普通窗口;如果窗口也认这套封装,可能把内容念出来。问题不只在"锁",更在"谁能开袋"。
🚀 实验发现
1)该论文在Anthropic、OpenAI、Google模型家族中均观察到跨模型兼容。对120道Codeforces题,解码后推理token数与API报告值大多紧密对应,但缺少真实明文真值。
2)该论文收集6708条GitHub与Hugging Face公开Agent轨迹,重建315320个推理块;328条轨迹、即4.9%含真实敏感信息,并统计到367项PII与182项凭据。
3)该论文还展示:隐藏推理可能暴露最终安全回答未呈现的信息,也可承载不可见Prompt Injection,影响后续Agent行为。负责任披露后,原攻击已无法按同样方式复现。
🔐 启示
该论文建议把推理块绑定用户、会话、模型与上下文,或改为服务端保存、客户端只持随机ID,并加强跨模型隔离。公开Agent轨迹或API日志时,应移除reasoning或signature字段。
📌 总结
该论文表明:LLM推理链"加密"不等于真正安全,系统须限制解密权限与上下文。