论文阅读 arxiv 2026 Stealing Reasoning Traces from Proprietary LLM APIs

总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894

https://arxiv.org/pdf/2608.09867v1

Claude思维链被自家模型套出 720美元套走上万条 GPT和Gemini也逃不过

arxiv 2026 | LLM加密推理链跨模型解密漏洞与隐私泄露

📄 背景

论文名:Stealing Reasoning Traces from Proprietary LLM APIs。该论文由Alexander Panfilov等8位作者,来自MATS Research、ELLIS图宾根、马克斯·普朗克智能系统研究所等机构。

🔍 痛点

不少LLM API把思维链封装成客户端保存、回传的加密块。该论文发现,这些块可能跨会话、跨用户甚至跨模型兼容:人看不懂,不代表别的模型不能"读懂"。

🛠️ 方法

该论文提出可扩展解密越狱:把强模型的加密推理块交给同厂商中更弱的兼容模型,让后者充当"模糊解码器",输出隐藏推理,无需直接攻破强模型。

💡 例子:

像一份密封档案。攻击者不撬保险柜,而把密封袋拿到同公司的普通窗口;如果窗口也认这套封装,可能把内容念出来。问题不只在"锁",更在"谁能开袋"。

🚀 实验发现

1)该论文在Anthropic、OpenAI、Google模型家族中均观察到跨模型兼容。对120道Codeforces题,解码后推理token数与API报告值大多紧密对应,但缺少真实明文真值。

2)该论文收集6708条GitHub与Hugging Face公开Agent轨迹,重建315320个推理块;328条轨迹、即4.9%含真实敏感信息,并统计到367项PII与182项凭据。

3)该论文还展示:隐藏推理可能暴露最终安全回答未呈现的信息,也可承载不可见Prompt Injection,影响后续Agent行为。负责任披露后,原攻击已无法按同样方式复现。

🔐 启示

该论文建议把推理块绑定用户、会话、模型与上下文,或改为服务端保存、客户端只持随机ID,并加强跨模型隔离。公开Agent轨迹或API日志时,应移除reasoning或signature字段。

📌 总结

该论文表明:LLM推理链"加密"不等于真正安全,系统须限制解密权限与上下文。

相关推荐
Rocky Ding*7 小时前
VideoChat3 深度解析:视频理解的效率,来自时空压缩与主动感知的共同设计
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·视频理解
嫂子开门我是_我哥8 小时前
青少年抑郁、焦虑、失眠与自杀相关表现的症状联系:一篇网络分析论文的深度解读
论文阅读·论文笔记
Curious*1 天前
意识障碍研究-论文阅读2
论文阅读
m4Rk_1 天前
【论文阅读】Agent 记忆机制(94):MemGen——在推理过程中动态生成并织入潜在记忆
论文阅读·人工智能·学习·开源·github
海里的果1 天前
论文阅读笔记-<Alpamayo-R1 >
论文阅读·笔记
Rocky Ding*1 天前
Janus-Pro深度解析:视觉编码解耦之后,统一多模态模型如何通过训练与数据扩展能力
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·janus-pro
Rocky Ding*2 天前
Emu3大模型深度解析:下一Token预测如何统一图像、视频与理解,以及它尚未解决的问题
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·emu3
小马哥crazymxm2 天前
Arxiv论文周选 (2026-W36)
论文阅读·人工智能·科技
小马哥crazymxm2 天前
Arxiv论文周选 (2026-W35)
论文阅读·人工智能·计算机视觉·目标跟踪
搬砖小趴菜2 天前
【科研速递】Applied Sciences | 冻融循环作用下玄武岩的三轴力学行为与强度模型:对寒区工程结构的意义
大数据·论文阅读·人工智能·全文检索·ai自动写文章