论文阅读 arxiv 2026 Stealing Reasoning Traces from Proprietary LLM APIs

总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894

https://arxiv.org/pdf/2608.09867v1

Claude思维链被自家模型套出 720美元套走上万条 GPT和Gemini也逃不过

arxiv 2026 | LLM加密推理链跨模型解密漏洞与隐私泄露

📄 背景

论文名:Stealing Reasoning Traces from Proprietary LLM APIs。该论文由Alexander Panfilov等8位作者,来自MATS Research、ELLIS图宾根、马克斯·普朗克智能系统研究所等机构。

🔍 痛点

不少LLM API把思维链封装成客户端保存、回传的加密块。该论文发现,这些块可能跨会话、跨用户甚至跨模型兼容:人看不懂,不代表别的模型不能"读懂"。

🛠️ 方法

该论文提出可扩展解密越狱:把强模型的加密推理块交给同厂商中更弱的兼容模型,让后者充当"模糊解码器",输出隐藏推理,无需直接攻破强模型。

💡 例子:

像一份密封档案。攻击者不撬保险柜,而把密封袋拿到同公司的普通窗口;如果窗口也认这套封装,可能把内容念出来。问题不只在"锁",更在"谁能开袋"。

🚀 实验发现

1)该论文在Anthropic、OpenAI、Google模型家族中均观察到跨模型兼容。对120道Codeforces题,解码后推理token数与API报告值大多紧密对应,但缺少真实明文真值。

2)该论文收集6708条GitHub与Hugging Face公开Agent轨迹,重建315320个推理块;328条轨迹、即4.9%含真实敏感信息,并统计到367项PII与182项凭据。

3)该论文还展示:隐藏推理可能暴露最终安全回答未呈现的信息,也可承载不可见Prompt Injection,影响后续Agent行为。负责任披露后,原攻击已无法按同样方式复现。

🔐 启示

该论文建议把推理块绑定用户、会话、模型与上下文,或改为服务端保存、客户端只持随机ID,并加强跨模型隔离。公开Agent轨迹或API日志时,应移除reasoning或signature字段。

📌 总结

该论文表明:LLM推理链"加密"不等于真正安全,系统须限制解密权限与上下文。

相关推荐
m4Rk_1 天前
【论文阅读】Agent 记忆机制(54):MINJA——普通用户如何仅通过查询污染 Agent 的长期记忆
论文阅读·人工智能·学习·开源·github
Capricorn19881 天前
个人知识库接入大模型频现“幻觉引用”?排查 RAG 溯源失效问题,解析知芽构建可信第三大脑的底层架构
大数据·论文阅读·人工智能·笔记·架构·论文笔记
Capricorn19882 天前
科研引用无法溯源怎么排查?知芽 Notebook Skill 技术机制拆解
大数据·论文阅读·人工智能·笔记·论文笔记
Capricorn19882 天前
Agent 记忆层接入后引用仍不可信?知芽 Notebook Skill 排障指南
大数据·论文阅读·人工智能·笔记·架构
Rocky Ding*2 天前
【三年面试五年模拟】2026-08-16_拼多多_笔试题与题解全解析
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·拼多多
无线通信科研笔记2 天前
IEEE TWC 2026 论文精读与完整复现|H-PASS:机械—电子双重可重构波束成形
论文阅读·人工智能·笔记·python·论文笔记
m4Rk_2 天前
【论文阅读】Agent 记忆机制(53):Experience-Following——为什么错误经验会在记忆中不断传播
论文阅读·人工智能·学习·开源·github
sel_92 天前
【多轮对话论文导读(三)】多轮对话与Agent论文阅读笔记:用户模拟、轨迹生成与长期记忆
论文阅读·人工智能·笔记·深度学习·算法·机器学习
西柚小萌新3 天前
【论文阅读】-- 通过跨模态操纵多模态智能体提示注入
论文阅读