论文阅读 arxiv 2026 Stealing Reasoning Traces from Proprietary LLM APIs

总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894

https://arxiv.org/pdf/2608.09867v1

Claude思维链被自家模型套出 720美元套走上万条 GPT和Gemini也逃不过

arxiv 2026 | LLM加密推理链跨模型解密漏洞与隐私泄露

📄 背景

论文名:Stealing Reasoning Traces from Proprietary LLM APIs。该论文由Alexander Panfilov等8位作者,来自MATS Research、ELLIS图宾根、马克斯·普朗克智能系统研究所等机构。

🔍 痛点

不少LLM API把思维链封装成客户端保存、回传的加密块。该论文发现,这些块可能跨会话、跨用户甚至跨模型兼容:人看不懂,不代表别的模型不能"读懂"。

🛠️ 方法

该论文提出可扩展解密越狱:把强模型的加密推理块交给同厂商中更弱的兼容模型,让后者充当"模糊解码器",输出隐藏推理,无需直接攻破强模型。

💡 例子:

像一份密封档案。攻击者不撬保险柜,而把密封袋拿到同公司的普通窗口;如果窗口也认这套封装,可能把内容念出来。问题不只在"锁",更在"谁能开袋"。

🚀 实验发现

1)该论文在Anthropic、OpenAI、Google模型家族中均观察到跨模型兼容。对120道Codeforces题,解码后推理token数与API报告值大多紧密对应,但缺少真实明文真值。

2)该论文收集6708条GitHub与Hugging Face公开Agent轨迹,重建315320个推理块;328条轨迹、即4.9%含真实敏感信息,并统计到367项PII与182项凭据。

3)该论文还展示:隐藏推理可能暴露最终安全回答未呈现的信息,也可承载不可见Prompt Injection,影响后续Agent行为。负责任披露后,原攻击已无法按同样方式复现。

🔐 启示

该论文建议把推理块绑定用户、会话、模型与上下文,或改为服务端保存、客户端只持随机ID,并加强跨模型隔离。公开Agent轨迹或API日志时,应移除reasoning或signature字段。

📌 总结

该论文表明:LLM推理链"加密"不等于真正安全,系统须限制解密权限与上下文。

相关推荐
m4Rk_19 小时前
【论文阅读】Agent 记忆机制(74):CompassMem——从相似度检索走向事件图上的记忆导航
论文阅读·人工智能·学习·开源·github
Rocky Ding*1 天前
【三年面试五年模拟】阿里巴巴-千问技术部算法一面全解析
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
Rocky Ding*1 天前
【三年面试五年模拟】2026-09-10 百度多模态大模型一面:9道技术问答与2道手撕题详解
论文阅读·人工智能·深度学习·机器学习·百度·aigc·ai-native
m4Rk_2 天前
【论文阅读】Agent 记忆机制(73):MemGAS——让长期对话记忆按问题选择粒度并关联证据
论文阅读·人工智能·学习·开源·github
Rocky Ding*2 天前
【三年面试五年模拟】2026-09-16 字节跳动 Agent 秋招一面全解析:从 Harness、记忆与并发到算法题的系统化解析
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
西柚小萌新3 天前
【论文阅读】--Trust Before Fusion:QIMG‑7 与面向污染多模态 RAG 的源感知信任
论文阅读·人工智能
m4Rk_3 天前
【论文阅读】Agent 记忆机制(72):EMA——在写入前决定什么值得记住
论文阅读·人工智能·学习·开源·github
Rocky Ding*4 天前
一文读懂Hallo数字人核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·数字人·ai-native
m4Rk_4 天前
【论文阅读】Agent 记忆机制(67):MemPO——用记忆级信用分配训练 Agent 主动管理长程上下文
论文阅读·人工智能·学习·开源·github
chnyi6_ya4 天前
论文阅读笔记:VBVR-Pro 把「用生成来推理」变成一个可训练、可验证、可优化的闭环
论文阅读·笔记