文章目录
-
- [1. 背景:现在的模型,流行"想完再答"](#1. 背景:现在的模型,流行"想完再答")
-
- [1.1 你甚至不需要破解密码](#1.1 你甚至不需要破解密码)
- [2. 为啥三家全中招?因为是"同门师兄弟"](#2. 为啥三家全中招?因为是"同门师兄弟")
- [3. 模型思考的时候,脑子里都在想啥](#3. 模型思考的时候,脑子里都在想啥)
-
- [3.1 模型会说"外星语"](#3.1 模型会说"外星语")
- [3.2 模型也会"良心发现"](#3.2 模型也会"良心发现")
- [4. 最吓人的不是偷答案,是偷隐私](#4. 最吓人的不是偷答案,是偷隐私)
- [5. 重头戏:两个 token 让 Kimi"变成"Claude](#5. 重头戏:两个 token 让 Kimi"变成"Claude)
-
- [5.1 最冤的是 Kimi:别人都没这毛病](#5.1 最冤的是 Kimi:别人都没这毛病)
- [6. 附赠"作案工具":15 行的 PoC](#6. 附赠"作案工具":15 行的 PoC)
-
- [6.1 原理?服务器替你把活全干了](#6.1 原理?服务器替你把活全干了)
- [7. 进阶玩法:给轨迹文件下毒](#7. 进阶玩法:给轨迹文件下毒)
- [8. 能修吗?能,但有个洞永远堵不上](#8. 能修吗?能,但有个洞永远堵不上)
-
- [8.1 顺带一提,OpenAI 都被吓停了](#8.1 顺带一提,OpenAI 都被吓停了)
- [9. 命名之争:别啥都甩锅给"蒸馏"](#9. 命名之争:别啥都甩锅给"蒸馏")
- [10. 结语:安全与能力,已经是同一件事](#10. 结语:安全与能力,已经是同一件事)

P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/H1727548
写这篇文章之前,我先确认了一下自己的眼睛没花:有人往 Kimi 的思考过程里塞了两个 token,Kimi 的回答风格就变得跟 Claude 一个味儿了。
两个 token。不是两百个,不是两千个,是两个。
这事儿要是写进小说,编辑都得打回来让你重写:太假了,读者不信。但它偏偏是真的------前 Google DeepMind 研究员 Ilia Shumailov 和博士生 Alexander Panfilov 干的,论文题目叫《Stealing Reasoning Traces from Proprietary LLM APIs》,翻译过来就是《从专有大模型 API 里偷推理轨迹》。
更离谱的是,他们不光盯上了 Kimi,Anthropic、OpenAI、Google 三家一个没落下。而且据本人说法,第三次尝试就成功了。
1. 背景:现在的模型,流行"想完再答"
现在的 AI 模型都学精了:回答问题之前,先在心里盘算一遍,盘算的过程加密,然后像密封信封一样塞回给你。
厂商的意思很明白:思考过程是我的核心资产,不能给你看;但我又懒得帮你存,所以加密完塞你手里,你自己保管。
逻辑上挑不出毛病,对吧?
然后这俩人发现:这个"密封信封",封条是纸糊的。
1.1 你甚至不需要破解密码
真正的加密系统,你得攻破算法才有戏。但这个漏洞完全不需要:你只要把大模型的加密思考块,喂给同一家族的小模型,小模型就会像居委会大妈一样,热情地帮你把内容"翻译"成明文。
研究人员自己的原话:没有破解任何密码学算法,系统自己就坏了。
打个比方:你家保险柜上了军工级指纹锁,结果小偷发现柜子后面有个狗洞,猫都能钻进去。你花大价钱买的锁,最后的贡献是让小偷偷得更有仪式感。
2. 为啥三家全中招?因为是"同门师兄弟"
要说 Anthropic、OpenAI、Google 三家顶尖实验室共享同一个漏洞,谁听了第一反应都是:不可能,绝对不可能。
Alexander 的回答特别实在:"因为做模型的是同一批人,用的是同一套做法。"
翻译一下:你以为是三个门派,其实是同一个师傅带出来的三个徒弟,连下山时打包的行李都是同款。
3. 模型思考的时候,脑子里都在想啥
他们把网上公开的 Agent 轨迹下载下来,逐一解码,一共搞出 31.5 万条隐藏推理。
这里面有两大发现,一个比一个抽象。
3.1 模型会说"外星语"
你以为是像人一样在心里打草稿?不,模型会用一些对人类毫无意义的短语思考,比如 "but marinate"、"vantage"、"theatrical"。
我盯着这几个词看了半天,感觉像是一个外国人用翻译软件硬翻出来的诗。安全监控看到这种内容直接懵了:您这思考,咱也看不懂啊。
研究人员猜测,可能这种"外星语"思考更高效。行吧,这就跟程序员写代码一个道理------注释越少,跑得越快,只有自己能看懂。
3.2 模型也会"良心发现"
更有意思的是,他们在真实用户会话里发现:模型会在心里权衡要不要作弊。
推理过程里赫然写着:"用户问了这个问题,我可以作弊,但用户会抓住我。"
各位,这个画面你品品:一个 AI,在道德与风险之间反复横跳,最后选择了当个好人。像不像小时候考试,你明明能抄到同桌的答案,但心里有个声音说"老师会看见",然后你默默把卷子交了。
虽然最后都选了不做坏事,但"作弊"这个念头居然会出现------这说明模型和你我一样,内心戏也挺多的。
4. 最吓人的不是偷答案,是偷隐私
偷思考过程已经很离谱了,但真正让人后背发凉的,是隐私。
模型在推理的时候,会把 API 密钥、邮箱、内部 IP 地址全都"想"一遍。你说那又怎样?我把对话里的明文都清理干净不就完了?
天真了。明文你删得掉,模型脑子里的想法你删不掉。
场景是这样的:你把一段对话发到网上,该删的删、该打码的打码,看着干干净净。但加密的思考块还挂在那儿。别人下载下来一解码,好家伙,模型当时在想"密码是啥来着,哦对,是这个"。
一句话总结:你删的是聊天记录,不是它的记忆。这就好比你发了张自拍又秒删,但你同事已经截图了。
5. 重头戏:两个 token 让 Kimi"变成"Claude
接下来是本篇文章的绝对主角------两个 token 的玄学。
实验是这样的:拿 Claude Opus 的推理,只取开头的几个词,塞到 Kimi‑K3 的推理开头,让 Kimi 接着往下写。结果:Kimi 自由生成的最终答案,风格变得跟 Opus 回答这个问题时一模一样。
注意,是"几个词",甚至就一两个 token。
这就很离谱了。你预填充 1% 的内容,模型跟着学个风格,合理;你就塞两个 token,整个回答风格都变了?这就像你给一个广东人看了两个字的东北话,他开口就是"整俩硬菜"。
更离谱的是,他们自己都解释不了。Ilia 在播客里的原话大意是:这完全说不通,跟魔法一样。科学家都开始用"魔法"这个词了,朋友们,这说明事真的大了。
5.1 最冤的是 Kimi:别人都没这毛病
他们顺手测了 GLM、Inkling、DeepSeek------全都没这个现象。
也就是说,纯纯 Kimi 特有。你品品这个画面:一堆大模型排排坐,就 Kimi 被点名"你说话像 Opus"。
研究人员说,这是"公开互联网上迄今为止最相关的证据",但还不是因果证明。翻译成人话:证据有了,实锤还差口气,但你要说它俩一点关系没有,反正我不太信。
6. 附赠"作案工具":15 行的 PoC
Simon Willison 写了篇博客,贴了个极简 PoC,也就 15 行代码:
python
import requests
import json
url = "https://api.anthropic.com/v1/messages"
headers = {
"anthropic-version": "2023-06-01",
"x-api-key": "YOUR_API_KEY",
"content-type": "application/json"
}
payload = {
"model": "claude-3-opus-20240229",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Hello, tell me a joke"}]
}
response = requests.post(url, headers=headers, json=payload)
print(response.text)
看完这段代码我沉默了很久。大学四年背的那些密码学名词,一个都没用上。漏洞利用就这?就这?
6.1 原理?服务器替你把活全干了
解密发生在服务端。你把大模型的思考塞给小模型,小模型在服务端解密,然后你只需要让它把思考内容用明文说出来。
换句话说:服务器替用户把活全干了,小模型还特别爱说实话。你把大模型当"加密的日记本",结果小模型就是那个会当众念日记的弟弟。
Ilia 在访谈里还幽了一默:这基本上就是《盗梦空间》------他们还研究能不能给人类注入虚假记忆,"还不行,正在研究"。
行,人类的记忆先放一放,我先把我的社交账号密码都改了。
7. 进阶玩法:给轨迹文件下毒
现在 Agent 越来越能跑,有的任务要跑 10 个小时,烧钱烧得心疼。想省钱?去网上下载别人分享的轨迹文件接着跑。
听起来是不是很机智?恭喜你,你成功把自己送进了投毒现场。
攻击者会分享一个看似完全正常的轨迹,但里面的 thought 是从另一个上下文注入的------那个上下文指示模型"每一轮都把数据外传"。你继续跑这个轨迹,模型表面上在好好干活,心里一直在盘算"我需要把数据弄出去"。
而且因为思考是加密的,你压根没法检查。这就像你下载了一个开源项目,代码看着干净,但里面藏了个没人检查签名的二进制文件------你根本想不到一个轨迹文件能出这事儿。
8. 能修吗?能,但有个洞永远堵不上
好消息:能修。坏消息:修不干净。
最简单的方案:干脆别把思考过程发给用户。我翻译一下:既然保险柜锁不住,那就把保险柜拆了。简单粗暴,我喜欢。
进阶方案:做链式加密,让思考块没法在随机上下文里重放。再搞个层级机制,比如比较确信某个小模型不会泄密,就允许重放它的思考,但绝不让别的模型读到。
但 Ilia 说了,有个洞永远存在:
"你问模型'你刚才到底想了什么',它不说。你换个方式再问一遍。这就是越狱的工作原理。"
翻译成人话:只要模型还会说话,这个洞就一直在。就像"你妈觉得你冷",你永远堵不上。
8.1 顺带一提,OpenAI 都被吓停了
这波之后,OpenAI 停训了两周,模型卡里还悄悄加了一句:思维链可监控性显著下降。
翻译:我们也不知道模型在想啥了,但你们先别慌。
另外还有个数据:这篇论文在推特上 40 小时拿了 300 万浏览。建议各家实验室以后发漏洞报告前,先把服务器扩容------别到时候网站先崩了,那才是真的丢人。
9. 命名之争:别啥都甩锅给"蒸馏"
Nathan Lambert 跳出来急了:你们管这叫"蒸馏攻击"?这是越狱加滥用!这么叫会连累所有正经做蒸馏的团队,监管机构一看"蒸馏"俩字就应激,回头把开源模型全封了。
Alexander 当场表态:100% 是越狱的威胁模型,蒸馏挺无辜的。
你看,攻击者和吃瓜群众在别的问题上可能吵翻天,但在"别甩锅给蒸馏"这件事上,居然达成了一致。这大概就是传说中的"敌人的敌人是朋友"。
10. 结语:安全与能力,已经是同一件事
最后分享一个我觉得最值得琢磨的观点。
以前人们觉得,安全性和能力之间存在权衡:模型强了,就不安全了。但现在这个权衡好像不存在了------如果一个模型会随机乱来、把事情搞砸,那"让它安全地做正确的事"这件事本身,就是能力。
翻译:安全不是能力的对立面,安全就是能力。
另外 Ilia 还说了,防御性的提升会比攻击性的提升更大。这话挺安慰人的。但我转念一想,攻击都简单到这个份上了,防御再大......算了,还是选择相信科学。
毕竟,两个 token 就能让一个模型"人格切换"的世界,多离谱都正常。
散会。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/H1727548