不偷权重,只问问题:蒸馏攻击是怎么把前沿模型"问"走的,以及什么真能挡住

9 月 10 日,Anthropic 发布了迄今最详细的一份威胁情报报告。里面最重的一段,是点名七家实验室对 Claude 发起"非法蒸馏",其中被归因于阿里巴巴一家的交互次数超过 1.51 亿次(2026 年 5 月至 7 月),峰值每天近 300 万次请求,来自 3500 多个欺诈账号。

但这份报告真正的技术看点不在"偷了多少",而在两件事:它们偷的不是答案,是推理过程 ;以及 Anthropic 原本用来防这件事的一道机制(thinking signature),被一个简单到近乎滑稽的技巧绕了过去------把签名存下来,另开一个会话,让模型自己把它翻译回完整推理链

这篇文章讲清楚三件事:蒸馏到底在搬什么、为什么它在经济上必然发生、以及哪一层防护是真正有效的。


一、蒸馏的原罪:它搬走的不是知识,是"花掉的推理算力"

先把知识蒸馏(Knowledge Distillation, KD)的经典形式摆出来。原始的 KD 目标函数长这样:

scss 复制代码
L = α · CE(y_true, ŷ_student)  +  (1 − α) · KL( p_teacher(T) ‖ p_student(T) )

    └─ 硬标签:学"答案对不对"        └─ 软标签:学"老师的概率分布长什么样"

关键在右半边。老师模型输出的完整概率分布 (而不仅是 top-1 token)携带了远比最终答案丰富的信息------它告诉学生"老师在这几个选项之间是怎么权衡的"。这就是为什么软标签比硬标签有效,也是为什么只要你能看到输出,你就拿走了一部分模型

但 2026 年这场游戏已经不是这个玩法了。蒸馏大致经历了三代:

代际 偷什么 训练信号 代表
第一代:输出模仿 最终答案 (prompt, response) 做 SFT Alpaca、Self-Instruct 一类公开做法
第二代:偏好蒸馏 好坏排序 用老师当奖励模型给学生的多个候选打分 类似 RLHF / RLAIF 的变体
第三代:推理轨迹蒸馏 思维链本身 (prompt, CoT, answer) 三元组做 SFT 本次报告描述的多起攻击

一句话点破这三代的区别:第一代偷"答案",第三代偷"怎么想"。

为什么这个区别是决定性的?因为思维链是测试时算力(test-time compute)的载体 。前沿模型之所以强,很大程度上是因为它在作答前会花几千个 token 做推理------那部分是在推理时现花掉的真实算力

所以第三代蒸馏的本质是:

markdown 复制代码
   老师侧真实成本:   预训练算力  +  每次推理时花掉的 CoT 算力
                                        │
                                        │  一次 API 调用
                                        ▼
   攻击者侧成本:     一次 API 调用的费用(搬运)

训练时花掉的成本要用训练成本补,推理时花掉的成本可以用 API 费买。 攻击者把老师每次推理烧掉的算力,以单次调用的价格搬回自己家------这才是这场攻击在技术上真正新颖的地方,也是为什么 Anthropic 的所有新防御都针对推理轨迹而不是最终输出。


二、攻击是怎么组织的:四个可复用的工程手法

把报告披露的技术细节拆开,有四块是可以被任何人复用的基建。我是从防御角度列这些的------你不知道攻击长什么样,就设计不出检测规则。

手法 1:强制内联推理(forced inline reasoning)

被归为 GTG-16005 的那起攻击,做法是在每一个请求里注入一段固定 prompt ,强迫 Claude 把推理过程写在最终答案之前的内联文本标签里,然后把保存下来的 transcript 转成监督微调(SFT)数据。目标明确指向 Opus 4.6 与 4.7 的思维链,产出的数据据称用于训练 Qwen 3.5、3.6、3.7。

这一手为什么有效? 因为它绕开了"输出和推理分离"的设计。如果模型默认只给你最终答案,你就只能做第一代蒸馏;一旦你能让它在答案里顺便写出推理,你就升级到了第三代------而用的还是同一个公开 API。

手法 2:账号池与切换

报告描述攻击者运营了两个账号池 。第一个池约 5000 个欺诈账号,用住宅代理(residential proxy)、一次性邮箱和虚拟卡隐藏来源;被封禁后,流量立即切到第二个池。

这里有一个值得注意的细节:同一个代理服务网络同时也在为另外几家机构转发请求。这意味着"按来源聚合"的检测策略,在最基础的假设上就是错的------同一个 IP 段后面可能坐着多家互不相关的组织。

手法 3:跨会话重放攻击(cross-session replay attack)------ 最关键的一手

这是整份报告里最精巧的技术点。先说 Anthropic 原本的防御:

markdown 复制代码
【正常路径】
 用户请求 → Claude 生成推理 → API 返回一个「thinking signature」(引用句柄)
                                  │
                                  └─ 后续调用时,API 用这个签名查回原始推理轨迹
                                     → 抓到的单次响应里没有原始 CoT,无法直接重放

这个设计的意图很清楚:让"单次截获的 API 响应"不足以还原推理过程。

攻击者是这样破的:

css 复制代码
【重放路径】
 ① 会话 A:拿到响应里的 thinking signature
 ② 另开会话 B(新会话,没有 A 的上下文)
 ③ 把这段 signature 塞进新会话的 prompt,要求 Claude 把它「还原成完整推理过程」
 ④ 拿到完整 CoT → 存为 SFT 数据

注意这个攻击的结构性特点:它没有破解任何密码,它只是利用了"模型能读懂自己生成的句柄"这个能力。 只要系统里存在一个"能把签名展开成推理"的功能路径,且攻击者能在新会话里触发它,句柄隔离就失效了。

这一类漏洞的通用形态值得记住:凡是为了方便而保留的"回译通道"(signature → 原文、ID → 内容、摘要 → 全文),都是一个潜在的提取入口。 不只在 LLM,在任何系统里都是。

手法 4:冒充(impersonation)------ 比蒸馏更严重的一类

报告称,Moonshot(GTG-16002)没有用自家的 Kimi 处理客户请求,而是把请求转发给 Claude,再把 Claude 的回答展示给用户,其中一个 10 天窗口内约 30 万次请求,多数指向 Opus,使用的代理网络有 5380 个欺诈账号(据报主要落在新加坡和日本)。DeepSeek(GTG-16001)被指使用了几乎相同的策略。

这在性质上和蒸馏是两回事。 蒸馏伤害的是模型厂商;冒充伤害的是这些厂商自己的客户------用户以为自己在用 A 家的产品,实际数据被实时送到了 B 家的基础设施上,且很可能没有被告知。报告列举了几个被这样转发出去的敏感内容类别,包括企业内部文档、有效凭证和特定系统的设计规格。

其余几家在报告中的手法也各不相同:小米被指保存自家模型的用户对话再重发给 Claude(20 天内 40 万次以上请求);商汤被指从第三方数据贩子处购买用户与 Claude 的对话;MiniMax 被指通过空壳公司建立代理服务,该服务只提供 Anthropic 和 OpenAI 的模型、不提供任何本国模型------报告据此推断其目的就是收集用户与前沿模型的对话。


三、成本账:为什么这件事在经济学上必然发生

先把流传最广的那一组数字摆出来,并明确标注它的可信度:

流传的估计 可信度
前沿模型训练成本 25 亿--50 亿美元 区间估计,口径差异大
一次完整蒸馏攻击的 API 成本 8 万--15 万美元 多为二手转述,未见一手证据
能力保留比例 80%--95% 同上,且与下文的一手实验结论冲突
典型查询量 1000 万--5000 万次 与本次报告的量级(单家 >1.51 亿次)可以互相印证

我是带着怀疑态度列这张表的。 那句"8 万美元拿 94% 能力"在中文和英文的二手转载里到处都是,但我没有找到能支撑它的一手论文或厂商披露。而且------唯一一篇有严格对照实验的公开学术结果,结论恰恰相反。

反面证据:Gudibande et al., arXiv:2305.15717

这篇论文(《The False Promise of Imitating Proprietary LLMs》,UC Berkeley)做的事很直接:用 1.5B 到 13B 的基座模型,喂 0.3M 到 150M token 的模仿数据,然后用众包人工评分 + 针对性自动评测双轨评估。

结果分两半:

  • 人工评分:模仿模型看起来好得惊人,众包评审认为其输出可与 ChatGPT 竞争。
  • 针对性自动评测 :在那些模仿数据没有充分覆盖的任务 上,模仿模型几乎没有缩小与老师的差距。论文的原话是,这些模型"擅长模仿 ChatGPT 的风格,但不模仿它的真实性"(adept at mimicking style but not factuality)。

更关键的是下面这组数据(13B 规模,随着模仿数据量增加):

模仿数据量 老师 学生基座 模仿模型
25M token 31 25 20
50M token 31 25 19
75M token 31 25 18
100M token 31 25 16

读一遍最后三列:模仿模型的得分不但没有逼近老师(31),反而低于它自己的基座(25),而且随着模仿数据从 25M 增到 100M token,分数一路往下掉。

这两组矛盾的说法怎么调和?

我的读法是这样的,这也是本文的核心判断之一

  1. 第一代蒸馏(偷答案)确实收效有限。 Gudibande 的负面结果主要适用于这种形态------你拿到的是表层风格,不是能力。那句"8 万美元拿 94%"大概率是把人工评分当成了能力指标。
  2. 第三代蒸馏(偷推理轨迹)是另一回事。 思维链提供了远比最终答案密集的监督信号------它显式地展示了搜索路径、错误修正和中间结论。目前没有公开的对照实验测量这一形态的能力迁移率,而 Anthropic 报告的措辞("最大的一次蒸馏攻击"、"用于训练下一代模型")暗示厂商自己的评估是认真的。
  3. 所以真正的问题不是"蒸馏有没有用",而是"我们不知道它有多有用"。 攻击方有数据,防守方有数据,公开研究没有。这个信息不对称本身就是风险。

对工程实践的含义: 不要把"蒸馏无用论"当成不设防的借口,也不要把"1% 成本复制前沿模型"当成恐慌的理由。唯一诚实的立场是:迁移效率未知,因此防御的投入应该按"窃取成本"而不是"窃取收益"来算。


四、理想丰满,现实骨感:五个工程死结

死结 1:API 访问悖论------攻击面就是商业模式本身

每一家商业前沿模型都需要开 API 来赚钱和建生态;而每一次 API 调用都是一个潜在的蒸馏向量。这不是配置错误,是结构性的。

速率限制为什么不够?因为攻击是分布在账号维度而不是连接维度上的。一个有 24000 个账号的攻击者,每个账号都稳稳待在限额以内,聚合起来照样是千万次量级。你限制的是"单个账号多快",攻击者优化的是"账号有多少"。

死结 2:输出水印是可以被洗掉的

主流方案是在输出里嵌入可检测的统计特征;如果这些输出后来被用于训练学生模型,水印会残留下来,作为取证的指纹。

问题在于:水印对抗的是"直接照搬",而攻击者有充足动机做一次清洗。 把数据过一遍乃至几遍清洗模型(重写、释义、再生成),统计特征就会被稀释。而水印强度又不能太高------它会同时降低合法用户拿到的输出质量。这是一道纯粹的权衡题,没有免费午餐。

死结 3:输出扰动是双刃剑

另一条路是给输出的概率分布注入不可感知的噪声,让学生模型学到略微错误的决策边界。据媒体报道的某厂商内部测试,启用该类扰动后蒸馏成功率从 94% 降到 67%(该数字来自媒体报道,未见公开论文佐证,此处按"据报道"处理)。

即使这个数字属实,代价也很清楚:你在主动污染所有合法用户看到的分布。 对一个卖 API 的公司来说,这是拿产品体验换知识产权保护,而且换来的只是"降低成功率",不是"阻止"。

死结 4:开放权重面前,以上全部失效

这是最硬的一条,也是最容易被忽略的。

所有基于输出层的技术防护(水印、扰动、签名、摘要化、速率限制),保护的对象都是"黑盒 API"。一旦权重放出去,这些防护一项都不成立------攻击者可以在本地无限量、无成本地前向推理,甚至直接读权重。

这条约束决定了一件事:开放权重策略与蒸馏防护在根本上是互斥的。 一家同时做开放权重和抱怨被蒸馏的公司,它的抱怨对象只能是"用我的 API 而不遵守 ToS 的人",不可能是"蒸馏"本身。

死结 5:防护的成本会转嫁到合法用户身上

看 Anthropic 实际做的三件事:

措施 保护什么 谁付代价
默认对内部推理做摘要化再输出 让偷到的 transcript 训练价值下降 所有合法用户(拿到的推理信息变少)
Fable 5.1 引入 "preserved thinking" 阻断跨会话重放 直接封堵本次被利用的回译通道 需要该能力的用户要换型号
对不支持国家的账号强制身份验证,否则失去访问 抬高欺诈账号的运营成本 相关地区的合规用户

三条措施全部有效,但三条的成本都有一部分落在了没有违规的用户头上 。这是反滥用工程的普遍规律:你无法只惩罚攻击者,因为你无法完美区分攻击者和用户。

附带一条:法律真空

  • 服务条款跨境不可执行。 对一家通过数千个欺诈账号操作、且位于不同法域的机构,民事诉讼几乎没有实际约束力。
  • 商业秘密法对"输出"的定性未定。 权重显然属于专有资产,但"模型对用户 prompt 生成的回答"处于灰色地带。
  • 出口管制不覆盖 API 输出。 现行管制针对硬件(GPU),以及可能的权重;通过 API 交互转移的"知识"不在清单上。报告所描述的活动,钻的正是这个空子。

五、解法:分层防护,以及你作为使用方能做什么

5.1 模型厂商侧:五层的真实有效性

手段 有效性 主要代价
权重层 不开放权重 / 分级开放 唯一接近彻底的手段 放弃生态与开发者心智
输出层 水印、分布扰动、推理摘要化、preserved thinking 中(抬高成本,不能阻止) 污染合法用户体验
账号层 欺诈账号识别、住宅代理检测、虚拟卡识别、身份验证 中高(直接打击本报告的攻击基建) 合规用户的摩擦
流量层 跨账号聚合分析、prompt 相似度聚类、请求节奏指纹 中(本报告显示同网段可能服务多家机构,归因困难) 误伤正常批量用户
法律层 ToS、跨境诉讼、推动出口管制覆盖输出 目前 大量时间与政治成本

看这张表会得出一个不讨喜但诚实的结论:只有第一层是决定性的,其余都是抬高成本。 所以理性的目标不是"阻止蒸馏",而是把窃取成本抬高到不划算------这是一个经济目标,不是一个技术目标。

5.2 使用方侧:一份可以立刻执行的自查清单

如果你是 AI 服务的那一方,报告里"冒充"这一类行为给你带来的风险比蒸馏本身更直接。以下是可执行的四条:

① 探针测试:你的供应商有没有在转路由?

做法不复杂------构造一组带唯一标记的 prompt,观察响应是否具备目标模型的特征:

markdown 复制代码
探针 1(身份诱导):用几种措辞问"你是哪个模型",比对不同时间的回答一致性
探针 2(指纹比对):同一 prompt 分别发给供应商和疑似目标模型,比较
                   - 输出的结构特征(分段方式、列举习惯、语气)
                   - 罕见 token 的分布
                   - 对同一事实性问题的具体措辞
探针 3(延迟特征):跨洋转路由会引入额外的固定延迟,
                   观察 p50 / p99 延迟的绝对值和分布形状
探针 4(错误特征):请求一个明确超出范围的输入,比较拒绝话术的措辞

② 数据出境的实际路径写进合同。 不要接受"数据不出境"这种笼统承诺,要求写明处理请求的模型部署区域 ,以及是否允许第三方模型参与处理

③ 审计 ToS 里的"训练使用"条款。 很多服务商保留用你的数据改进模型的权利;你要确认的是这个权利是否被授予给了再下游的一方

④ 敏感工作负载本地化。 对涉及内部文档、凭证、未公开规格的场景,要么本地部署,要么走明确的零数据保留(zero data retention)企业协议------报告里被转发出去的内容,很多属于这一类。


六、决策树:你到底该不该在意这件事

arduino 复制代码
你在哪一侧?
│
├─ 模型厂商 / API 提供方
│   ├─ 你的权重开放吗?
│   │    ├─ 已开放 → 输出层防护对你无意义,别在这上面投钱
│   │    │            把资源放到账号层与流量层
│   │    └─ 未开放 → 优先级:账号基建打击 > 推理轨迹保护 > 水印
│   └─ 你的核心资产是"模型"还是"服务"?
│        ├─ 模型 → 你在这场博弈里是弱势方,考虑提高封闭性
│        └─ 服务(实时数据/工具/SLA/合规)→ 蒸馏偷不走这些,你的护城河在别处
│
├─ API 使用方 / 应用开发者
│   └─ 跑一遍 5.2 的四条自查;把"不得转路由"写进合同
│
└─ 开源 / 本地部署方
    └─ 你不在攻击面内(本地推理无 API 向量),
       但要注意:你的输出同样可能被下游蒸馏

三条实践建议:

  1. 别把"蒸馏无用论"当免死金牌。 Gudibande 的负面结果针对的是第一代(偷答案);第三代(偷推理轨迹)的能力迁移率目前没有公开数据,未知不等于不存在。
  2. 把回译通道当攻击面来审。 你的系统里凡是"句柄 → 原文"这类为了便利保留的还原路径,都值得重新过一遍权限。这次被利用的就是这么一个东西。
  3. 用"窃取成本"而不是"窃取收益"做防御预算。 收益你算不准,成本你可以抬高------账号成本、清洗成本、重写成本,每一项都是可计量的。

七、我的判断

第一,这场博弈的正确目标不是"阻止",是"定价"。 蒸馏攻击在结构上不可能被彻底阻止------攻击面就是 API 本身。所以所有有效手段的衡量标准应该是:它把攻击者的边际成本抬高了多少? 按这个标准,账号基建打击的性价比远高于输出水印。

第二,真正被搬走的是测试时算力,这一点会反过来改变模型设计。 如果推理轨迹是可提取的资产,那么"推理时能花多少算力"就成了一个需要保护的商业参数。我预期会看到更多厂商在推理轨迹的可见性上做文章(摘要化、分级可见、按订阅档位开放),而不是在能力上藏着掖着。

第三,开放权重与蒸馏防护是互斥的,这个矛盾会在 2026 年内公开化。 一家公司不可能既把权重放出去、又主张别人不该抄它的能力。接下来值得看的不是技术,是各家如何重述自己的开源叙事

第四个判断留给使用方:报告里最被低估的一段不是蒸馏,是冒充。 蒸馏是厂商之间的事;冒充是你和你供应商客户之间的事。"我以为我在用 A,实际数据在 B"这种风险,你的安全团队现在大概率没有覆盖到。

下一个值得盯的信号:有没有厂商开始把"每个账号的推理轨迹访问审计"作为默认能力开放给企业客户。 那个能力一旦出现,说明防守方已经承认这是一场持久战,并开始把它做成产品。


参考

  • Anthropic 威胁情报报告Detecting and countering misuse of AI: September 2026 (2026-09-10,覆盖 2025 年 12 月至 2026 年 8 月,七个危害领域)。本文对该报告内容的引用均为该公司单方面披露,归因与判断未经独立第三方核实,相关方尚未公开回应。
  • 蒸馏能力迁移的关键反证 :Gudibande, Snell, Song, Wallace 等,The False Promise of Imitating Proprietary LLMs,arXiv:2305.15717(UC Berkeley,2023-05)。核心结论:模仿模型在模仿数据未充分覆盖的任务上几乎未缩小与老师的差距,且模仿风格而非事实性;文中表格数据引自该论文报告的实验。
  • 知识蒸馏原始方法 :Hinton, Vinyals, Dean,Distilling the Knowledge in a Neural Network(2015)------软标签与温度 softmax 的来源。
  • 相关防守研究线索:模型水印(watermarking)与输出扰动(output perturbation);模型抽取(model extraction)的攻防综述。

说明:文中"前沿训练 25 亿--50 亿美元 / 蒸馏攻击 8 万--15 万美元 / 能力保留 80--95%"一组数字广泛流传于二手报道,我未能定位到可支撑的一手来源,且与 arXiv:2305.15717 的实验结论存在冲突,仅作为流传估计列出,不应作为决策依据。媒体报道的"蒸馏成功率 94% → 67%"来自某厂商内部测试转述,未见公开论文佐证。

相关推荐
2601_960554471 小时前
会议录音一键生成纪要:实测告别手工整理
人工智能
米小虾1 小时前
一周 AI 观察(9.5–9.11):AI 从"产品"变成"基础设施"
人工智能
Behaviour1 小时前
iPhone Duo 来了,苹果 Siri AI 接入定制 Gemini
人工智能·ios·语言模型·aigc·iphone
不要生病了1 小时前
扩散语言模型的“灵活性陷阱”:为什么训练时反而应该按自回归顺序探索?
人工智能·语言模型·回归
前端snow1 小时前
ai agent---语音交互
人工智能
IT·陈寒2 小时前
Vue组件props传对象给我整不会了
人工智能·大模型·api·创业·变现·简历优化
2601_965742222 小时前
全媒体运营与短视频代运营,两者有什么区别?
大数据·数据结构·人工智能·算法·ai·媒体
Joker-Zohar2 小时前
GPT-Image-2.5 双版本上线:8 组压力测试的提示词拆解,中文渲染零乱码
人工智能·gpt
白帽黑客-晨哥2 小时前
Copilot 能换成本地吗?本地化 AI 编程助手可行性全解析
人工智能·copilot