知识蒸馏:大模型教小模型,远不止背答案那么简单

摘要:从 DeepSeek 被指控蒸馏 OpenAI 的争议切入,拆解知识蒸馏的核心机制------硬标签只背答案,软标签才是思维方式的传承,用化学蒸馏和米其林大厨带徒弟两个类比,把暗知识的本质讲透。


2025 年,DeepSeek 以 600 万美金的训练成本,做出了和 OpenAI 掰手腕的模型。OpenAI 随即指控 DeepSeek 用了一种叫蒸馏的技术------把 OpenAI 的输出拿去训练自己的模型,走捷径。这个指控让"蒸馏"从一个学术术语变成了行业热词。但蒸馏到底是什么?它和普通的"让模型学习答案"有什么本质区别?小模型公司怎么去学大模型公司的本事?


化学蒸馏:提取精华,去其糟粕

"蒸馏"这个词最早来自化学。把混合液体加热,让某些成分变成蒸汽挥发,再冷却收集------提取精华,去其糟粕。一瓶海水,蒸馏后得到淡水;一桶原油,蒸馏后得到汽油、柴油、沥青。

这个过程的核心逻辑是:不是把整个混合物搬过来,而是只提取其中有价值的部分。

大模型蒸馏的核心思路一模一样。把大模型里的"精华知识"提取出来,灌进小模型。大模型被称为老师模型 (Teacher Model),小模型被称为学生模型 (Student Model)。提取的过程,就叫知识蒸馏(Knowledge Distillation)。

这有点像《天龙八部》里无崖子把毕生功力传给虚竹------不是给虚竹一本武功秘籍让他自己练,而是直接把内功灌进去。虚竹拥有的不是"如何练功"的知识,而是"练功之后"的实力。


硬标签:让学生背答案,看似高效实则肤浅

小模型怎么学习大模型的本事?最直接的做法是:向大模型发送大量问题,拿到答案,然后让小模型去学这些"题目和标准答案"的对应关系。

比如,给大模型看一张猫的图片,大模型回答"这是猫"。小模型就把这个对应关系记下来:这张图 = 猫。这个方法叫硬标签(Hard Label)------答案是一个确定的、非此即彼的标签。

javascript 复制代码
// 硬标签:只有一个正确答案
const hardLabel = {
    label: "猫",
    confidence: 100%  // 非猫即非猫,没有中间地带
}

硬标签的优点是简单直接。但问题也很明显:小模型学到的只是"标准答案",不是"思维方式"。 就像一个学生对着答案书背题目------考试遇到一模一样的题会做,题目稍微变一下,就傻了。

硬标签丢失了大量信息。大模型在看到猫的图片时,脑子里不是"猫 = 100%,其他 = 0%"。它真正的判断过程是一组概率分布------这才是大模型"思考"的本质。

硬标签和软标签的差异,一张图就能说清楚:

硬标签的答案是"猫 = 1,狗 = 0",非此即彼。软标签的答案是"猫 0.6,狗 0.3,虎 0.1",一种渐变的概率谱。前者是判断题,后者是理解题。


软标签:概率分布里藏着大模型的思维方式

大模型在回答问题时,输出的不是单一答案,而是一组概率分布。这是 LLM 工作方式的核心------它不是在"选择"答案,而是在"评估"每个可能答案的合理程度。

以识别一张猫的图片为例,大模型的实际输出可能是:

javascript 复制代码
// 软标签:一个概率分布,包含了丰富的语义信息
const softLabel = {
    "猫": 0.80,    // 80% 的把握这是猫
    "狗": 0.10,    // 10% 的把握这是狗
    "老虎": 0.05,  // 5% 的把握这是老虎
    "鸡": 0.01,    // 1% 的把握这是鸡
    // ... 其他动物各占微小概率
}

这个概率分布比硬标签"猫 = 100%"包含了多得多的信息,这就是软标签(Soft Label):

  1. "猫"和"狗"有相似之处(狗的概率 10%,远高于鸡的 1%)------说明大模型认为猫和狗在形态上比较接近,都是常见宠物
  2. "猫"和"老虎"也有相似之处(老虎的概率 5%)------说明大模型知道猫和老虎同属猫科动物,但差异比狗更大
  3. "猫"和"鸡"基本不相关(鸡的概率只有 1%)------说明大模型清楚这两者之间几乎没有任何关联

这种"猫和狗比较像,猫和老虎有点像但没那么像,猫和鸡完全不像"的类比感和关联感,是大模型在积累了海量训练数据后形成的暗知识(Dark Knowledge)。它不是显式地写在某个文档中的规则,而是隐含在概率分布的结构中。

硬标签只能告诉小模型"答案就是猫,记住就行了"。软标签告诉小模型"这张图 60% 像猫,30% 像狗,10% 像老虎"------它包含了大模型对这道题的理解方式:猫和狗有相似之处,老虎不太像但也有点像。这种"类比感"和"关联感",是大模型积累了海量数据之后形成的暗知识,硬标签里完全没有。

蒸馏的本质,就是让小模型去模仿这套概率分布,而不是只背标准答案。学生模型学的不只是"猫是猫",而是"猫这种生物在大模型的认知体系里,和狗、老虎、鸡分别是什么关系"。


蒸馏流程:老师怎么把"思维方式"传给学生

左侧:老师模型(大模型)。老师看到一张猫的图片,输出的是概率分布------猫 60%、狗 30%、老虎 10%。这不是一个简单答案,而是老师"思考"的过程。

中间:蒸馏过程 。不是直接把答案复制给学生,而是提炼------把老师的概率分布作为软标签,让学生去模仿。这个过程叫"知识蒸馏",提炼的是老师的"思维方式"。

右侧:学生模型(小模型)。学生经过训练后,面对同一张猫的图片,输出的概率分布接近老师------猫 ≈ 60%、狗 ≈ 30%、老虎 ≈ 10%。学生学到的不是"猫是猫"这个结论,而是"为什么猫是猫"的判断过程。

蒸馏流程的三个角色对应了三个关键步骤:老师输出软标签 → 学生模仿概率分布 → 学生获得思维方式 。这句话浓缩了知识蒸馏的全部精髓:"小模型学的不是答案,而是思维方式。"


米其林大厨带徒弟:蒸馏的终极类比

想象你要培养一个厨师新人。两种方案:

方案一:给菜谱(硬标签)

你给新人一本厚厚的菜谱:宫保鸡丁 ------ 鸡胸肉 200g、花生 50g、干辣椒 10g、酱油 15ml、糖 10g、淀粉 5g、大火翻炒 3 分钟。

新人按步骤操作,做出来的菜"形似"。但换个食材------比如把鸡胸肉换成鸡腿肉------他就不知道该怎么调整火候和调味了。因为菜谱只教了"步骤",没教"判断"。

方案二:让米其林大厨亲自示范(蒸馏)

大厨在灶台前做菜,新人在旁边看。大厨不只看菜谱,还看食材的状态------这块鸡胸肉偏厚,多切一刀;今天的辣椒不够辣,多加半勺;火候差不多了,不是看时间,而是看油的颜色和肉的纹理变化。

新人学到的不是"翻炒 3 分钟",而是"如何判断什么时候该出锅"。这个"判断力"就是大厨的暗知识------它无法写成菜谱,但可以通过观察和模仿来传递。

让大厨亲自示范,这就是蒸馏训练。 小模型在模仿大模型概率分布的过程中,学到的不是"标准答案",而是"判断答案的方式"。

维度 硬标签(背菜谱) 蒸馏(看大厨示范)
学什么 标准答案 概率分布(思维方式)
换题怎么办 不会,没见过 会,学会了判断
信息量 低(只有对错) 高(包含类间关系)
迁移能力

蒸馏在 LLM 领域的实际应用

回到 DeepSeek 的争议。OpenAI 指控 DeepSeek 蒸馏 OpenAI 的模型,具体做法可能是:向 OpenAI 的 API 发送大量请求,把输入和输出的概率分布(软标签)收集下来,用来训练自己的模型。

这个指控在技术上是否成立,我们不做判断。但蒸馏本身是一项合法的、被广泛使用的技术。Google 在 2015 年就发表了知识蒸馏的论文,之后这项技术被用于:

  • 模型压缩:把 GPT-4 级别的能力压缩到可以在手机上运行的模型大小
  • 领域迁移:把通用模型的知识蒸馏到垂直领域模型(如医疗、法律)
  • 多模态蒸馏:让一个纯文本模型学到视觉模型对图片的理解方式

蒸馏不是"作弊",而是 AI 模型发展的一条重要技术路线。关键问题在于:蒸馏的是公开数据还是专有数据? 如果蒸馏的是 API 返回的公开输出,这在技术上是合法的;但如果涉及破获 API 限制、大规模抓取服务条款禁止的数据,那就进入了灰色地带。


总结

知识蒸馏本质上不是"抄答案",而是传承思维方式。三个核心认知:

  1. 硬标签是背答案:小模型记住了"猫 = 猫",但不知道为什么,换张没见过的猫图片就认不出来
  2. 软标签是学判断:概率分布(猫 80%、狗 10%、老虎 5%、鸡 1%)包含了类与类之间的语义关系,这种暗知识是大模型在海量数据上积累的认知结构
  3. 蒸馏是看大厨示范:不是给菜谱,而是让新人站在米其林大厨旁边,看他怎么判断火候、怎么凭感觉调味

蒸馏让大模型的"内力"能够传递给小模型,让成本只有几百万美金的模型,也能拥有接近顶级模型的能力。用菜谱培养的是流水线厨师,用蒸馏培养的是下一个米其林大厨。

相关推荐
寒水馨1 天前
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)
windows·llm·大语言模型·llama·本地部署·ollama·模型运行
leeyi1 天前
流式传输引擎:Eino StreamReader 源码拆解(第61篇-E47)
llm·aigc·agent
AINative软件工程1 天前
LLM 应用的熔断降级工程实践:Circuit Breaker 不只是重试的升级版
后端·llm·ai编程
wangruofeng2 天前
opencodex 解锁 Codex 任意模型,一个本地代理打通 Claude/Kimi/GLM/DeepSeek
llm·github·openai
wangruofeng2 天前
姚顺雨长谈:在 Anthropic 和 Gemini 训练模型,英雄主义已经过时
llm·aigc
赵康2 天前
AI 写代码之后,Code Review 会议怎么开
ai·llm·skill
莫逸风2 天前
【AgentScope 2.0】 0. 学习指南
java·llm·agent·agentscope
谢白羽2 天前
vllm源码剖析14-vLLM 分布式推理-专家并行EP
笔记·分布式·llm·论文·vllm