别再以为大模型蒸馏就是抄答案了,我之前理解错了大半
前阵子刷到 OpenAI 和 DeepSeek 的争议新闻,我当时啃着瓜就下了结论:不就是拿大模型的输出训自己的小模型吗,说白了就是抄答案走捷径。直到这周专门去捋知识蒸馏的原理,才发现我之前的理解,连核心都没摸到 ------ 这玩意儿根本不是背答案那么简单。
从一条行业争议聊起:蒸馏到底是啥
2025 年 DeepSeek 花 600 万美金训练成本,做出了能和 OpenAI 掰手腕的模型,当时圈内直接炸了。OpenAI 那边直指对方用了蒸馏技术,属于抄捷径。我当时跟着看热闹,对蒸馏的全部认知就是:批量给大模型发请求,把返回的答案攒成数据集,拿去训自己的模型。
说实话,那时候我打心底觉得这技术没什么技术含量,不就是堆 API 调用量吗?直到这周仔细啃完知识点,才发现自己完全想偏了。
先从名字说起吧。蒸馏本来是化学里的操作,把混合液体加热,不同成分沸点不一样,该挥发的挥发,再冷凝收集,最终目的是提取精华、去掉糟粕。大模型领域的知识蒸馏,思路几乎是照搬这个逻辑:把大模型里藏着的海量知识,提炼出最核心的精华,再 "灌" 到体量更小的模型里。
行业里习惯把大的那个叫老师模型 ,小的叫学生模型。整个提取知识、传递给小模型的过程,就是知识蒸馏。
我之前最大的认知误区:以为是背答案,其实是学手感
这是我踩的第一个坑,也是大部分人刚接触蒸馏时最容易误解的地方。
我最开始想的特别直白:蒸馏不就是给学生模型喂题目,再把老师模型给的答案当标准答案,让学生照着学吗?跟学生背题库有什么区别?这样训出来的模型,换个题目不就直接废了?
后来才明白,这种只记最终答案的做法,叫硬标签,根本算不上真正的蒸馏,也是最低效的做法。
硬标签:只告诉你对错,不告诉你为什么
我们平时训练普通模型,用的基本都是硬标签。比如做图片分类,标注一张图是猫,那标签就是非黑即白的:猫是 1,狗、老虎、鸡全是 0。模型学的就是 "这个图案对应猫这个类别",对错分明,没有任何中间地带。
就像考试背选择题答案,你只记住这道题选 A,至于为什么选 A、B 和 C 错在哪、哪个选项迷惑性最强,你一概不知道。换个题干稍微改一改,你就不会了。
如果蒸馏只用硬标签,那训出来的小模型就是个 "背题家",泛化能力差得离谱,根本没学到大模型的真本事。
软标签:藏着大模型没说出口的暗知识
真正的蒸馏,核心学的是软标签。
很多人不知道,大模型回答问题的时候,输出的从来不是一个孤零零的答案。它本质上是在计算概率:比如判断一张图是什么,它内部会算出一串结果 ------ 猫的概率 80%,狗 10%,老虎 8%,鸡 2%。最后只把概率最高的 "猫" 作为答案返回给你,但背后这一整串概率分布,才是它真正的 "思考过程"。
这串带权重的概率分布,就是软标签。

划个重点 软标签里最有价值的,不是最高的那个正确答案,而是其他错误选项的概率占比。
你仔细品品这组数字:为什么狗的概率比老虎高?因为在大模型的认知里,猫和狗都是常见家养宠物,视觉特征共性更多;老虎虽然是猫科,但日常场景出现频率低,相似度反而排在狗后面;鸡和猫差异最大,所以概率最低。
这些类别之间的关联度、相似性、模糊地带,就是大模型从万亿级数据里摸出来的暗知识------ 是标注数据里永远不会写、硬标签里永远藏不住的信息。它没法直接用语言说清楚,但真实影响着模型的判断逻辑。
而蒸馏要做的,就是让小模型去拟合这一整串概率分布。不是让它记住 "这道题选猫",而是让它学会 "为什么猫的概率最高,为什么狗比老虎更像猫,为什么鸡基本不沾边"。
说白了,小模型学的不是答案,是大模型的思考方式。
一个最通俗的比方:菜谱和大厨示范的区别
说个我自己琢磨出来的比方,听完你肯定就懂了。
假设你要培养一个新人厨师,有两种带法。
第一种,甩给他一本精准到克的菜谱:盐 2 克、生抽 5 毫升、中火炒 3 分钟,一步一步写死。新人严格照着做,也能做出一盘能吃的菜。但换个锅、换个牌子的酱油、甚至换个地方的燃气火候,他大概率就做砸了。因为他只记住了步骤,没理解背后的逻辑。这就是硬标签教学。
第二种,让他站在米其林大厨旁边看一整天。大厨不会跟你说放几克盐,他会尝一口,然后稍微加一点;不会定闹钟算时间,他看菜的颜色和状态就知道熟没熟;甚至同样一道菜,食材新鲜度不一样,调味和火候都会微调。新人在旁边学的,是大厨的判断逻辑、是经验攒出来的手感、是菜谱上写不出来的细节。
蒸馏干的就是第二件事。大模型是米其林大厨,小模型是新人。我们不让新人死背菜谱,而是让他全程看大厨怎么做,去模仿大厨的判断逻辑,把大厨的 "感觉" 尽可能学到自己身上。
说句实在的:蒸馏真的是作弊吗
聊回最开始的行业争议,很多人说蒸馏就是作弊、就是剽窃,其实这话有点片面。
知识蒸馏本身是模型压缩领域非常经典的技术,早就存在了,根本不是什么旁门左道。它最正统的用法是:你自己训了一个效果很好但体积很大的模型,部署起来又贵又慢,于是你用蒸馏的方法,把大模型的能力浓缩到一个小模型里,既能保证效果差不太多,又能省算力、跑得快。
现在我们手机里很多端侧 AI 功能,背后其实都是蒸馏后的小模型在跑。总不能为了个相册分类,把千亿参数的大模型塞手机里吧。
但话又说回来,如果未经授权,批量调用别人家的商用 API,用人家的模型输出大规模训练自己的商用模型,那这就是合规和商业伦理层面的问题了,和技术本身好不好是两码事。
最后聊聊我踩过的几个认知坑
捋完整个原理,回头看自己最开始的想法,真的错得挺明显的。这里也说几个最容易踩的认知误区,省得大家再走弯路。
第一个坑,觉得蒸馏就是 "抄答案",技术含量低。真不是。只拿硬标签训那才叫抄答案,真正的蒸馏要处理软标签、要控制拟合程度、要平衡效果和速度,门道多着呢。不然为什么同样是蒸馏,有人训出来的小模型又快又准,有人训出来的就是个废物。
第二个坑,觉得蒸馏无所不能,小模型能完全追上大模型。别想了,不可能。学生模型的参数规模就是它的天花板,就像再厉害的老师,也没法把小学生教成院士。蒸馏只能在小模型的能力上限里,尽量让它逼近大模型的效果,参数差太多的话,再厉害的技巧也没用。
第三个坑,觉得蒸馏只能用来训大模型。其实恰恰相反,蒸馏最常用的场景是落地部署。大模型效果好,但太贵太慢;小模型便宜快,但效果差点意思。蒸馏就是在中间找平衡,让小模型尽可能吸收大模型的能力,满足落地的性价比需求。
其实搞懂蒸馏之后再回头看那些行业新闻,就不会只停留在吃瓜层面了。很多技术名词听起来玄乎,扒开了看核心逻辑都特别朴素 ------ 说白了就是 "师傅带徒弟",只不过师傅是大模型,徒弟是小模型,带的方式不是讲知识点,是让徒弟模仿自己的思考过程。
如果你之前也对蒸馏有误解,或者有自己的理解,欢迎在评论区聊两句。毕竟技术这东西,越聊越明白。