为什么现在越来越多的开源模型,都"毕业"于 Qwen?

作者:吴佳浩 Alben
引子:信息传播的速度,正在超过技术理解的速度
最近一年,AI 领域的信息量大到有点失控。
每天打开手机,扑面而来的都是:
- 新模型发布
- 新项目开源
- 新 Benchmark 刷新第一
- 新的"国产突破"
标题也越来越夸张:
"全球首个!" "国产超越 GPT!" "再次震惊 AI 圈!"
可是当你真的点进去,翻开 GitHub、Hugging Face,打开那张不起眼的 Model Card,往往会看到这样一行字:
bash
Base Model: Qwen
或者:
bash
Backbone: Llama / DeepSeek
然后你会意识到一件事:
很多所谓的"新模型",并不是全新的 Foundation Model,而是基于某个优秀的基座模型,继续训练出来的新能力。
这背后其实不是"自媒体在骗人",而是一个更值得关注的现象:AI 信息的传播速度,已经远远超过了大部分读者理解这些技术概念的速度。 Base Model、Checkpoint、SFT、Agent 这些完全不同层级的概念,被压缩进同一条十几秒的短视频、同一个耸动的标题里,误解也就随之产生。
于是一个问题自然浮现出来:
为什么现在越来越多的开源模型,都"毕业"于 Qwen?
需要先说明的是:Qwen、Llama、DeepSeek 等优秀的基础模型,正在共同成为开源生态的底座。这篇文章以 Qwen 为主要案例,是因为它目前案例最密集、覆盖面最广,但它绝不是唯一的答案。
一、GitHub 上正在发生一个有趣的变化
如果你最近半年持续关注开源模型社区,会发现一个现象:Qwen 正在悄悄成为大量新模型的"起点",而不是"终点"。
1. 多模态方向
比如腾讯的 WeMM-Embedding,定位是多模态 Embedding 模型,用于图像 / 文本 / 视频检索。它采用了大规模视觉语言模型作为基础能力来源,并针对多模态 Embedding 任务进行了进一步的训练优化------而不是从零搭建一个全新的视觉-语言架构。这类路线,与 Qwen、Llama 等开源基座模型的发展方向高度一致。
2. Embedding / Reranker 方向
大量向量模型、检索模型、排序模型,开始选择 Qwen 作为语言理解的基础。原因很朴素:做 Embedding 不需要重新发明 Transformer。真正的重点在于对比学习策略、数据构造方式、Hard Negative 挖掘、检索任务的针对性优化。
3. OCR / Document AI
现在很多文档理解模型,目标是解决 PDF 理解、表格解析、图文问答、企业知识库这些具体问题,底层也越来越多地选择 Qwen-VL 系列作为基础。
4. Agent / Tool Calling
Agent 时代对基座的要求变了:需要强指令理解、可靠的工具调用、长上下文支持、扎实的代码能力。越来越多面向中文场景的 Agent 类模型,开始选择 Qwen 作为基础能力来源------当然,Agent 这个方向本身是百花齐放的,Claude、GPT、Llama、DeepSeek 同样有大量的 Agent 生态,这里说的只是其中一条比较明显的路线。
5. 不只是中国团队
这里要特别澄清一点:这不是只有国内团队在这么做。像 NVIDIA 的 Nemotron 系列这样的国际项目,也体现了类似的路线------基于优秀的开源 Base Model,通过继续训练、数据优化和能力增强,形成面向特定场景的模型产品。需要说明的是,Nemotron 并不是一个统一基于 Qwen 的系列,它综合采用了包括 Qwen、Llama 在内的多种开源基座,这里想强调的不是"某一家用了什么",而是这套"基于开源 Base Model 继续训练"的方法论,已经被全球团队广泛采纳。
这说明的不是某一家公司多厉害,而是整个行业正在形成一种共识:优秀的 Base Model,已经变成了 AI 工业的基础设施。
当然,Qwen 并不是唯一扮演这个角色的模型。Llama、Gemma、DeepSeek 等同样承担着类似的功能。这篇文章讨论的是一个更普遍的趋势:优秀 Base Model 正在成为整个开源生态共同的"培养基",Qwen 只是目前案例最密集、最典型的一个。
二、不要误解:基于 Qwen 训练,不等于"套壳"
很多人第一次看到 Base Model: Qwen 时,本能反应是:
"这不就是套壳吗?"
但如果你真的了解今天大模型的研发流程,会发现事情没这么简单。一个 Foundation Model 之上,可以生长出非常多条不同的技术路线:

真正的创新,往往不是发生在 Transformer 结构本身,而是发生在:
- 数据(怎么构造、清洗、配比)
- 训练目标(用什么方式引导模型学习)
- Loss 设计
- 推理优化
- 工程系统(如何把模型稳定、高效地跑起来)
换句话说:Base Model 提供的是"语言和世界知识的底座",而真正决定一个衍生模型价值的,是它在这个底座之上解决了什么具体问题。
三、为什么偏偏是 Qwen?
1. 中文生态优势
国内大量企业场景本质上是中文场景------中文知识、中文语料、中文业务流程。Qwen 从训练数据到指令风格,天然对中文更友好,这是很多本土团队优先选择它的现实原因。
2. 多模态能力完整
从 Qwen-VL 到 Qwen3-VL,覆盖图片、视频、OCR、文档理解等多种模态任务,给下游开发者提供了一个"开箱即用"的多模态起点。
3. 参数规模覆盖完整
Qwen 系列的参数覆盖非常宽,从 0.5B、1.5B、4B、8B、14B、32B 一直到 72B、235B:

这种覆盖度意味着,无论你的目标场景是手机端、边缘设备、单卡服务器,还是大规模集群,几乎都能找到一个尺寸合适的 Qwen 版本作为起点。
4. 工程生态成熟
Qwen 对主流推理和部署框架的支持非常完善,包括 Transformers、vLLM、SGLang、Ollama、LMDeploy、TensorRT-LLM 等,这大大降低了开发者的接入成本。
5. 商业生态友好
对企业落地来说,最现实的考量往往不是"模型多强",而是 License 是否清晰、能否自由部署、能否修改、能否商用。Qwen 在这些方面给出了比较友好的答案。
三点五、为什么今天很少有人从零训练 Foundation Model?
这其实是贯穿全文的一个前提问题:既然从零训练一个模型理论上可行,为什么绝大多数团队都不这么做?
答案很现实:训练一个 Foundation Model,门槛已经高到大部分团队负担不起。它通常需要:
- 数万亿 Token 级别的高质量语料
- 数千张 GPU 的算力投入
- 一整套数据清洗与配比体系
- 成熟的分布式训练工程能力
- 长期的迭代与维护成本
这几项加在一起,注定了从零造一个 Foundation Model,只属于少数有足够资源的团队。
用一个类比来说:以前工业界比的是"谁能造出更好的发动机";而今天,发动机已经有少数几家公司能造得足够好,行业分工正在转向"谁能基于一台优秀的发动机,造出更好的汽车"。
这也是为什么,越来越多团队选择站在 Qwen、Llama、DeepSeek 这些已经训练好的基座之上,把精力放在数据、训练方法和场景能力上------这不是偷懒,而是一种更合理的行业分工。
四、AI 行业正在进入"Base Model 时代"
过去几年,行业竞争的核心问题是:谁能设计出更好的 Transformer 架构?
而现在,竞争的重心已经转移到:谁能把一个优秀的 Base Model,转化成真正解决问题的产品?
如果把这个过程画成一条价值链,大概是这样的:

这里特意加入了 Evaluation 这一环。今天很多团队的瓶颈,其实不是"不会训练",而是"不知道有没有真的提升"------没有可靠的评估体系,数据和训练方法的改动就是在盲开。Foundation Model 是这条链路的底层起点,但它本身并不直接产生价值------真正的价值是在"数据 + Training Recipe"塑造出能力、经过 Evaluation 验证有效、再转化为"领域能力",最终通过 Agent / Workflow 的组织落地为产品价值的过程中逐层产生的。
Base Model 正在变成新的"操作系统",而应用层的能力,才是最终被用户感知到的东西。
五、真正需要警惕的,是 AI 信息传播正在脱离技术事实
回到开头的话题:问题从来不是"开源模型太多了",而是很多内容根本不解释一个模型到底是什么,把完全不同的概念混为一谈:
| 名称 | 实际含义 |
|---|---|
| Foundation Model | 从零训练的基础模型 |
| Checkpoint | 某个训练阶段保存的权重版本 |
| SFT | 指令微调(Supervised Fine-Tuning) |
| CPT | 持续预训练(Continued Pre-Training) |
| LoRA | 参数高效微调 |
| Embedding | 向量模型,用于表示和检索 |
| Reranker | 排序模型,用于结果重排 |
| Agent | 系统级能力,通常调用一个或多个模型 |
而这些完全不同的概念,在很多标题里,最终都会被压缩成同一句话:
"某某发布新大模型"
久而久之,普通用户就会产生一种错觉:每天都有新的 GPT 级模型诞生。而事实是,大部分"新模型",只是在一个成熟基座之上做了针对性的继续训练。
六、以后怎么判断一个模型是不是真的有创新?
与其看标题、Star 数、Benchmark 截图,不如问自己三个问题:
1. 基座是什么?
是 Qwen?Llama?Gemma?DeepSeek?还是真正的全新预训练?
2. 改了什么?
架构变了吗?数据变了吗?Loss 设计变了吗?训练方法或推理优化有创新吗?
3. 解决了什么问题?
有没有真实的业务价值,是不是能落地到具体场景里。
这三个问题问下来,一个模型的"含金量"基本就能判断个八九不离十。
七、为什么 Base Model 会越来越像操作系统?
这里有一个类比,可能会让"黄埔军校"这个说法更容易理解。
在 Windows 时代,开发者不会重新去写一遍操作系统内核,而是在 Windows 提供的这套底层能力之上,开发出千千万万种应用软件。操作系统负责最基础、最通用的部分,应用软件负责解决具体问题。
今天的 Base Model,正在扮演类似的角色------它更像是一套 AI 操作系统,在它之上运行的是:
- Agent
- RAG(检索增强生成)
- Copilot 类产品
- 行业应用
- 企业知识系统
开发者不需要重新训练一个从零开始的语言模型,就像开发者不需要重新写一个操作系统内核一样。这正是"Base Model 基础设施化"的本质。
当然,这只是一个类比,不是严格对等------Android 是一个完整的软件平台,而 Qwen 本质上是一组模型权重。但如果一定要找一个参照物,Qwen 在开源 AI 生态中的角色,更接近 Android 在移动生态中的角色:提供一个开放底座,让大量开发者基于它构建自己的能力。
八、Qwen 为什么像开源 AI 的"黄埔军校"
今天的 Qwen,已经不仅仅是一个模型权重,它更像是:
- 一个训练平台
- 一个生态入口
- 一层基础设施
大量模型从这里出发,然后进入企业系统、开源社区、具体行业应用,长成完全不同的样子。未来大概率还会出现更多类似定位的 Base Model,但 Qwen 已经代表了一个明确的趋势:
开源 AI 正在从"造模型时代",走向"基座生态时代"。
结尾
过去几年,我们关注的是"谁训练出了最大的模型"。
未来的大模型竞争,不会只是模型之间的竞争,而是围绕基础模型生长出来的整个生态之间的竞争------谁能沉淀出更好的数据、更可靠的评估体系、更成熟的 Agent 生态、更贴近场景的行业能力。
Qwen 只是其中一个代表。
它像一所开源 AI 的黄埔军校,培养了一批又一批"毕业生";但真正决定这些毕业生价值的,不是它们毕业于哪里,而是它们走向世界之后,创造了什么。