第16章 主流开源模型选型:Qwen/LLaMA/GLM/Mistral 怎么选
一句话点题: 2024年开源大模型已经能打闭源了,别只盯着GPT------选对模型,省下的不只是钱,还有数据安全和自主可控。
16.1 开源 vs 闭源:先搞清楚选什么
在选具体模型之前,先回答一个根本问题:该用开源还是闭源?
闭源模型(API调用)
代表:GPT-4o、Claude 3.5、Gemini 1.5
优势:
- 效果最好(GPT-4o、Claude 3.5 Sonnet 仍是天花板)
- 零运维,调API就行
- 迭代快,厂商持续更新
劣势:
- 数据要发给厂商,敏感行业不能用
- 按Token收费,量大了一月烧几万到几十万
- 不可控,厂商随时可能改API、涨价、下线
- 有内容审查,某些合法场景被误杀
开源模型(自己部署)
代表:Qwen、LLaMA、GLM、Mistral、DeepSeek
优势:
- 数据不出本地,安全合规
- 一次性投入硬件,长期使用成本远低于API
- 可微调、可定制,适配特定业务
- 完全自主可控,不受厂商限制
劣势:
- 效果略逊于顶级闭源(差距在缩小)
- 需要GPU硬件或云服务器
- 有运维成本(部署、监控、更新)
- 需要一定的技术能力
怎么选:决策树
你的数据敏感吗?(金融/医疗/政务/军工)
├── 是 → 开源模型(必须自部署)
└── 否 → 你的日均调用量多大?
├── < 1000次 → 闭源API(省钱省事)
├── 1000-10000次 → 闭源API 或 开源(看预算)
└── > 10000次 → 开源模型(自部署更划算)
└── 需要微调吗?
├── 是 → 开源(必须)
└── 否 → 两者都行,算经济账
2024年的关键变化:开源模型和闭源的差距已经非常小了。 Qwen2.5-72B、DeepSeek-V3、LLaMA-3.1-405B 在很多基准测试上已经追平甚至超过 GPT-4。如果你因为一年前的印象觉得"开源不行",是时候重新评估了。
16.2 开源模型四大阵营
目前开源大模型主要有四大阵营,每个阵营背后是一家公司或组织:
| 阵营 | 代表模型 | 背景 | 开源策略 |
|---|---|---|---|
| 阿里通义 | Qwen 系列 | 阿里云 | 全系列开源,中文最强 |
| Meta | LLaMA 系列 | Facebook/Meta | 领头开源,生态最大 |
| 智谱AI | GLM 系列 | 清华系 | 开源+商用友好 |
| DeepSeek | DeepSeek 系列 | 幻方量化 | 极致性价比,训练成本低 |
除此之外还有 Mistral(法国团队,欧洲代表)、Yi(零一万物)、Baichuan(百川智能)等,但主流选择集中在前四家。
16.3 Qwen(通义千问):中文场景的首选
基本信息
| 项目 | 内容 |
|---|---|
| 发布方 | 阿里云 |
| 官网 | qwen.readthedocs.io |
| HuggingFace | Qwen/Qwen2.5-* |
| 开源协议 | Apache 2.0(商用免费) |
| 最新版本 | Qwen2.5(2024年9月) |
| 模型规模 | 0.5B / 1.5B / 3B / 7B / 14B / 32B / 72B |
为什么推荐 Qwen
1. 中文能力最强
Qwen 的训练数据中中文占比高,中文理解、生成、文化常识远超 LLaMA。在 C-Eval(中文考试)、CMMLU(中文多任务理解)等中文基准上长期第一。
实测对比(同一句中文):
问题: "解释什么是'阴阳怪气'"
Qwen: "阴阳怪气是指说话时不直接表达真实想法,而是用看似正常但暗含讽刺
或不满的语气来表达,让人感觉不舒服但又不好直接反驳的交流方式。"
LLaMA: "阴阳怪气 is a Chinese term that refers to..." (中文夹杂英文,理解偏差)
2. 全系列开源,尺寸齐全
从 0.5B(手机能跑)到 72B(需要多卡),各种尺寸都有,适配不同部署场景。
3. 编码和数学能力突出
Qwen2.5-Coder 系列在代码生成上超过了很多更大的模型,Qwen2.5-Math 在数学推理上也表现出色。
4. 中文 Token 效率高
Qwen 的 Tokenizer 对中文优化好,同样一段中文,Qwen 用的 Token 数比 LLaMA 少 30-50%------推理更快、成本更低。
5. 工具调用能力强
Qwen 对 Function Calling 的支持非常好,适合做 Agent 开发。
Qwen2.5 各尺寸对比
| 模型 | 参数量 | 推荐显存(FP16) | 推荐显存(INT4) | 适合场景 |
|---|---|---|---|---|
| Qwen2.5-0.5B | 5亿 | 1GB | 0.5GB | 手机/边缘设备 |
| Qwen2.5-1.5B | 15亿 | 3GB | 1.5GB | 树莓派/低配设备 |
| Qwen2.5-3B | 30亿 | 6GB | 2.5GB | 普通笔记本 |
| Qwen2.5-7B | 70亿 | 14GB | 5GB | 单卡部署(主流选择) |
| Qwen2.5-14B | 140亿 | 28GB | 10GB | 单卡A100/A6000 |
| Qwen2.5-32B | 320亿 | 64GB | 20GB | 双卡A100 |
| Qwen2.5-72B | 720亿 | 144GB | 48GB | 多卡服务器 |
Qwen 变体系列
| 变体 | 用途 | 说明 |
|---|---|---|
| Qwen2.5 | 通用对话 | 默认选择 |
| Qwen2.5-Coder | 代码生成 | 编程能力强 |
| Qwen2.5-Math | 数学推理 | 数学解题强 |
| Qwen2-VL | 视觉理解 | 图片/视频理解 |
| Qwen2-Audio | 语音理解 | 语音输入 |
| Qwen2.5-MoE | 混合专家 | 用A14B的参数达到72B的效果 |
16.4 LLaMA:生态最大的开源模型
基本信息
| 项目 | 内容 |
|---|---|
| 发布方 | Meta |
| 官网 | llama.meta.com |
| 开源协议 | LLaMA 3 License(有使用限制) |
| 最新版本 | LLaMA 3.1(2024年7月) |
| 模型规模 | 8B / 70B / 405B |
LLaMA 的优势
1. 生态最大
LLaMA 是开源大模型的"祖师爷"------市面上大多数开源模型(Qwen 早期版本、Vicuna、Alpaca 等)都是基于 LLaMA 架构开发的。社区工具、微调脚本、部署方案最多。
2. 405B 是最强的开源模型
LLaMA 3.1 405B 是目前参数量最大的开源模型,在很多基准测试上接近 GPT-4o 和 Claude 3.5。
3. 英文能力最强
如果你的应用场景以英文为主(如面向海外用户),LLaMA 的英文理解和生成仍然是最强的。
4. 多语言支持
LLaMA 3.1 支持 8 种语言(英、法、德、意、葡、西、泰、印地),虽然中文不如 Qwen,但多语言覆盖面广。
LLaMA 的劣势
1. 中文偏弱
LLaMA 的中文训练数据占比低,中文理解和生成不如 Qwen。虽然 LLaMA 3 比前几代好了很多,但仍有差距。
2. 开源协议有限制
LLaMA 3 的协议规定:月活用户超过 7 亿的产品需要单独申请授权。对绝大多数公司不是问题,但大公司需要注意。
3. 模型尺寸选择少
只有 8B / 70B / 405B 三个尺寸,中间档(如 14B、32B)缺失,不如 Qwen 灵活。
LLaMA 3.1 各尺寸对比
| 模型 | 参数量 | 推荐显存(FP16) | 推荐显存(INT4) | 适合场景 |
|---|---|---|---|---|
| LLaMA 3.1-8B | 80亿 | 16GB | 6GB | 单卡部署 |
| LLaMA 3.1-70B | 700亿 | 140GB | 45GB | 多卡服务器 |
| LLaMA 3.1-405B | 4050亿 | 810GB | 250GB | 集群部署 |
16.5 GLM(智谱):清华系的全能选手
基本信息
| 项目 | 内容 |
|---|---|
| 发布方 | 智谱AI(清华系) |
| 官网 | zhipuai.cn |
| 开源协议 | MIT(商用最友好) |
| 最新版本 | GLM-4(2024年6月开源 GLM-4-9B) |
| 模型规模 | 9B(开源版)/ 130B+(API版) |
GLM 的优势
1. MIT 协议,商用最友好
GLM 采用 MIT 协议,没有任何使用限制------想怎么用就怎么用,大公司也放心。
2. 中英双语均衡
GLM 的中英文能力比较均衡,中文不如 Qwen 但好于 LLaMA,英文不如 LLaMA 但好于 Qwen。
3. 架构独特
GLM 用的是 GLM(General Language Model)架构,融合了 BERT 的双向注意力和 GPT 的自回归生成,理论上理解能力更强。
4. 工具调用和多模态
GLM-4 支持工具调用、代码执行、网页浏览,且开源了视觉版本 GLM-4V。
GLM 的劣势
1. 开源尺寸有限
目前开源的主要是 9B 版本,没有 70B+ 的大尺寸开源,高精尖场景受限。
2. 社区生态不如 Qwen 和 LLaMA
微调工具、部署教程、第三方支持相对少一些。
16.6 DeepSeek:极致性价比的黑马
基本信息
| 项目 | 内容 |
|---|---|
| 发布方 | 深度求索(幻方量化) |
| 官网 | deepseek.com |
| 开源协议 | MIT |
| 最新版本 | DeepSeek-V3 / DeepSeek-R1 |
| 模型规模 | 671B(MoE,激活37B) |
DeepSeek 的优势
1. MoE 架构,推理成本极低
DeepSeek-V3 采用 Mixture of Experts(MoE)架构,总参数 671B 但每次推理只激活 37B------用 37B 的计算成本获得接近 671B 的效果。
2. 训练成本惊人地低
DeepSeek-V3 的训练成本仅约 557 万美元(2048 张 H800 训练约 2 个月),远低于 GPT-4 估计的数亿美元。证明了高效训练策略的重要性。
3. 效果接近顶级闭源
在多项基准测试上,DeepSeek-V3 接近 GPT-4o 和 Claude 3.5 Sonnet,是开源模型中效果最好的之一。
4. API 价格极低
DeepSeek 的 API 价格远低于同行,输入 1 元/百万 Token,输出 2 元/百万 Token(缓存命中更便宜),性价比碾压级。
5. DeepSeek-R1 推理能力突破
DeepSeek-R1 是专注于推理的模型(类似 OpenAI o1),在数学、代码、逻辑推理上表现出色,且完全开源,甚至公开了训练方法。
DeepSeek 的劣势
1. 部署门槛高
671B 参数的模型部署需要大量显存,即使 INT4 量化也需要约 350GB 显存(约 5 张 H100)。普通团队难以自部署。
2. MoE 推理框架要求高
MoE 架构需要专门的推理框架支持,部署复杂度高于 Dense 模型。
3. 品牌知名度不如 Qwen/LLaMA
虽然技术实力强,但社区生态和工具支持还在追赶中。
16.7 Mistral:欧洲的力量
基本信息
| 项目 | 内容 |
|---|---|
| 发布方 | Mistral AI(法国) |
| 官网 | mistral.ai |
| 开源协议 | Apache 2.0 |
| 最新版本 | Mistral Large 2 / Mixtral 8x22B |
| 模型规模 | 7B / 8x7B(MoE) / 8x22B(MoE) / 123B |
Mistral 的优势
1. 小模型效率高
Mistral 7B 在同尺寸模型中效率出众,MoE 架构的 Mixtral 8x7B 用较少的激活参数达到 70B 级别的效果。
2. 欧洲合规
如果业务在欧洲,Mistral 是 GDPR 合规的优先选择。
3. 推理速度快
MoE 架构 + 优化的推理框架,生成速度快。
Mistral 的劣势
1. 中文能力弱
训练数据以英文和欧洲语言为主,中文能力明显不如 Qwen 和 GLM。
2. 不太适合中文场景
如果你的用户主要说中文,别选 Mistral。
16.8 四大模型横向对比
综合能力对比
| 维度 | Qwen2.5 | LLaMA 3.1 | GLM-4 | DeepSeek-V3 |
|---|---|---|---|---|
| 中文能力 | ★★★★★ | ★★★ | ★★★★ | ★★★★ |
| 英文能力 | ★★★★ | ★★★★★ | ★★★★ | ★★★★★ |
| 代码能力 | ★★★★ | ★★★★ | ★★★ | ★★★★★ |
| 数学推理 | ★★★★ | ★★★★ | ★★★ | ★★★★★ |
| 工具调用 | ★★★★★ | ★★★ | ★★★★ | ★★★★ |
| 多模态 | ★★★★(VL) | ★★★ | ★★★★(V) | ★★★ |
| 开源协议 | Apache 2.0 | LLaMA License | MIT | MIT |
| 部署难度 | 低~中 | 低~高 | 低 | 高 |
| 社区生态 | ★★★★★ | ★★★★★ | ★★★ | ★★★ |
各尺寸效果对比(以7-9B为例)
| 模型 | 中文理解 | 代码生成 | 数学推理 | 指令遵循 |
|---|---|---|---|---|
| Qwen2.5-7B | ★★★★★ | ★★★★ | ★★★★ | ★★★★ |
| LLaMA 3.1-8B | ★★★ | ★★★ | ★★★ | ★★★★ |
| GLM-4-9B | ★★★★ | ★★★ | ★★★ | ★★★★ |
| Mistral 7B | ★★ | ★★★ | ★★ | ★★★ |
16.9 选型决策框架
按场景选模型
| 场景 | 首选模型 | 原因 |
|---|---|---|
| 中文对话/客服 | Qwen2.5-7B/14B | 中文最强,尺寸灵活 |
| 英文应用 | LLaMA 3.1-8B/70B | 英文最强,生态好 |
| 代码助手 | DeepSeek-Coder / Qwen2.5-Coder | 代码能力突出 |
| 数学/逻辑推理 | DeepSeek-R1 | 推理能力强 |
| 多模态(图文) | Qwen2-VL / GLM-4V | 视觉理解好 |
| 手机/边缘设备 | Qwen2.5-0.5B/1.5B | 小尺寸效果好 |
| 高精度复杂任务 | Qwen2.5-72B / LLaMA 3.1-405B | 大模型能力强 |
| 预算有限的推理 | DeepSeek-V3 API | API价格最低 |
| 需要商用无限制 | GLM-4 / DeepSeek | MIT协议 |
| Agent/工具调用 | Qwen2.5 | Function Call支持好 |
| 欧洲业务 | Mistral | GDPR合规 |
按硬件选模型
| 硬件配置 | 推荐模型 | 量化方案 |
|---|---|---|
| 消费级显卡(8GB) | Qwen2.5-7B | INT4 |
| 消费级显卡(12GB) | Qwen2.5-7B | INT8 |
| 消费级显卡(16GB) | Qwen2.5-14B | INT4 |
| 工作站(24GB,如3090/4090) | Qwen2.5-14B/32B | INT4/INT8 |
| 单卡A100(40GB) | Qwen2.5-32B | INT8 |
| 单卡A100(80GB) | Qwen2.5-72B | INT4 |
| 双卡A100(160GB) | Qwen2.5-72B | FP16 |
| 4卡A100(320GB) | LLaMA 3.1-70B | FP16 |
| 8卡H100(640GB) | Qwen2.5-72B / LLaMA 3.1-70B | FP16 |
| 集群(2000GB+) | DeepSeek-V3 / LLaMA 3.1-405B | INT4 |
按团队技术能力选
| 团队能力 | 推荐方案 |
|---|---|
| 无AI团队,只会调API | DeepSeek API(最便宜)或 Qwen API |
| 有后端,能部署 | Ollama + Qwen2.5-7B(最简单的部署方案) |
| 有AI工程师 | vLLM + Qwen2.5-14B/32B |
| 有完整AI团队 | 多模型组合:Qwen做主力 + DeepSeek做推理 |
16.10 MoE vs Dense:两种架构的选型
什么是 MoE
Dense(稠密)模型:每次推理,所有参数都参与计算。如 Qwen-72B、LLaMA-70B。
MoE(Mixture of Experts,混合专家)模型:模型内部有多个"专家"网络,每次推理只激活其中一部分。如 DeepSeek-V3(671B总参数,37B激活)、Mixtral 8x7B(47B总参数,13B激活)。
两种架构对比
| 维度 | Dense 模型 | MoE 模型 |
|---|---|---|
| 计算效率 | 低(全部参数参与) | 高(只激活部分) |
| 显存占用 | 少(只存激活的参数) | 多(要存所有专家) |
| 同等算力效果 | 一般 | 更好 |
| 部署难度 | 简单 | 复杂 |
| 显存/计算比 | 均衡 | 高显存低计算 |
| 适合场景 | 显存有限 | 算力有限、显存充足 |
大白话理解
Dense 模型像一个"全能员工",什么都会但每次做任何事都要动用全部能力。
MoE 模型像一个"专家团队",有8个专家,每次根据任务类型找最合适的2个专家干活------其他6个闲着但要发工资(占显存)。
选型建议
- 显存充足、追求性价比 → MoE(如 Mixtral 8x7B、DeepSeek-V3)
- 显存有限、追求简单 → Dense(如 Qwen2.5-7B/14B)
- 需要极致推理速度 → MoE(激活参数少,计算量小)
- 需要微调 → Dense(MoE 微调更复杂)
16.11 实际选型案例
案例一:创业公司做中文客服机器人
需求: 中文对话、日均5000次问答、部署在自有服务器、预算有限
分析:
- 中文场景 → Qwen 系列
- 日均5000次 → 不算大,7B 够用
- 预算有限 → 单卡部署
- 客服需要工具调用 → Qwen 的 Function Call 好
推荐: Qwen2.5-7B + INT4量化 + vLLM 部署,一张 3090/4090 即可
案例二:金融公司做研报分析
需求: 中文研报理解、数据不能外传、需要高精度
分析:
- 数据敏感 → 必须自部署
- 中文专业文本 → 需要强中文能力
- 高精度 → 大模型
- 金融场景 → 需要微调
推荐: Qwen2.5-72B + 行业数据微调(LoRA),4张A100部署
案例三:出海公司做英文编程助手
需求: 英文为主、代码生成、面向海外开发者
分析:
- 英文 → LLaMA 系列最强
- 代码生成 → 可以考虑 DeepSeek-Coder 或 Qwen-Coder
- 海外用户 → LLaMA 生态好
推荐: LLaMA 3.1-8B 做日常对话 + DeepSeek-Coder 做代码生成,双模型路由
案例四:个人开发者做本地知识库
需求: 个人使用、本地文档问答、笔记本能跑
分析:
- 本地部署 → 小模型
- 笔记本 → 8GB 显存
- 问答为主 → 不需要太强推理
推荐: Qwen2.5-7B INT4 + Ollama,MacBook M1/M2 统一内存即可跑
案例五:大厂做复杂Agent系统
需求: 多步推理、工具调用、多轮对话、高并发
分析:
- 推理强 → DeepSeek-R1
- 工具调用 → Qwen
- 高并发 → MoE 架构
推荐: Qwen2.5-72B 做主力对话 + DeepSeek-R1 做复杂推理,API 路由分发
16.12 模型版本管理注意事项
不要盲目追最新
开源模型更新很快,但不是每个版本都值得升级:
- 大版本更新(如 Qwen2 → Qwen2.5):通常有显著提升,值得升级
- 小版本更新(如 Qwen2.5-7B-Instruct → Qwen2.5-7B-Instruct-v2):改进有限,评估后再决定
- 新模型发布:先看基准测试,再看社区反馈,别急着上线
版本锁定建议
生产环境建议锁定具体版本号,而不是用 latest:
python
# ❌ 不要这样
model_name = "Qwen/Qwen2.5-7B-Instruct" # 可能指向最新版
# ✅ 应该这样
model_name = "Qwen/Qwen2.5-7B-Instruct:v2.0.0" # 锁定版本
微调模型的版本管理
如果你在开源模型上做了微调,记录好:
基础模型: Qwen2.5-7B-Instruct (commit: abc123)
微调方法: LoRA (rank=8, alpha=16)
训练数据: dataset_v3.json (5000条)
训练参数: lr=2e-4, epochs=3, batch_size=32
这样出问题时能快速回滚。
16.13 闭源API选型补充
虽然本章重点是开源模型,但如果你决定用闭源 API,这里也有一个快速选型指南:
| API | 优势 | 劣势 | 价格(输入/输出/百万Token) |
|---|---|---|---|
| GPT-4o | 综合最强,多模态 | 贵,有审查 | 2.5/10 |
| Claude 3.5 Sonnet | 写作/代码强,长文本好 | 限制多 | 3/15 |
| Gemini 1.5 Pro | 超长上下文(2M),多模态 | 中文一般 | 1.25/5 |
| DeepSeek V3 API | 最便宜,效果好 | 偶尔不稳定 | ¥1/¥2 |
| Qwen Plus API | 中文好,便宜 | 复杂推理稍弱 | ¥0.8/¥2 |
| 智谱GLM-4 API | 均衡,MIT商用 | 生态小 | ¥0.1/¥0.1(turbo) |
闭源 API 选型建议:
- 预算充足要最好效果 → GPT-4o 或 Claude 3.5
- 中文为主预算有限 → DeepSeek V3 或 Qwen Plus
- 需要超长上下文 → Gemini 1.5 Pro
- 需要最便宜 → DeepSeek V3 或 GLM-4 Turbo
16.14 本章小结
核心选型原则
| 原则 | 说明 |
|---|---|
| 中文优先选 Qwen | 中文场景 Qwen 没有对手 |
| 英文优先选 LLaMA | 英文场景 LLaMA 生态和效果最好 |
| 推理优先选 DeepSeek | R1 推理能力突出 |
| 商用无限制选 GLM/DeepSeek | MIT 协议最友好 |
| 小设备选 Qwen 小尺寸 | 0.5B-3B 系列覆盖边缘设备 |
| Agent 开发选 Qwen | Function Call 支持最好 |
| 预算有限选 DeepSeek API | 性价比碾压级 |
2024年开源模型格局一句话
Qwen 是中文王者,LLaMA 是英文霸主,DeepSeek 是性价比之王,GLM 是商用最省心。 四家各有优势,没有"最好的模型",只有"最适合你场景的模型"。
重要提醒
- 别只看排行榜:排行榜上的分数和实际业务效果可能有差距,一定要用自己的业务数据测试
- 别追求最大:72B 不一定比 7B 好多少,但成本差 10 倍。先从 7B 开始,不够再升级
- 别忽视部署成本:模型免费,但 GPU 要钱。算总账:硬件电费 + 运维人力 + 微调成本
- 别锁定一家:建议准备 2 个模型做主备,主力挂了能切换
- 定期重新评估:开源模型迭代很快,半年前的最优选可能已经不是最优了
下一步
选好了模型,下一章讲 Prompt 工程------同样的模型,问法不同效果天差地别。怎么写好 Prompt,是大模型应用开发的基本功。
延伸阅读:
- Qwen 技术报告:Qwen2.5 Technical Report (Alibaba, 2024)
- LLaMA 技术报告:The Llama 3 Herd of Models (Meta, 2024)
- DeepSeek 技术报告:DeepSeek-V3 Technical Report (2024)
- 开源大模型排行榜:Hugging Face Open LLM Leaderboard
- 中文大模型评测:SuperCLUE、C-Eval、CMMLU