题干
- 中国开源 LLM 的几个代表性系列各自的历史脉络?
- ChatGLM 系列的 GLM 架构有什么独特之处?
- Qwen 系列的训练数据策略与工程取舍?
- DeepSeek V2/V3 引领的 MLA / MoE / FP8 路线具体做了什么?
- Yi / Baichuan / InternLM / MiniMax 等其它系列的差异化?
- 国际主流 (LLaMA / Mistral / Gemma) 的差异是什么?
题解
1. 中国开源 LLM 主要玩家
text
- ChatGLM (智谱, THUDM) → GLM 架构, 中英双语
- Qwen (Alibaba, 通义千问) → 大而全, 多 size, 长上下文
- DeepSeek (深度求索) → MoE + MLA + FP8 + R1
- Yi (零一万物) → 高质量中英, 中等尺寸
- Baichuan (百川) → 工程优化 + 开源集中
- InternLM (上海 AI Lab) → 工具调用 / 长上下文
- MiniMax (MiniMax) → 多模态 / 长上下文
- Hunyuan (腾讯) → MoE + 图像 / 视频统一
2. ChatGLM / GLM 架构回顾
GLM (General Language Model) 关键:
text
- Prefix LM / 自回归填空混合: 输入是 mask span, 输出填补
- 后来 ChatGLM (1/2/3/4) 转向 decoder-only 标准 Transformer
- GLM-4 系列 multi-lingual, 9B/32B/130B 较均衡
特点:
text
- 中文为主的混合语料训练
- GLM-4-Air / GLM-4-Flash: 极小尺寸 (< 10B)
- GLM-4-Plus: 大尺寸, 闭源扩展
- 重视 Agent / Function Call 能力
- 多轮工具调用、Code Interpreter 集成
3. Qwen (通义千问)
时间线
text
2023.04 Qwen-7B (LLaMA-like decoder)
2023.09 Qwen-1.5 (MoE, 72B/110B)
2023.11 Qwen-1.5-110B
2024.06 Qwen2 (multi-size, GQA)
2024.11 Qwen2.5 (data scaling, expand)
2025.04 Qwen3 (MoE 235B / 30B / dense 8B)
技术特色
text
- GQA + YARN + 大词表 152k
- 训练数据: 多语种 → 高质量中英 + 代码 + 数学
- Code / Math 任务特别出色
- 1.5B ~ 110B 多种 size
- 文档与 HF 生态兼容好
工程:
text
- Qwen2.5-VL: 视觉版本
- Qwen2-Audio: 语音 + 多模态
- Qwen-Agent: 内置工具 / planning
4. DeepSeek (深度求索)
最"卷"的中国开源代表:
text
DeepSeek-V1 (2024.01): 67B dense, 2 epochs pretrain → MoE 8x7B
DeepSeek-V2 (2024.05): 236B MoE, MLA (Multi-head Latent Attention)
DeepSeek-V2.5 (2024.09): chat / code 强
DeepSeek-V3 (2024.12): 685B MoE + FP8 + 自研 MoE gate
DeepSeek-R1 (2025.01): V3 base + RL on CoT + distill
DeepSeek-V3.1 / R1.x : 多模态 / thinking budget
关键技术
text
MLA: Multi-head Latent Attention
- KV 投影到 R=64 维 latent
- cache 只存 latent → 比 MQA 还省
- 长上下文下 4~10× KV 节省
MoE: 256 expert, top-8 (V3); 自研 shared expert 思路
FP8: 混合精度, 4D 并行 + FP8 通信
Routing: NoAuxTectic balanced routing (V3)
Training Hacks: DualPipe, efficient all-to-all
R1: RL on CoT (GRPO), rule-based reward
工程意义:
text
- 把"工程能力"推到极致, 训练 670B MoE 仅 ~6000 张 H800
- 开源策略: V3 / R1 都开源 + 商业可用
- 推动 DeepSeek-Math / DeepSeek-Coder / DeepSeek-VL 等专项模型
5. Yi (零一万物)
text
- Yi-6B / Yi-34B (2024.01) - 中英双语, 内容质量高
- Yi-Lightning: 闭源旗舰, 速度提升 3×
- Yi-VL-6B / Yi-Vision: 视觉版
特点:
text
- 大规模中英训练语料, "聊天质量"测评靠前
- Yi-34B 用 200k context 时效果佳
- 路线偏 "高质量 chat" 而非 extreme 推理
6. Baichuan (百川)
text
- Baichuan-7B / 13B (2023): 早期开源 7B/13B, 中英
- Baichuan2-7B / 13B: 改进数据, 增加商业可用许可
- Baichuan3: 文档未充分开源
- 重点: 开源策略最宽松 (商用免费, 但限制不能用于再训练 base)
7. InternLM (上海 AI Lab + 商汤)
text
InternLM-7B (2023)
→ InternLM2 (7B / 20B)
→ InternLM2.5
→ InternLM3 / InternLM-XComposer (多模态)
特点:
text
- 长上下文 + 工具调用能力
- InternLM-Chat / InternLM-Math / InternLM-VL 多产品
- 与 OpenXLab 生态整合, 强调"工具和 Agent"
8. MiniMax 等其它
text
- MiniMax-7B / abab 系列: 长上下文 + 强多语
- Hunyuan (腾讯): MoE + Turbo + Turbo-Vision
- Doubao / ERNIE / 混元: 字节/百度/腾讯大厂
- 文心 X1 / 4.0 Turbo (百度)
- 豆包 / 混元 多模态 (字节 / 腾讯)
9. 中国 LLM 共同特点
text
1. 多语种 (中英为主, 多支持日韩)
2. MoE 普及 (DeepSeek / Qwen-Moe / Hunyuan)
3. 多模态集成度高 (视觉 / 视频 / 语音)
4. 工具 / Agent 强化 (function call, MCP)
5. R1-style reasoning 快速跟进
6. 量化 / 部署 / 端侧生态活跃 (LMDeploy, xFasterTransformer)
10. 中国与海外开源对比
| 维度 | 中国开源 (Qwen / DeepSeek / GLM) | 海外开源 (LLaMA / Mistral / Gemma / Phi) |
|---|---|---|
| 中文质量 | 优秀 | 一般 (除 Gemma 中文增强版) |
| 推理 (math) | DeepSeek-R1 / Qwen-QwQ 强 | Phi-4, o1-style 紧跟 |
| MoE 路线 | 大力投入 (DeepSeek / Hunyuan) | Mixtral / DBRX |
| 视频 / 语音 | 多模态整合快 | 分头发展 |
| 部署生态 | LMDeploy / vLLM-Chinese | vLLM / sglang / tgi |
| 训练任务数据 | 国内中文网页 / 公众号 / 知乎 | Wikipedia / Book / CommonCrawl |
11. 工程经验
text
选型:
- 通用 LLM (中文好 + 强): Qwen2.5 / DeepSeek-V3 / GLM-4
- 推理 (数学 / 代码): DeepSeek-R1 / QwQ / Qwen3-Thinking
- 长上下文: Qwen2.5-1M / GLM-4-Long / InternLM2.5 长上下文
- 多模态: Qwen2.5-VL / GLM-4V / Hunyuan-Vision
- 端侧小尺寸: Qwen2.5-0.5B/1.5B / MiniMax-7B-INT4
- 可商用 (宽松许可): DeepSeek / Baichuan (注意商用许可差异)
12. 国产硬件 (Ascend / Iluvatar / Cambricon)
text
- DeepSeek 等系列对国产硬件支持在演进
- 训练时仍大多依赖 NVIDIA / H100 / H800
- 端侧 / 推理侧:国产 NPU + 量化栈活跃
13. 趋势
text
- MoE + R1-style RL 工程: DeepSeek 引领
- 端侧 (1B ~ 3B) 高质量: Qwen / GLM 持续优化
- 多模态、视频、机器人融合
- 推理 / Agent / RAG / Tool Use 综合发展
- 国产训练框架 (MindSpore / Paddle / OneFlow) 在算子 / 通信上的进展
代码示例
python
# 选择 Qwen / DeepSeek 在 HuggingFace 上加载示例
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "Qwen/Qwen2.5-7B-Instruct"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto",
attn_implementation="flash_attention_2",
)
messages = [
{"role": "system", "content": "你是一个助手"},
{"role": "user", "content": "你好, 介绍一下你自己"},
]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
ids = tok(text, return_tensors="pt").to(model.device)
out = model.generate(**ids, max_new_tokens=256, temperature=0.7, top_p=0.9)
print(tok.decode(out[0], skip_special_tokens=True))
python
# DeepSeek-R1 风格输出示例 (含 <think> 标签)
text = """
下面是用户的提问。
<|User|>: 解方程 x^2 - 5x + 6 = 0
<|Assistant|>:
<think>
先判断能否因式分解: x^2 - 5x + 6 = (x-2)(x-3)
所以 x = 2 或 x = 3。
</think>
方程可以分解为 (x-2)(x-3)=0,所以解为 x = 2 与 x = 3。
<|end▁of▁sentence|>
"""
面试延伸
- MLA 与 GQA 在 KV cache 节省上各能压多少?
- DeepSeek-V3 训练 cost 与同规模稠密模型在 FLOPs 量级上的对比?
- 中国系列为何多 MoE 而海外更多 Dense?背后商业考量有什么不同?
- 端侧部署 1B 模型:Qwen2.5-1.5B vs. Phi-4-mini vs. MiniMax-3B 的差异?