大语言模型面试和题解,梳理中国主流开源 LLM 系列的发展脉络、技术路线与工程取舍

题干

  1. 中国开源 LLM 的几个代表性系列各自的历史脉络?
  2. ChatGLM 系列的 GLM 架构有什么独特之处?
  3. Qwen 系列的训练数据策略与工程取舍?
  4. DeepSeek V2/V3 引领的 MLA / MoE / FP8 路线具体做了什么?
  5. Yi / Baichuan / InternLM / MiniMax 等其它系列的差异化?
  6. 国际主流 (LLaMA / Mistral / Gemma) 的差异是什么?

题解

1. 中国开源 LLM 主要玩家

text 复制代码
- ChatGLM (智谱, THUDM)        → GLM 架构, 中英双语
- Qwen (Alibaba, 通义千问)     → 大而全, 多 size, 长上下文
- DeepSeek (深度求索)          → MoE + MLA + FP8 + R1
- Yi (零一万物)                → 高质量中英, 中等尺寸
- Baichuan (百川)              → 工程优化 + 开源集中
- InternLM (上海 AI Lab)       → 工具调用 / 长上下文
- MiniMax (MiniMax)            → 多模态 / 长上下文
- Hunyuan (腾讯)               → MoE + 图像 / 视频统一

2. ChatGLM / GLM 架构回顾

GLM (General Language Model) 关键:

text 复制代码
- Prefix LM / 自回归填空混合: 输入是 mask span, 输出填补
- 后来 ChatGLM (1/2/3/4) 转向 decoder-only 标准 Transformer
- GLM-4 系列 multi-lingual, 9B/32B/130B 较均衡

特点:

text 复制代码
- 中文为主的混合语料训练
- GLM-4-Air / GLM-4-Flash: 极小尺寸 (< 10B)
- GLM-4-Plus: 大尺寸, 闭源扩展
- 重视 Agent / Function Call 能力
- 多轮工具调用、Code Interpreter 集成

3. Qwen (通义千问)

时间线
text 复制代码
2023.04  Qwen-7B      (LLaMA-like decoder)
2023.09  Qwen-1.5     (MoE, 72B/110B)
2023.11  Qwen-1.5-110B
2024.06  Qwen2         (multi-size, GQA)
2024.11  Qwen2.5       (data scaling, expand)
2025.04  Qwen3         (MoE 235B / 30B / dense 8B)
技术特色
text 复制代码
- GQA + YARN + 大词表 152k
- 训练数据: 多语种 → 高质量中英 + 代码 + 数学
- Code / Math 任务特别出色
- 1.5B ~ 110B 多种 size
- 文档与 HF 生态兼容好

工程:

text 复制代码
- Qwen2.5-VL: 视觉版本
- Qwen2-Audio: 语音 + 多模态
- Qwen-Agent: 内置工具 / planning

4. DeepSeek (深度求索)

最"卷"的中国开源代表:

text 复制代码
DeepSeek-V1 (2024.01): 67B dense, 2 epochs pretrain → MoE 8x7B
DeepSeek-V2 (2024.05): 236B MoE, MLA (Multi-head Latent Attention)
DeepSeek-V2.5 (2024.09): chat / code 强
DeepSeek-V3 (2024.12): 685B MoE + FP8 + 自研 MoE gate
DeepSeek-R1 (2025.01): V3 base + RL on CoT + distill
DeepSeek-V3.1 / R1.x : 多模态 / thinking budget
关键技术
text 复制代码
MLA: Multi-head Latent Attention
   - KV 投影到 R=64 维 latent
   - cache 只存 latent → 比 MQA 还省
   - 长上下文下 4~10× KV 节省

MoE:  256 expert, top-8 (V3); 自研 shared expert 思路
FP8:  混合精度, 4D 并行 + FP8 通信
Routing:  NoAuxTectic balanced routing (V3)
Training Hacks:  DualPipe, efficient all-to-all
R1:  RL on CoT (GRPO), rule-based reward

工程意义:

text 复制代码
- 把"工程能力"推到极致, 训练 670B MoE 仅 ~6000 张 H800
- 开源策略: V3 / R1 都开源 + 商业可用
- 推动 DeepSeek-Math / DeepSeek-Coder / DeepSeek-VL 等专项模型

5. Yi (零一万物)

text 复制代码
- Yi-6B / Yi-34B (2024.01) - 中英双语, 内容质量高
- Yi-Lightning:  闭源旗舰, 速度提升 3× 
- Yi-VL-6B / Yi-Vision: 视觉版

特点:

text 复制代码
- 大规模中英训练语料, "聊天质量"测评靠前
- Yi-34B 用 200k context 时效果佳
- 路线偏 "高质量 chat" 而非 extreme 推理

6. Baichuan (百川)

text 复制代码
- Baichuan-7B / 13B (2023): 早期开源 7B/13B, 中英
- Baichuan2-7B / 13B: 改进数据, 增加商业可用许可
- Baichuan3: 文档未充分开源
- 重点: 开源策略最宽松 (商用免费, 但限制不能用于再训练 base)

7. InternLM (上海 AI Lab + 商汤)

text 复制代码
InternLM-7B (2023)
   → InternLM2 (7B / 20B)
   → InternLM2.5
   → InternLM3 / InternLM-XComposer (多模态)

特点:

text 复制代码
- 长上下文 + 工具调用能力
- InternLM-Chat / InternLM-Math / InternLM-VL 多产品
- 与 OpenXLab 生态整合, 强调"工具和 Agent"

8. MiniMax 等其它

text 复制代码
- MiniMax-7B / abab 系列: 长上下文 + 强多语
- Hunyuan (腾讯): MoE + Turbo + Turbo-Vision
- Doubao / ERNIE / 混元: 字节/百度/腾讯大厂
- 文心 X1 / 4.0 Turbo (百度)
- 豆包 / 混元 多模态 (字节 / 腾讯)

9. 中国 LLM 共同特点

text 复制代码
1. 多语种 (中英为主, 多支持日韩)
2. MoE 普及 (DeepSeek / Qwen-Moe / Hunyuan)
3. 多模态集成度高 (视觉 / 视频 / 语音)
4. 工具 / Agent 强化 (function call, MCP)
5. R1-style reasoning 快速跟进
6. 量化 / 部署 / 端侧生态活跃 (LMDeploy, xFasterTransformer)

10. 中国与海外开源对比

维度 中国开源 (Qwen / DeepSeek / GLM) 海外开源 (LLaMA / Mistral / Gemma / Phi)
中文质量 优秀 一般 (除 Gemma 中文增强版)
推理 (math) DeepSeek-R1 / Qwen-QwQ 强 Phi-4, o1-style 紧跟
MoE 路线 大力投入 (DeepSeek / Hunyuan) Mixtral / DBRX
视频 / 语音 多模态整合快 分头发展
部署生态 LMDeploy / vLLM-Chinese vLLM / sglang / tgi
训练任务数据 国内中文网页 / 公众号 / 知乎 Wikipedia / Book / CommonCrawl

11. 工程经验

text 复制代码
选型:
  - 通用 LLM (中文好 + 强):  Qwen2.5 / DeepSeek-V3 / GLM-4
  - 推理 (数学 / 代码): DeepSeek-R1 / QwQ / Qwen3-Thinking
  - 长上下文:             Qwen2.5-1M / GLM-4-Long / InternLM2.5 长上下文
  - 多模态:               Qwen2.5-VL / GLM-4V / Hunyuan-Vision
  - 端侧小尺寸:           Qwen2.5-0.5B/1.5B / MiniMax-7B-INT4
  - 可商用 (宽松许可):   DeepSeek / Baichuan (注意商用许可差异)

12. 国产硬件 (Ascend / Iluvatar / Cambricon)

text 复制代码
- DeepSeek 等系列对国产硬件支持在演进
- 训练时仍大多依赖 NVIDIA / H100 / H800
- 端侧 / 推理侧:国产 NPU + 量化栈活跃

13. 趋势

text 复制代码
- MoE + R1-style RL 工程: DeepSeek 引领
- 端侧 (1B ~ 3B) 高质量: Qwen / GLM 持续优化
- 多模态、视频、机器人融合
- 推理 / Agent / RAG / Tool Use 综合发展
- 国产训练框架 (MindSpore / Paddle / OneFlow) 在算子 / 通信上的进展

代码示例

python 复制代码
# 选择 Qwen / DeepSeek 在 HuggingFace 上加载示例
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Qwen/Qwen2.5-7B-Instruct"

tok   = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
    attn_implementation="flash_attention_2",
)

messages = [
    {"role": "system", "content": "你是一个助手"},
    {"role": "user",   "content": "你好, 介绍一下你自己"},
]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
ids  = tok(text, return_tensors="pt").to(model.device)

out  = model.generate(**ids, max_new_tokens=256, temperature=0.7, top_p=0.9)
print(tok.decode(out[0], skip_special_tokens=True))
python 复制代码
# DeepSeek-R1 风格输出示例 (含 <think> 标签)
text = """
下面是用户的提问。
<|User|>: 解方程 x^2 - 5x + 6 = 0

<|Assistant|>: 
<think>
    先判断能否因式分解: x^2 - 5x + 6 = (x-2)(x-3)
    所以 x = 2 或 x = 3。
</think>
方程可以分解为 (x-2)(x-3)=0,所以解为 x = 2 与 x = 3。
<|end▁of▁sentence|>
"""

面试延伸

  • MLAGQA 在 KV cache 节省上各能压多少?
  • DeepSeek-V3 训练 cost 与同规模稠密模型在 FLOPs 量级上的对比?
  • 中国系列为何 MoE 而海外更 Dense?背后商业考量有什么不同?
  • 端侧部署 1B 模型:Qwen2.5-1.5B vs. Phi-4-mini vs. MiniMax-3B 的差异?
相关推荐
墨林陌1 小时前
AI 热点日报(2026-09-20):谷歌Gemini首次越狱入侵三家公司,阶跃星辰发布6000亿参数Step 5
人工智能
赵广陆1 小时前
Cline与Cherry Studio中配置MCP Server
人工智能
邵奈一1 小时前
【紧急处理ZCode事件】ZCode 工作区快照静默上传:检测方法与三层防护实践
人工智能·学习·大模型·国产
烟雨江南7851 小时前
会议语音识别私有化部署方案:音频不出内网,如何接入现有会议系统
人工智能·websocket·音视频·语音识别·ai客服
hzxxxz1 小时前
从 2.4T 到 284B:模型变小之后,企业 AI 投入的 3 笔账
人工智能
4SAPI1 小时前
大模型 API 聚合平台选型指南:企业与个人用户的接入架构、稳定性与成本评估
人工智能·php·agent
我不会起名字3221 小时前
一天一道力扣Hot100(36):深度优先算法---组合总和
数据结构·c++·后端·python·算法·go
小K讲AI营销1 小时前
AI基础设施融资路径的中美比较:资本市场模式与政策金融模式
大数据·数据库·人工智能
bmxy小明同学1 小时前
2026-09-19-多模态看懂PDF
人工智能