大模型介绍
简介
大模型指参数规模巨大、基于深度神经网络构建的人工智能模型。主要有语言模型,图像视频模型,语音模型,多模态模型(可以同时处理文本图像语音等)。本文主要描述大语言模型,即LLM(Large Language Model)。LLM大语言模型主要使用Transformer架构,在海量文本数据上进行训练,可以理解和生成自然语言。
LLM本质是有一个词表,其中的每个词叫做token,用向量的形式表示,向量之间的关系就是词之间的关系(注意力权重)。将输入的文本编码为高维向量,通过深度神经网络找到上下文关系,最终通过预测下一个词的概率来生成文本。
能力
虽然仅仅是通过预测和生成文本,但是得益于算法和海量数据所带来的能力,大语言模型可以做到:
- 理解和推理,实现数学运算,逻辑证明等
- 生成和创作各种类型的文章,论文,诗歌等
- 理解文案内容再翻译
- 编程,表格等能力,可以理解和输出特殊格式的文字
通过在Agent等外部工具中使用,可以扩展大模型的能力,使得大模型具有浏览网页,读取编辑文件,执行命令等功能。实际上还是通过文本来实现。下面是简化的调用流程,实际很多场景要更复杂。
- Agent通过提示词告诉大模型有xx能力,可以通过xx指令调用(指令也是文本)
- 大模型在适当时机输出指令,告诉Agent调用xx能力。
- Agent调用能力,并返回结果给大模型。
- 例如访问网页,实际上是Agent访问网页,将网页内容返回给大模型解析。

多轮对话能力:大模型本质上是不能记住信息的,每次用户输入的文本,它都当做是一次全新的对话来回答。那么大模型是如何实现多轮对话的能力呢?也需要外部工具的帮助。工具将每轮对话的问题和回答记录下来,当用户问问题时,工具将前面的问题和回答也都提供给大模型,组成一串很长的文本。这样大模型可以看到之前的对话,也就可以理解上下文并做出相应回答了。
分类和厂商
大模型的分类有很多类型,这里一一列举下:
- 以模态分类
- 语言模型:仅支持文本的理解和生成
- 多模态模型:除文本外,还支持图片或视频或声音等的理解或生成
- 图片生成模型:文生图/图生图模型
- 视频生成模型:文生视频/图生视频/视频生视频等模型
- 全模态模型:支持文本/图片/视频/声音等全部模态的理解和生成
- 以参数激活模式分类
- 稠密模型:每次处理时所有参数都参与运算
- 稀疏模型:处理时仅部分参数参与运算
- 混合专家模型(MoE):稀疏模型中的主流用法,模型中包含很多专家子网络。每次处理时仅部分专家参与运算
- 以开源分类
- 闭源模型:模型所有内容都不公开
- 开放权重模型:公开模型训练后的权重文件,使用者可以自行部署调用模型
其中开放权重模型更像是将模型做完后的成果开源,并不是开放模型的训练代码本身。用户下载了权重文件后,只能自己部署和调用。有些厂商还会开放训练方法和代码,但由于需要性能非常强大的服务器,以及需要海量的数据,复现一个类似模型是非常困难的。
世界范围内有很多厂商在开发大模型,其中以美国和中国为主。这里列举了部分排名前列的模型厂商。
| 国家 | 厂商名字 | 模型系列 | 大模型为主业 |
|---|---|---|---|
| 美国 | OpenAI | GPT | 是 |
| 美国 | Anthropic | Claude | 是 |
| 美国 | Gemini | 否 | |
| 美国 | xAI(SpaceX) | Grok | 否 |
| 中国 | 深度求索 | DeepSeek | 是 |
| 中国 | 月之暗面 | Kimi | 是 |
| 中国 | 阿里巴巴 | Qwen千问 | 否 |
| 中国 | 智谱 | GLM | 是 |
| 中国 | 字节跳动 | Seed(豆包, Seedance, Seedream) | 否 |
| 中国 | 稀宇科技 | MiniMax | 是 |
| 中国 | 小米 | MiMo | 否 |
| 中国 | 美团 | LongCat龙猫 | 否 |
参数和推理流程
重要参数
市场上的大模型在描述中都提供了一些参数值,例如参数量,上下文长度,数值编码精度等,这里简单解释一下这些参数的含义。
| 参数 | 含义 | 举例 |
|---|---|---|
| 参数量 | 模型一共可以调节的参数数量,B表示Billion,即十亿 | 70B 200B 2T |
| 上下文长度 | 一次输入+输出的所有token总数 | 128K 1M |
| 数值编码精度 | 每个参数的编码规范和存储位数(整数/浮点数,4位/8位/16位等) | FP16 INT8 MXFP4 |
| 层数 | Transformer层的数量,数据会一次经过每一层处理 | 80层 100层 |
| 词表 | 字/词与token编码的对应关系表 | "你好" "hi" |
| 向量维度 | 每个token对应的特征向量的维度(长度),每个维度代表一种语义 | 1024维 5120维 |
其中上下文长度虽然指的是"一次输入+输出的"token总数,但要注意前面提到过大模型没有记忆功能,我们提到的前面的问题和回答是会随着新问题一起发送给大模型的。因此多轮对话越长,每次发给大模型的token越多,当多轮对话中的所有token加起来超过token总数时,也就超过了上下文长度。
为了简单起见,这里和后续我们都选择Qwen3-0.6B为例来描述。这是一个开放权重模型,参数量级比较小的稠密语言模型。这个模型在大部分普通电脑中都能运行起来,非常适合作为学习使用。这里首先看一下它的参数值:
| 参数 | 值 |
|---|---|
| 参数量 | 0.6B |
| 上下文长度 | 32K |
| 数值编码精度 | BF16 |
| 层数 | 28层 |
| 词表 | 151936(支持上百种语言) |
| 向量维度 | 1024维 |
模型推理流程
大模型分为训练和推理两个过程。简单理解下,训练可以看作是创造这个模型的过程;推理则是使用创建好的模型,让它回答问题的过程。这里我们顺着前面的介绍,使用Qwen3-0.6B为例,简要描述一下模型的推理流程。

- 首先用户输入问题文本。被分词器切分成token序列。分词器切分和转换token是按照预设的词表进行。
- 每个token被转换为对应的向量,每个向量是1024维。token序列就变成了向量序列。
- 将向量序列输入进第一层网络中,开始计算。
- 第一层网络得到的结果被输入第二层网络计算,输出再依次通过后续网络,直到第28层。
- 使用结果预测得到一个新的token,放入前面的token序列中作为最后一个元素。
- 重复第2到5个步骤,直到生成结束。
- 将token序列转换回文本,输出给用户。
通过上面的流程描述,我们可以看到几个关键点:
- 将文本转换为数据的方式是分词器和token,最终在模型计算中以向量表示
- 模型每次只能预测一个词,再预测下一个词时,需要重新通过所有层计算
- 每一层都会将之前计算过的向量结果缓存下来,只有预测的新词需要重新计算,避免重复计算消耗性能
参数量组成
前面了解模型推理过程之后,有些同学心中会有一个问题,即为什么模型的数据量这么大。这里我们将0.6B的参数量拆开,看看究竟是怎么组成的。
- 词嵌入 即每个token对应的初始向量,词表中的每个词都有初始向量。即 151,936 × 1,024 = 155,582,464
- 单个Transformer层中,Q/K/V/O投影矩阵分别为 1024 × 1024 × 2 + 1024 × 2048 × 2 = 6,291,456
- 单个Transformer层中,前馈网络的参数为 1024 × 3072 × 3 = 9,437,184
- 每层的参数量为 9,437,184 + 6,291,456 = 15,728,640 (省略了部分很少的参数)
- 所有层的参数总量为 15,728,640 × 28 = 440,401,920
- 模型总参数为 155,582,464 + 440,401,920 = 595,984,384 ≈ 596M = 0.6B

从模型参数量的拆解中,可以看到影响模型参数量大小的最重要的几个点:词表大小,向量维度,层数。还有每层的结构也会影响,但这篇文章中并不讨论模型结构细节。尤其是向量维度的增长对模型参数量大小的影响是平方级别的。
例如我们将向量维度*5 = 5120,层数变为64层,提升之后正是Qwen3-32B的参数。那么模型Transformer层的数据量可以简单推算为 0.44B * 5^2 * 64 / 28 ≈ 25B。模型中部分参数量并不严格按照平方计算,因此和实际参数量有差距,但大致是符合参数量级的。
训练和GPU
训练方式
训练是创造大模型的过程,其中主要分为两个步骤:先进行预训练,再进行后训练。预训练是使用巨量的各种领域的文本来让模型学习语言和知识。这一阶段数据量非常大,计算量也很高。预训练结束后,词嵌入(即每个token对应的初始向量)和所有层的参数值都已经填充完成了,理论上来说,它已经是一个成型的模型格式和数据了。但是它只会续写文本,基本无法正常对话。
后训练是对预训练后的参数进行调整。它接收问题答案成对格式的数据,通过学习学会对话问答的形式以及指令形式,也就是SFT。还有其它强化学习等也可以调整参数。
GPU参数
大模型的训练和推理放到GPU中进行,因此需要GPU的算力进行计算,GPU中的显存(即GPU内存)用来存放模型本身和训练数据。CPU和内存也能进行计算,但由于原理不同,计算速度非常慢。这里首先介绍一下GPU中的部分参数含义和概念:
- 计算能力 表示GPU计算能力的数值,注意同一个GPU,不同精度数字的运算能力不同,例如FP32, FP16等,精度越小计算能力越强。
- FLOPS 每秒浮点数的运算次数
- TFLOPS 每秒10^12次运算 PFLOPS 每秒10^15次运算
- 显存类型 在内存芯片设计上的区别
- GDDR 普通家用显存
- HBM 使用3D堆叠技术,高性能计算卡使用 HBM3e > HBM3
- 显存带宽 GPU计算核心和显存之间的数据传输速度
大模型的GPU要求
如何判断大模型需要的GPU要求呢?这里我们根据大模型参数量,给出一个粗略的计算公式,注意这里仅适用于稠密模型。首先是计算能力需求。其中训练token数量采用Qwen3的预训练36T,后训练一般没有这么多。推理token数量采用每秒30个token。
- 训练(预训练后训练类似) 6 * 模型参数量 * 训练token数量
- 以Qwen3-0.6B为例 6 * 0.6B * 36T ≈ 1.3 × 10^23 FLOP = 1.3 × 10^11 TFLOPS
- 以Qwen3-32B为例 6 * 32B * 36T ≈ 6.9 × 10^25 FLOP = 6.9 × 10^13 TFLOPS
- 推理 2 * 模型参数量 * token数量
- 以Qwen3-0.6B为例 2 * 0.6B * 30 ≈ 3.6 × 10^10 FLOPs = 0.036 TFLOPS
- 以Qwen3-32B为例 2 * 32B * 30 ≈ 1.9 × 10^12 FLOPs = 1.9 TFLOPS
可以看到,训练和推理所需的计算性能相差很大。然后再看下对于显存的要求。注意显存要求是和模型数值精度位数有直接关系的,例如16位相比8位,显存需求一般要大一倍。下面的公式中我们以BF16,即16位两字节来计算。
- 训练(预训练后训练类似) 8 * 模型参数量 * 2
- 以Qwen3-0.6B为例 8 * 0.6B * 2 ≈ 9.6 × 10^9 字节 = 9.6GB
- 以Qwen3-32B为例 8 * 32B * 2 ≈ 5.12 × 10^11 字节 = 512GB
- 推理 显存主要分为两部分:模型参数量 * 2 + KV Cache
- 加载模型本身 模型参数量 * 2
- KV Cache 即前面推理流程中提到的 每层都会将之前计算过的向量结果缓存下来
- 输入的上下文大小越长,缓存越大
- 一个token的缓存大小,大小与模型结构和层数有关
- 以Qwen3-0.6B为例 1token的KV Cache缓存约为 4KB * 28层 = 112KB
- 上下文1K时 0.6B * 2 + 1K * 112K ≈ 1.2 GB + 112MB ≈ 1.3GB
- 上下文32K时(最大上下文) 0.6B * 2 + 32K * 112K ≈ 1.2 GB + 3.8GB ≈ 5GB
- 以Qwen3-32B为例 1token的KV Cache缓存约为 4KB * 64层 = 256KB
- 上下文1K时 32B * 2 + 1K * 256K ≈ 64 GB + 256 MB ≈ 64GB
- 上下文32K时(最大上下文) 32B * 2 + 32K * 256K ≈ 64GB + 8.6GB ≈ 72.6GB
可以看到对于小模型来说,上下文越大,缓存占用的显存也就越大,甚至远大于模型本身的显存要求。但是模型参数量增大后,缓存增长却没有那么快,在超大模型中缓存的占比就非常小了。另外这是保守估计的计算值,实际上因为一些额外计算,额外程序和数据存储等,计算量和显存使用量都会更大。
另外显存与计算能力不一样的点在于,计算能力即使差一点也可以用,就是运行得慢一点。但显存是个硬指标,如果不符合要求,模型会无法启动,这时候一点工作都不能完成。从这个角度看,训练模型的硬性条件是很高的。
GPU市场
上面了解了模型对于GPU的要求之后,我们来看一下市场上的GPU有哪些,都提供了怎样的性能。这里分为国外GPU和国内GPU分别介绍。首先是国外GPU:
| 国家 | 厂商 | 型号 | BF16稠密算力峰值 | 显存大小 | 显存类型 | 显存带宽 | 发布时间 |
|---|---|---|---|---|---|---|---|
| 美国 | NVIDIA | H100 | 989 TFLOPS | 80GB | HBM3 | 3.4 TB/s | 2022 |
| 美国 | NVIDIA | H200 | 989 TFLOPS | 141GB | HBM3e | 4.9 TB/s | 2024 |
| 美国 | NVIDIA | B200 | 2250 TFLOPS | 192GB | HBM3e | 8 TB/s | 2024 |
| 美国 | NVIDIA | B300 | 3750 TFLOPS | 288GB | HBM3e | 8 TB/s | 2024 |
| 美国 | NVIDIA | H20 (中国特供) | 148 TFLOPS | 96GB | HBM3 | 4 TB/s | 2024 |
| 美国 | AMD | MI300X | 1307 TFLOPS | 192 GB | HBM3 | 5.3 TB/s | 2023 |
| 美国 | AMD | MI325X | 1307 TFLOPS | 256 GB | HBM3e | 6.1 TB/s | 2024 |
| 美国 | AMD | MI350X | 2306 TFLOPS | 288 GB | HBM3e | 8.2 TB/s | 2025 |
| 美国 | AMD | MI355X | 2516 TFLOPS | 288 GB | HBM3e | 8.2 TB/s | 2025 |
有些厂商还提供了整个机柜的全套方案,例如下面列出两个NVIDIA的方案,内部包含72颗GPU芯片,GPU和CPU集成在一起,即B200集成后为GB200,B300集成后为GB300。
| 国家 | 厂商 | 型号 | BF16稠密算力峰值 | 显存大小 |
|---|---|---|---|---|
| 美国 | NVIDIA | GB200 NVL72 | 180000 TFLOPS | 13.4TB |
| 美国 | NVIDIA | GB300 NVL72 | 360000 TFLOPS | 20TB |
除了NVIDIA和AMD之外,Google,Amazon等厂商也在推出GPU,但是市场份额较少。最后列一下家用的顶级显卡5090和常见的苹果M4芯片的参数做对比:
| 国家 | 厂商 | 型号 | BF16稠密算力峰值 | 显存大小 | 显存类型 | 显存带宽 | 发布时间 |
|---|---|---|---|---|---|---|---|
| 美国 | NVIDIA | RTX5090 | 419 TFLOPS | 32GB | GDDR7 | 1.8 TB/s | 2025 |
| 美国 | Apple | M4 | 13 TFLOPS | 使用电脑的统一内存 | LPDDR5X | 120 GB/s | 2024 |
评测
现在基本上每个大模型发布之时,都会附带一些测试分数,还会与其它大模型比较分数高低。这些测试是什么,有什么作用?这里我们以DeepSeek-V4-Pro-0813报告中的部分测试为例,简单看一下这些评测内容。
HLE
HLE(Humanity's Last Exam)翻译为中文叫作"人类最后的测试"。包含2,500个问题,涉及数十个学科,包括数学、人文学科和自然科学。它由全球各领域的专家编写,包含适合自动评分的选择题和简答题。题目和对应翻译举例如下:

Terminal Bench
Terminal Bench是一个评估大模型在Agent中,使用命令行完成任务的测试。其中大部分是计算机编程相关任务,包含编译/调试/运行代码,配置服务,处理数据等。它分为很多个测试版本,例如1.0, 2.0, 2.1, 3.0等。如下图有两个任务,左侧是从源码构建出Linux操作系统内核,右侧是使用git提交代码并启动本地HTTP服务。

NL2Repo
NL2Repo是字节跳动提出的一个评估模型在编程Agent中执行长周期任务性能的测试,这些任务要求从零开始生成一个完整可运行的代码库。测试包含104个不同的任务,每个任务都配有独立的测试环境。test_files目录中包含全部任务数据,每个任务中包含四个文件。
- start.md 任务的需求描述文档
- test_case_count.txt 该任务包含的测试用例总数,通常只是一个数字
- test_commands.json 定义如何运行测试的具体命令行指令
- test_files.json 测试所需的外部数据或文件清单
题目的start.md部分内容和对应翻译举例如下:

CyberGym
CyberGym是用于大规模评估模型在Agent中对真实世界网络安全漏洞实战能力的测试。它包含三种测试形式:
| 测试名称 | 测试内容 | 测试例子数量 |
|---|---|---|
| CyberGym | 漏洞复现 | 1507个漏洞/188个项目 |
| ExploitGym | 利用漏洞攻击 | 869个漏洞 |
| CyberGym-E2E | 漏洞修复 | 920个漏洞/139个项目 |
排行
在大模型发布时,除了前面的评测外,网络上还会有一些排行,表示大模型各种能力的高低,有些排行本身就是用数据评测出的,有些则是单纯的排行榜。
Artificial Analysis
Artificial Analysis是一个大模型排行和分析平台,里面包含了各种各样的排行榜,包括AI智能排行,速度排行,成本排行,图像/视频排行等。它最主要的智能指数(Artificial Analysis Intelligence Index)是由很多种评测得分加权形成的,其中包含外部评测(例如SciCode, GPQA Diamond, 还有前面介绍过的HLE, Terminal-Bench等),也包含一些平台自己的评测。截至文章撰写时排行如下:

Arena
Arena是一个大模型排行平台,里面也包含很多榜单,包括对话榜,Agent榜,前端开发榜等等。这些榜单并不是通过数据评测得分排行,而是通过用户真实的体验感受得出。用户使用AI时,Arena会同时提供两个匿名模型的结果,用户投票选出更好的一方。然后通过Elo评分系统最终得出排名。Elo评分系统是广泛使用的评分机制,像是篮球、乒乓球、围棋、游戏等,都采用这个评分机制对运动员进行排名。例如下面是这个平台的前端代码能力排行:

其它站点
Hugging Face
Hugging Face的中文名叫做抱抱脸,是一个人工智能社区平台。它主要由两部分组成,这两部分的使用者都非常广泛:
- 大模型和数据集的上传/下载/分享平台。目前有超过200万个模型和50万个数据集
- 以Transformers为主的大模型的开源训练推理工具库,可通过少量代码快速实现功能
Hugging Face在国内无法访问,但是有对应的国内镜像站。国内还有一个类似的网站叫做魔搭社区,是阿里创办的大模型平台。
OpenRouter
OpenRouter是一个大模型API聚合平台。在不用OpenRouter时,我们使用哪个大模型,就要去对应厂商的网站中充钱,获取一个单独的API地址和key。如果想体验不同的模型,就比较麻烦。OpenRouter和这些大模型厂商都谈好了合作,我们只需要接入OpenRouter的API,在这里面充值一次,就可以一键切换使用不同的模型。
OpenRouter会公布不同模型在平台的调用数据,因为OpenRouter的访问量比较大,因此这个数据经常被用来比较模型的受欢迎程度,例如这是文章撰写时最近一周的模型调用量排名:

参考
- 魔搭社区
https://www.modelscope.cn/ - 英伟达算力卡全解析:型号规格、算力、采购限制与国内选型指南(2026年8月)
https://www.cnblogs.com/xiaobaiysf/p/22352462 - 2026 算力卡性能 TOP20 排名,FP16/FP8/INT8 算力实测汇总
https://www.iotdt.com/news/xingyezixun/2694.html - TechPowerUp GPU Specs Database
https://www.techpowerup.com/gpu-specs/ - 华为昇腾
https://www.hiascend.com/zh - 【大模型技术落地实践】2 - 国产加速设备选型
https://www.cnblogs.com/lijiext/p/21212508 - 一文看懂华为昇腾芯片
https://zhuanlan.zhihu.com/p/1913660152676094004 - 华为昇腾910B1、B2、B3、B4的差别
https://zhuanlan.zhihu.com/p/1981677289818314114 - 摩尔线程技术文档 MTT S4000
https://docs.mthreads.com/s4000/s4000-doc-online/introduction/ - 昇腾/寒武纪/沐曦/昆仑芯全系列国产算力卡算力排名对比
https://www.iotdt.com/news/xingyezixun/2693.html - 燧原硬件文档中心
https://support.enflame-tech.com/onlinedoc_hw/index.html - 燧原科技的 AI 芯片
https://tieba.baidu.com/p/10371217414 - gitee AI文档 芯片集群与技术支持
https://ai.gitee.com/docs/compute/clusters_gpu/biren_gpu - 信创国测AI卡不同型号分析总结
https://ai6s.net/6a6ffa7610ee7a33f29572c4.html - HLE 项目网站
https://lastexam.ai/ - HLE 数据集查看
https://www.modelscope.cn/datasets/cais/hle - Terminal Bench 项目网站
https://www.tbench.ai/ - GitHub NL2Repo
https://github.com/multimodal-art-projection/NL2RepoBench - CyberGym 项目网站
https://www.cybergym.io/ - GitHub CyberGym
https://github.com/sunblaze-ucb - Artificial Analysis
https://artificialanalysis.ai/ - Arena
https://arena.ai/ - Arena 中文镜像
https://arena.atease.dev/ - Hugging Face
https://huggingface.co/ - Hugging Face 中文镜像
https://hf-mirror.com/ - OpenRouter
https://openrouter.ai/