一文读懂大模型生态:分类/参数/结构/训练/GPU/评测/排行/社区

大模型介绍

简介

大模型指参数规模巨大、基于深度神经网络构建的人工智能模型。主要有语言模型,图像视频模型,语音模型,多模态模型(可以同时处理文本图像语音等)。本文主要描述大语言模型,即LLM(Large Language Model)。LLM大语言模型主要使用Transformer架构,在海量文本数据上进行训练,可以理解和生成自然语言。

LLM本质是有一个词表,其中的每个词叫做token,用向量的形式表示,向量之间的关系就是词之间的关系(注意力权重)。将输入的文本编码为高维向量,通过深度神经网络找到上下文关系,最终通过预测下一个词的概率来生成文本。

能力

虽然仅仅是通过预测和生成文本,但是得益于算法和海量数据所带来的能力,大语言模型可以做到:

  • 理解和推理,实现数学运算,逻辑证明等
  • 生成和创作各种类型的文章,论文,诗歌等
  • 理解文案内容再翻译
  • 编程,表格等能力,可以理解和输出特殊格式的文字

通过在Agent等外部工具中使用,可以扩展大模型的能力,使得大模型具有浏览网页,读取编辑文件,执行命令等功能。实际上还是通过文本来实现。下面是简化的调用流程,实际很多场景要更复杂。

  1. Agent通过提示词告诉大模型有xx能力,可以通过xx指令调用(指令也是文本)
  2. 大模型在适当时机输出指令,告诉Agent调用xx能力。
  3. Agent调用能力,并返回结果给大模型。
  4. 例如访问网页,实际上是Agent访问网页,将网页内容返回给大模型解析。

多轮对话能力:大模型本质上是不能记住信息的,每次用户输入的文本,它都当做是一次全新的对话来回答。那么大模型是如何实现多轮对话的能力呢?也需要外部工具的帮助。工具将每轮对话的问题和回答记录下来,当用户问问题时,工具将前面的问题和回答也都提供给大模型,组成一串很长的文本。这样大模型可以看到之前的对话,也就可以理解上下文并做出相应回答了。

分类和厂商

大模型的分类有很多类型,这里一一列举下:

  • 以模态分类
    • 语言模型:仅支持文本的理解和生成
    • 多模态模型:除文本外,还支持图片或视频或声音等的理解或生成
    • 图片生成模型:文生图/图生图模型
    • 视频生成模型:文生视频/图生视频/视频生视频等模型
    • 全模态模型:支持文本/图片/视频/声音等全部模态的理解和生成
  • 以参数激活模式分类
    • 稠密模型:每次处理时所有参数都参与运算
    • 稀疏模型:处理时仅部分参数参与运算
    • 混合专家模型(MoE):稀疏模型中的主流用法,模型中包含很多专家子网络。每次处理时仅部分专家参与运算
  • 以开源分类
    • 闭源模型:模型所有内容都不公开
    • 开放权重模型:公开模型训练后的权重文件,使用者可以自行部署调用模型

其中开放权重模型更像是将模型做完后的成果开源,并不是开放模型的训练代码本身。用户下载了权重文件后,只能自己部署和调用。有些厂商还会开放训练方法和代码,但由于需要性能非常强大的服务器,以及需要海量的数据,复现一个类似模型是非常困难的。

世界范围内有很多厂商在开发大模型,其中以美国和中国为主。这里列举了部分排名前列的模型厂商。

国家 厂商名字 模型系列 大模型为主业
美国 OpenAI GPT
美国 Anthropic Claude
美国 Google Gemini
美国 xAI(SpaceX) Grok
中国 深度求索 DeepSeek
中国 月之暗面 Kimi
中国 阿里巴巴 Qwen千问
中国 智谱 GLM
中国 字节跳动 Seed(豆包, Seedance, Seedream)
中国 稀宇科技 MiniMax
中国 小米 MiMo
中国 美团 LongCat龙猫

参数和推理流程

重要参数

市场上的大模型在描述中都提供了一些参数值,例如参数量,上下文长度,数值编码精度等,这里简单解释一下这些参数的含义。

参数 含义 举例
参数量 模型一共可以调节的参数数量,B表示Billion,即十亿 70B 200B 2T
上下文长度 一次输入+输出的所有token总数 128K 1M
数值编码精度 每个参数的编码规范和存储位数(整数/浮点数,4位/8位/16位等) FP16 INT8 MXFP4
层数 Transformer层的数量,数据会一次经过每一层处理 80层 100层
词表 字/词与token编码的对应关系表 "你好" "hi"
向量维度 每个token对应的特征向量的维度(长度),每个维度代表一种语义 1024维 5120维

其中上下文长度虽然指的是"一次输入+输出的"token总数,但要注意前面提到过大模型没有记忆功能,我们提到的前面的问题和回答是会随着新问题一起发送给大模型的。因此多轮对话越长,每次发给大模型的token越多,当多轮对话中的所有token加起来超过token总数时,也就超过了上下文长度。

为了简单起见,这里和后续我们都选择Qwen3-0.6B为例来描述。这是一个开放权重模型,参数量级比较小的稠密语言模型。这个模型在大部分普通电脑中都能运行起来,非常适合作为学习使用。这里首先看一下它的参数值:

参数
参数量 0.6B
上下文长度 32K
数值编码精度 BF16
层数 28层
词表 151936(支持上百种语言)
向量维度 1024维

模型推理流程

大模型分为训练和推理两个过程。简单理解下,训练可以看作是创造这个模型的过程;推理则是使用创建好的模型,让它回答问题的过程。这里我们顺着前面的介绍,使用Qwen3-0.6B为例,简要描述一下模型的推理流程。

  1. 首先用户输入问题文本。被分词器切分成token序列。分词器切分和转换token是按照预设的词表进行。
  2. 每个token被转换为对应的向量,每个向量是1024维。token序列就变成了向量序列。
  3. 将向量序列输入进第一层网络中,开始计算。
  4. 第一层网络得到的结果被输入第二层网络计算,输出再依次通过后续网络,直到第28层。
  5. 使用结果预测得到一个新的token,放入前面的token序列中作为最后一个元素。
  6. 重复第2到5个步骤,直到生成结束。
  7. 将token序列转换回文本,输出给用户。

通过上面的流程描述,我们可以看到几个关键点:

  • 将文本转换为数据的方式是分词器和token,最终在模型计算中以向量表示
  • 模型每次只能预测一个词,再预测下一个词时,需要重新通过所有层计算
  • 每一层都会将之前计算过的向量结果缓存下来,只有预测的新词需要重新计算,避免重复计算消耗性能

参数量组成

前面了解模型推理过程之后,有些同学心中会有一个问题,即为什么模型的数据量这么大。这里我们将0.6B的参数量拆开,看看究竟是怎么组成的。

  • 词嵌入 即每个token对应的初始向量,词表中的每个词都有初始向量。即 151,936 × 1,024 = 155,582,464
  • 单个Transformer层中,Q/K/V/O投影矩阵分别为 1024 × 1024 × 2 + 1024 × 2048 × 2 = 6,291,456
  • 单个Transformer层中,前馈网络的参数为 1024 × 3072 × 3 = 9,437,184
  • 每层的参数量为 9,437,184 + 6,291,456 = 15,728,640 (省略了部分很少的参数)
  • 所有层的参数总量为 15,728,640 × 28 = 440,401,920
  • 模型总参数为 155,582,464 + 440,401,920 = 595,984,384 ≈ 596M = 0.6B

从模型参数量的拆解中,可以看到影响模型参数量大小的最重要的几个点:词表大小,向量维度,层数。还有每层的结构也会影响,但这篇文章中并不讨论模型结构细节。尤其是向量维度的增长对模型参数量大小的影响是平方级别的。

例如我们将向量维度*5 = 5120,层数变为64层,提升之后正是Qwen3-32B的参数。那么模型Transformer层的数据量可以简单推算为 0.44B * 5^2 * 64 / 28 ≈ 25B。模型中部分参数量并不严格按照平方计算,因此和实际参数量有差距,但大致是符合参数量级的。

训练和GPU

训练方式

训练是创造大模型的过程,其中主要分为两个步骤:先进行预训练,再进行后训练。预训练是使用巨量的各种领域的文本来让模型学习语言和知识。这一阶段数据量非常大,计算量也很高。预训练结束后,词嵌入(即每个token对应的初始向量)和所有层的参数值都已经填充完成了,理论上来说,它已经是一个成型的模型格式和数据了。但是它只会续写文本,基本无法正常对话。

后训练是对预训练后的参数进行调整。它接收问题答案成对格式的数据,通过学习学会对话问答的形式以及指令形式,也就是SFT。还有其它强化学习等也可以调整参数。

GPU参数

大模型的训练和推理放到GPU中进行,因此需要GPU的算力进行计算,GPU中的显存(即GPU内存)用来存放模型本身和训练数据。CPU和内存也能进行计算,但由于原理不同,计算速度非常慢。这里首先介绍一下GPU中的部分参数含义和概念:

  • 计算能力 表示GPU计算能力的数值,注意同一个GPU,不同精度数字的运算能力不同,例如FP32, FP16等,精度越小计算能力越强。
    • FLOPS 每秒浮点数的运算次数
    • TFLOPS 每秒10^12次运算 PFLOPS 每秒10^15次运算
  • 显存类型 在内存芯片设计上的区别
    • GDDR 普通家用显存
    • HBM 使用3D堆叠技术,高性能计算卡使用 HBM3e > HBM3
  • 显存带宽 GPU计算核心和显存之间的数据传输速度

大模型的GPU要求

如何判断大模型需要的GPU要求呢?这里我们根据大模型参数量,给出一个粗略的计算公式,注意这里仅适用于稠密模型。首先是计算能力需求。其中训练token数量采用Qwen3的预训练36T,后训练一般没有这么多。推理token数量采用每秒30个token。

  • 训练(预训练后训练类似) 6 * 模型参数量 * 训练token数量
    • 以Qwen3-0.6B为例 6 * 0.6B * 36T ≈ 1.3 × 10^23 FLOP = 1.3 × 10^11 TFLOPS
    • 以Qwen3-32B为例 6 * 32B * 36T ≈ 6.9 × 10^25 FLOP = 6.9 × 10^13 TFLOPS
  • 推理 2 * 模型参数量 * token数量
    • 以Qwen3-0.6B为例 2 * 0.6B * 30 ≈ 3.6 × 10^10 FLOPs = 0.036 TFLOPS
    • 以Qwen3-32B为例 2 * 32B * 30 ≈ 1.9 × 10^12 FLOPs = 1.9 TFLOPS

可以看到,训练和推理所需的计算性能相差很大。然后再看下对于显存的要求。注意显存要求是和模型数值精度位数有直接关系的,例如16位相比8位,显存需求一般要大一倍。下面的公式中我们以BF16,即16位两字节来计算。

  • 训练(预训练后训练类似) 8 * 模型参数量 * 2
    • 以Qwen3-0.6B为例 8 * 0.6B * 2 ≈ 9.6 × 10^9 字节 = 9.6GB
    • 以Qwen3-32B为例 8 * 32B * 2 ≈ 5.12 × 10^11 字节 = 512GB
  • 推理 显存主要分为两部分:模型参数量 * 2 + KV Cache
    • 加载模型本身 模型参数量 * 2
    • KV Cache 即前面推理流程中提到的 每层都会将之前计算过的向量结果缓存下来
      • 输入的上下文大小越长,缓存越大
      • 一个token的缓存大小,大小与模型结构和层数有关
    • 以Qwen3-0.6B为例 1token的KV Cache缓存约为 4KB * 28层 = 112KB
      • 上下文1K时 0.6B * 2 + 1K * 112K ≈ 1.2 GB + 112MB ≈ 1.3GB
      • 上下文32K时(最大上下文) 0.6B * 2 + 32K * 112K ≈ 1.2 GB + 3.8GB ≈ 5GB
    • 以Qwen3-32B为例 1token的KV Cache缓存约为 4KB * 64层 = 256KB
      • 上下文1K时 32B * 2 + 1K * 256K ≈ 64 GB + 256 MB ≈ 64GB
      • 上下文32K时(最大上下文) 32B * 2 + 32K * 256K ≈ 64GB + 8.6GB ≈ 72.6GB

可以看到对于小模型来说,上下文越大,缓存占用的显存也就越大,甚至远大于模型本身的显存要求。但是模型参数量增大后,缓存增长却没有那么快,在超大模型中缓存的占比就非常小了。另外这是保守估计的计算值,实际上因为一些额外计算,额外程序和数据存储等,计算量和显存使用量都会更大。

另外显存与计算能力不一样的点在于,计算能力即使差一点也可以用,就是运行得慢一点。但显存是个硬指标,如果不符合要求,模型会无法启动,这时候一点工作都不能完成。从这个角度看,训练模型的硬性条件是很高的。

GPU市场

上面了解了模型对于GPU的要求之后,我们来看一下市场上的GPU有哪些,都提供了怎样的性能。这里分为国外GPU和国内GPU分别介绍。首先是国外GPU:

国家 厂商 型号 BF16稠密算力峰值 显存大小 显存类型 显存带宽 发布时间
美国 NVIDIA H100 989 TFLOPS 80GB HBM3 3.4 TB/s 2022
美国 NVIDIA H200 989 TFLOPS 141GB HBM3e 4.9 TB/s 2024
美国 NVIDIA B200 2250 TFLOPS 192GB HBM3e 8 TB/s 2024
美国 NVIDIA B300 3750 TFLOPS 288GB HBM3e 8 TB/s 2024
美国 NVIDIA H20 (中国特供) 148 TFLOPS 96GB HBM3 4 TB/s 2024
美国 AMD MI300X 1307 TFLOPS 192 GB HBM3 5.3 TB/s 2023
美国 AMD MI325X 1307 TFLOPS 256 GB HBM3e 6.1 TB/s 2024
美国 AMD MI350X 2306 TFLOPS 288 GB HBM3e 8.2 TB/s 2025
美国 AMD MI355X 2516 TFLOPS 288 GB HBM3e 8.2 TB/s 2025

有些厂商还提供了整个机柜的全套方案,例如下面列出两个NVIDIA的方案,内部包含72颗GPU芯片,GPU和CPU集成在一起,即B200集成后为GB200,B300集成后为GB300。

国家 厂商 型号 BF16稠密算力峰值 显存大小
美国 NVIDIA GB200 NVL72 180000 TFLOPS 13.4TB
美国 NVIDIA GB300 NVL72 360000 TFLOPS 20TB

除了NVIDIA和AMD之外,Google,Amazon等厂商也在推出GPU,但是市场份额较少。最后列一下家用的顶级显卡5090和常见的苹果M4芯片的参数做对比:

国家 厂商 型号 BF16稠密算力峰值 显存大小 显存类型 显存带宽 发布时间
美国 NVIDIA RTX5090 419 TFLOPS 32GB GDDR7 1.8 TB/s 2025
美国 Apple M4 13 TFLOPS 使用电脑的统一内存 LPDDR5X 120 GB/s 2024

评测

现在基本上每个大模型发布之时,都会附带一些测试分数,还会与其它大模型比较分数高低。这些测试是什么,有什么作用?这里我们以DeepSeek-V4-Pro-0813报告中的部分测试为例,简单看一下这些评测内容。

HLE

HLE(Humanity's Last Exam)翻译为中文叫作"人类最后的测试"。包含2,500个问题,涉及数十个学科,包括数学、人文学科和自然科学。它由全球各领域的专家编写,包含适合自动评分的选择题和简答题。题目和对应翻译举例如下:

Terminal Bench

Terminal Bench是一个评估大模型在Agent中,使用命令行完成任务的测试。其中大部分是计算机编程相关任务,包含编译/调试/运行代码,配置服务,处理数据等。它分为很多个测试版本,例如1.0, 2.0, 2.1, 3.0等。如下图有两个任务,左侧是从源码构建出Linux操作系统内核,右侧是使用git提交代码并启动本地HTTP服务。

NL2Repo

NL2Repo是字节跳动提出的一个评估模型在编程Agent中执行长周期任务性能的测试,这些任务要求从零开始生成一个完整可运行的代码库。测试包含104个不同的任务,每个任务都配有独立的测试环境。test_files目录中包含全部任务数据,每个任务中包含四个文件。

  • start.md 任务的需求描述文档
  • test_case_count.txt 该任务包含的测试用例总数,通常只是一个数字
  • test_commands.json 定义如何运行测试的具体命令行指令
  • test_files.json 测试所需的外部数据或文件清单

题目的start.md部分内容和对应翻译举例如下:

CyberGym

CyberGym是用于大规模评估模型在Agent中对真实世界网络安全漏洞实战能力的测试。它包含三种测试形式:

测试名称 测试内容 测试例子数量
CyberGym 漏洞复现 1507个漏洞/188个项目
ExploitGym 利用漏洞攻击 869个漏洞
CyberGym-E2E 漏洞修复 920个漏洞/139个项目

排行

在大模型发布时,除了前面的评测外,网络上还会有一些排行,表示大模型各种能力的高低,有些排行本身就是用数据评测出的,有些则是单纯的排行榜。

Artificial Analysis

Artificial Analysis是一个大模型排行和分析平台,里面包含了各种各样的排行榜,包括AI智能排行,速度排行,成本排行,图像/视频排行等。它最主要的智能指数(Artificial Analysis Intelligence Index)是由很多种评测得分加权形成的,其中包含外部评测(例如SciCode, GPQA Diamond, 还有前面介绍过的HLE, Terminal-Bench等),也包含一些平台自己的评测。截至文章撰写时排行如下:

Arena

Arena是一个大模型排行平台,里面也包含很多榜单,包括对话榜,Agent榜,前端开发榜等等。这些榜单并不是通过数据评测得分排行,而是通过用户真实的体验感受得出。用户使用AI时,Arena会同时提供两个匿名模型的结果,用户投票选出更好的一方。然后通过Elo评分系统最终得出排名。Elo评分系统是广泛使用的评分机制,像是篮球、乒乓球、围棋、游戏等,都采用这个评分机制对运动员进行排名。例如下面是这个平台的前端代码能力排行:

其它站点

Hugging Face

Hugging Face的中文名叫做抱抱脸,是一个人工智能社区平台。它主要由两部分组成,这两部分的使用者都非常广泛:

  • 大模型和数据集的上传/下载/分享平台。目前有超过200万个模型和50万个数据集
  • 以Transformers为主的大模型的开源训练推理工具库,可通过少量代码快速实现功能

Hugging Face在国内无法访问,但是有对应的国内镜像站。国内还有一个类似的网站叫做魔搭社区,是阿里创办的大模型平台。

OpenRouter

OpenRouter是一个大模型API聚合平台。在不用OpenRouter时,我们使用哪个大模型,就要去对应厂商的网站中充钱,获取一个单独的API地址和key。如果想体验不同的模型,就比较麻烦。OpenRouter和这些大模型厂商都谈好了合作,我们只需要接入OpenRouter的API,在这里面充值一次,就可以一键切换使用不同的模型。

OpenRouter会公布不同模型在平台的调用数据,因为OpenRouter的访问量比较大,因此这个数据经常被用来比较模型的受欢迎程度,例如这是文章撰写时最近一周的模型调用量排名:

参考

相关推荐
martindelophy1 小时前
Codex Chrome 插件 + Timeline Studio:构建可编辑的 AI 视频剪辑 Agent 工作流
前端·人工智能·chrome
AIkk861 小时前
大文件怎么压缩变小方便传输?本地压缩+云端方案对比测评
人工智能
薛定e的猫咪1 小时前
(ICLR2026)MORL‑FB:从无奖励强化学习视角重新审视多目标强化学习
人工智能·深度学习·机器学习
行业研究员1 小时前
腾讯云ADP:智能体平台封神榜
人工智能·microsoft·腾讯云·智能体·智能体平台·腾讯云adp
问天_观心1 小时前
零基础在windows环境下的WSL使用llamafactory(一)
人工智能·windows·python·神经网络·语言模型·github·模型蒸馏
陈童学哦1 小时前
DeepSeek Harness(Cordis):打破Agent框架黑盒,一切皆插件
人工智能
小睿科技1 小时前
建筑AI睿兔大脑 | AI把工程成本测算从经验活变成算清楚的技术活
人工智能
正经教主1 小时前
AI提示词工程(高阶)第19课:提示词评估与A/B测试
人工智能
Zach_菠萝侠2 小时前
【DeepSeek Harness 研究】进化方向1:动态路由 思考、设计与实现
人工智能·深度学习·deepseek
whyutianict_vv2 小时前
从 Web 前端到 HarmonyOS ArkTS:一次 AI 鸿蒙全栈智能体开发的迁移实录
前端·人工智能·harmonyos