
我们天天在用豆包、DeepSeek、千问、Claude......但它们最初并不是"聊天机器人",而是一个只会"接着往下写"的文本续写机器。这个机器,就叫基座模型 。基座模型是怎么来的?答案就三个字:预训练。
预训练到底在做什么?
想象一下,你把一个人关进图书馆,让他没日没夜地读书。没人给他出题、没人批改作业,他只是顺着文字往下看,自己猜下一个词应该是什么。
几年之后,他自然学会了语法、常识、逻辑,甚至能写出像模像样的文章。
大模型的预训练,本质上就是这件事。

关键点:不需要人工标注,模型从海量文本中自己学习规律。
为什么不需要标注?因为文本本身就是答案。让模型"猜下一个词"或者"填被遮住的词",猜对了就是学到了,猜错了就调整参数。这种让数据自己当老师的训练方式,就叫自监督学习。
预训练、微调、推理分别是什么?
很多人把这三个阶段混在一起,其实它们分工非常清晰:

简单记:
- 预训练:埋头苦读,学会语言和世界知识。
- 微调:老师带着做真题,学会听指令。
- 推理:用户提问,模型作答。
我们平时用的 ChatGPT,是经历了"预训练 + 微调 + 人类反馈强化学习"之后才变成对话机器人的,不是一开始就会聊天的。
预训练方式
目前主流预训练方式有两种:

| 流派 | 代表作 | 核心玩法 | 擅长什么 |
|---|---|---|---|
| 自回归 | GPT 系列 | 预测下一个词 | 文本生成、对话、代码续写 |
| 掩码语言模型 | BERT 系列 | 预测被遮住的词 | 文本理解、分类、抽取 |
GPT 像写作文接龙,BERT 像做完形填空。今天我们见到的 ChatGPT、Claude、DeepSeek,走的都是 GPT 这条"接龙"路线。
GPT 是怎么训练的?
别被万亿 token 吓到,原理其实非常朴素。
模型会拿到每一个前缀,然后努力去猜下一个 token 是什么。猜错了?没关系,计算误差,反向传播,调整参数。万亿次这样的猜测和修正之后,模型就逐渐掌握了语言规律。
BERT 又是怎么训练的?
BERT 的方式更像学生时代老师出的完形填空题:
它不看后面的词,只能根据上下文去推测被遮住的部分。这种方式让 BERT 非常擅长"理解"文本,而不是"生成"文本。
训练数据从哪来?
一句话:几乎一切能读的文字。
网页、书籍、论文、代码、维基百科、论坛帖子......只要是文本,几乎都能喂给模型。但 raw data 不能直接吃,必须经过清洗:去重、去垃圾、过滤低质量内容、做隐私脱敏。数据清洗,往往比训练本身还费工夫。
预训练到底要多大算力?

规模大致是什么概念?
- 数据量级:万亿 token 起步
- 模型参数:几十亿到上万亿
- GPU 数量:数千到数万张 A100/H100
- 训练时间:数周到数月
所以预训练基本是大厂的牌桌,普通团队更多是在开源基座模型上做微调。
Scaling Law:越大越强,而且有规律
大模型领域有一个著名的发现,叫 Scaling Law(缩放定律):

text
Loss ≈ A / N^α + B / D^β + C
N = 参数量
D = 数据量
α ≈ 0.076, β ≈ 0.095
结论:
模型扩大 10 倍 → 数据也要扩大约 10 倍
→ 计算量扩大约 100 倍
→ Loss 持续下降
通俗理解:只要你敢堆参数、堆数据、堆算力,模型能力就会稳定提升。这也是 OpenAI 当年敢于把 GPT-3 做到 1750 亿参数的理论底气。
预训练的工程流程
这不是写几行 Python 就能跑通的事,而是一个完整系统工程:
其中分布式训练是重头戏。数据并行、张量并行、流水线并行一起上,才能把万亿参数模型"摊"到几千张 GPU 上跑起来。
预训练有多烧钱?

- GPT-3 大约用了 355 GPU·年
- GPT-4 据传是 数万 GPU·年
- 电费 + 硬件 + 人力,整体成本 百万到亿美元
所以预训练这件事,拼的不仅是算法,更是工程、资源和资金。
预训练完,模型到底学会了什么?
预训练结束后的模型,通常叫 Base Model(基座模型)。它已经很强,但还"不会聊天"。

它能续写、能翻译、能写代码,但你问它"你好",它可能回你一段 Wikipedia 式的定义,而不是自然打招呼。要让它变得"会聊天",还得靠后面的 SFT 微调 和 RLHF 人类对齐。
整个技术栈里的预训练
预训练是地基。Transformer、Token、海量数据、Scaling Law 共同支撑着它;地基之上,再经过微调和 RLHF,才能盖出对话模型这栋大楼。
LLM训练全流程
对比一下三个阶段,你就能理解为什么预训练最烧钱、周期最长,而后面微调和对齐相对轻量。
普通人能参与预训练吗?
看到前面动辄几千张 GPU、几个月训练、几百万美元,很多人可能会想:这事跟我有关系吗?
答案是:有,而且门槛比你想象的低。
你确实很难从头预训练一个 GPT-4,但并不意味着你只能当旁观者。普通人参与大模型赛道,至少有三条路:
1. 走微调路线,站在巨人肩膀上
开源基座模型已经非常多:Llama、Qwen、Mistral、DeepSeek-MoE......这些模型已经完成过昂贵的预训练,你可以直接拿来做微调。
- 数据:准备几千到几万条领域问答对
- 硬件:几张 3090 / A100 就能跑
- 工具:LLaMA-Factory、Axolotl、Unsloth 等框架已经把流程封装得很简单
花上几天时间,你就能做出一个"懂自己业务"的专属模型。
2. 做数据工程,这是被低估的入口
预训练质量很大程度上取决于数据。而清洗数据、构建高质量语料、设计指令数据集,恰恰是普通人最能发力的环节。
- 爬虫 + 清洗管道
- 去重、过滤、隐私脱敏
- 设计提示词模板、人工标注、质量评估
未来"AI 训练师""数据工程师"这类岗位只会越来越吃香。
3. 用模型,而不是训模型
对大多数人来说,最有价值的参与方式是:把大模型用到自己的工作流里。
写代码、做文案、处理表格、做知识库、自动化客服......真正拉开差距的,不是你会不会训练模型,而是你能不能把它用得比别人更好。
预训练是大厂的战场,但应用和微调是每个人的机会。你不需要从头造一辆跑车,学会驾驶、改装、保养,已经足够让你跑在前面。
总结
一句话总结:
预训练,就是让模型在海量文本里做"完形填空"或"预测下一个词"的自监督学习。它学会了语言规律和世界知识,产出基座模型;基座模型再经过微调和人类对齐,才变成我们能对话的 ChatGPT、Claude、DeepSeek。