大模型到底是怎么学会说话的?一文看懂预训练

我们天天在用豆包、DeepSeek、千问、Claude......但它们最初并不是"聊天机器人",而是一个只会"接着往下写"的文本续写机器。这个机器,就叫基座模型 。基座模型是怎么来的?答案就三个字:预训练

预训练到底在做什么?

想象一下,你把一个人关进图书馆,让他没日没夜地读书。没人给他出题、没人批改作业,他只是顺着文字往下看,自己猜下一个词应该是什么。

几年之后,他自然学会了语法、常识、逻辑,甚至能写出像模像样的文章。

大模型的预训练,本质上就是这件事。

关键点:不需要人工标注,模型从海量文本中自己学习规律。

为什么不需要标注?因为文本本身就是答案。让模型"猜下一个词"或者"填被遮住的词",猜对了就是学到了,猜错了就调整参数。这种让数据自己当老师的训练方式,就叫自监督学习


预训练、微调、推理分别是什么?

很多人把这三个阶段混在一起,其实它们分工非常清晰:

简单记:

  • 预训练:埋头苦读,学会语言和世界知识。
  • 微调:老师带着做真题,学会听指令。
  • 推理:用户提问,模型作答。

我们平时用的 ChatGPT,是经历了"预训练 + 微调 + 人类反馈强化学习"之后才变成对话机器人的,不是一开始就会聊天的。


预训练方式

目前主流预训练方式有两种:

流派 代表作 核心玩法 擅长什么
自回归 GPT 系列 预测下一个词 文本生成、对话、代码续写
掩码语言模型 BERT 系列 预测被遮住的词 文本理解、分类、抽取

GPT 像写作文接龙,BERT 像做完形填空。今天我们见到的 ChatGPT、Claude、DeepSeek,走的都是 GPT 这条"接龙"路线。


GPT 是怎么训练的?

别被万亿 token 吓到,原理其实非常朴素。

模型会拿到每一个前缀,然后努力去猜下一个 token 是什么。猜错了?没关系,计算误差,反向传播,调整参数。万亿次这样的猜测和修正之后,模型就逐渐掌握了语言规律。


BERT 又是怎么训练的?

BERT 的方式更像学生时代老师出的完形填空题:

它不看后面的词,只能根据上下文去推测被遮住的部分。这种方式让 BERT 非常擅长"理解"文本,而不是"生成"文本。


训练数据从哪来?

一句话:几乎一切能读的文字。

网页、书籍、论文、代码、维基百科、论坛帖子......只要是文本,几乎都能喂给模型。但 raw data 不能直接吃,必须经过清洗:去重、去垃圾、过滤低质量内容、做隐私脱敏。数据清洗,往往比训练本身还费工夫。


预训练到底要多大算力?

规模大致是什么概念?

  • 数据量级:万亿 token 起步
  • 模型参数:几十亿到上万亿
  • GPU 数量:数千到数万张 A100/H100
  • 训练时间:数周到数月

所以预训练基本是大厂的牌桌,普通团队更多是在开源基座模型上做微调。


Scaling Law:越大越强,而且有规律

大模型领域有一个著名的发现,叫 Scaling Law(缩放定律)

text 复制代码
Loss ≈ A / N^α + B / D^β + C

N = 参数量
D = 数据量
α ≈ 0.076, β ≈ 0.095

结论:
  模型扩大 10 倍 → 数据也要扩大约 10 倍
  → 计算量扩大约 100 倍
  → Loss 持续下降

通俗理解:只要你敢堆参数、堆数据、堆算力,模型能力就会稳定提升。这也是 OpenAI 当年敢于把 GPT-3 做到 1750 亿参数的理论底气。


预训练的工程流程

这不是写几行 Python 就能跑通的事,而是一个完整系统工程:

其中分布式训练是重头戏。数据并行、张量并行、流水线并行一起上,才能把万亿参数模型"摊"到几千张 GPU 上跑起来。


预训练有多烧钱?

  • GPT-3 大约用了 355 GPU·年
  • GPT-4 据传是 数万 GPU·年
  • 电费 + 硬件 + 人力,整体成本 百万到亿美元

所以预训练这件事,拼的不仅是算法,更是工程、资源和资金。


预训练完,模型到底学会了什么?

预训练结束后的模型,通常叫 Base Model(基座模型)。它已经很强,但还"不会聊天"。

它能续写、能翻译、能写代码,但你问它"你好",它可能回你一段 Wikipedia 式的定义,而不是自然打招呼。要让它变得"会聊天",还得靠后面的 SFT 微调RLHF 人类对齐


整个技术栈里的预训练

预训练是地基。Transformer、Token、海量数据、Scaling Law 共同支撑着它;地基之上,再经过微调和 RLHF,才能盖出对话模型这栋大楼。


LLM训练全流程

对比一下三个阶段,你就能理解为什么预训练最烧钱、周期最长,而后面微调和对齐相对轻量。


普通人能参与预训练吗?

看到前面动辄几千张 GPU、几个月训练、几百万美元,很多人可能会想:这事跟我有关系吗?

答案是:有,而且门槛比你想象的低。

你确实很难从头预训练一个 GPT-4,但并不意味着你只能当旁观者。普通人参与大模型赛道,至少有三条路:

1. 走微调路线,站在巨人肩膀上

开源基座模型已经非常多:Llama、Qwen、Mistral、DeepSeek-MoE......这些模型已经完成过昂贵的预训练,你可以直接拿来做微调。

  • 数据:准备几千到几万条领域问答对
  • 硬件:几张 3090 / A100 就能跑
  • 工具:LLaMA-Factory、Axolotl、Unsloth 等框架已经把流程封装得很简单

花上几天时间,你就能做出一个"懂自己业务"的专属模型。

2. 做数据工程,这是被低估的入口

预训练质量很大程度上取决于数据。而清洗数据、构建高质量语料、设计指令数据集,恰恰是普通人最能发力的环节。

  • 爬虫 + 清洗管道
  • 去重、过滤、隐私脱敏
  • 设计提示词模板、人工标注、质量评估

未来"AI 训练师""数据工程师"这类岗位只会越来越吃香。

3. 用模型,而不是训模型

对大多数人来说,最有价值的参与方式是:把大模型用到自己的工作流里。

写代码、做文案、处理表格、做知识库、自动化客服......真正拉开差距的,不是你会不会训练模型,而是你能不能把它用得比别人更好。

预训练是大厂的战场,但应用和微调是每个人的机会。你不需要从头造一辆跑车,学会驾驶、改装、保养,已经足够让你跑在前面。

总结

一句话总结

预训练,就是让模型在海量文本里做"完形填空"或"预测下一个词"的自监督学习。它学会了语言规律和世界知识,产出基座模型;基座模型再经过微调和人类对齐,才变成我们能对话的 ChatGPT、Claude、DeepSeek。

相关推荐
小小工匠1 小时前
给模型一套设计词汇:Impeccable 如何把「AI 味」变成可检测、可修复的工程问题
人工智能·agent·impeccable·ui skill
科技新资讯1 小时前
国内AI买量视频制作服务商排名
人工智能
VIP_CQCRE1 小时前
用 Ace Data Cloud 快速接入 OpenAI Chat Completions API:兼容官方格式,更适合开发者落地
ai·大模型·openai·api·ace data cloud
a1122998212 小时前
关键词排名失效?2026年GEO工具选型标准更新
人工智能
aaa小葵2 小时前
LangGraph
数据库·人工智能
Olafur_zbj2 小时前
【AI】CUDA的新编程模型:tile编程模型
人工智能·cuda·tile
明源云2 小时前
租赁管理系统软件推荐:如何选到真正好用的不动产租赁管理软件
大数据·人工智能·架构
MinggeQingchun2 小时前
AI - ChatModel和ChatClient
人工智能·saa·chatclient·chatmodel
余生皆假期-2 小时前
傅里叶变换和拉普拉斯变换
人工智能·算法·机器学习