什么是大语言模型?
文章目录
- 什么是大语言模型?
- [1. 什么是大语言模型](#1. 什么是大语言模型)
- [2. 大语言模型的核心特点](#2. 大语言模型的核心特点)
-
- [2.1 规模巨大](#2.1 规模巨大)
- [2.2 通用性强](#2.2 通用性强)
- [2.3 训练方式不同](#2.3 训练方式不同)
- [2.4 交互方式发生变化](#2.4 交互方式发生变化)
- [3. 常见的大语言模型:](#3. 常见的大语言模型:)
- [4. 结合 AI应用 和 Agent](#4. 结合 AI应用 和 Agent)
-
- [1.1 结合AI应用理解:](#1.1 结合AI应用理解:)
- [1.2 结合 Agent 智能体的角度](#1.2 结合 Agent 智能体的角度)
- [5. 总结:](#5. 总结:)
1. 什么是大语言模型
大语言模型 (Large Language Model,LLM)是指基于大规模神经网络 ,通过自监督或半监督 方式,对海量文本进行训练 、能理解和生成人类语言的语言模型**。
大语言模型的参数规模通常达到数十亿至万亿级别。例如,GPT-3 包含 1750 亿参数。
如果这句话对于刚接触大语言模型的同学来说比较抽象,我们可以先分别理解其中几个重要的概念:
- 神经网络
- 自监督学习
- 半监督学习
- 语言模型
理解了这几个概念之后,再回过头来看"大语言模型",就会更加容易。
1.1 什么是神经网络?
我们可以把神经网络简单理解成一个非常高效的"团队工作流程"或"条件反射链"。
举个例子:如何教一个小朋友识别猫?
我们不会只给小朋友一条简单的规则,例如:
"有胡子就是猫。"
因为兔子也可能有胡子。
我们会让他看很多猫的图片:
- 有的神经元负责识别"尖耳朵";
- 有的神经元负责识别"胡须";
- 有的神经元负责识别"毛茸茸的尾巴"。
这些神经元会一层层地传递和组合信息,最后大脑综合判断:
"这是猫!"
神经网络就是模仿人脑的这种工作方式。
它由大量虚拟的"神经元"和连接组成。
每个神经元都像一个小处理单元 ,负责处理一点点信息。无数个神经元分成很多层,前一层的输出作为后一层的输入。
通过海量数据的训练,这个网络会自己调整每个"神经元"的重要性,也就是参数的值,最终形成一个非常复杂的"判断流水线"。
例如,一个识别猫的神经网络,某些参数可能专门负责识别猫的眼睛,另一些参数专门负责识别猫的轮廓。
简单来说
神经网络就是一个通过数据训练出来的、由大量参数组成的复杂决策系统。
1.2 什么是自监督学习
自监督学习可以理解成一个"完形填空"超级大师。
例如,我们想学会一门外语,但没有老师给出题和批改,怎么办?
我们可以拿一本该语言的小说,自己玩"完形填空":
随机盖住一个词,然后根据上下文猜测这个词是什么。
一开始可能猜得乱七八糟。
但是不断重复这个过程,看了成千上万本书后,我们就会逐渐掌握这个语言的:
- 语法;
- 词汇搭配;
- 上下文逻辑。
现在不仅能轻松猜对被盖住的词,甚至能够自己写出流畅的文章。
这就是自监督学习。
模型面对海量的、没有标签的原始文本,例如互联网上的文章、网页等。
它自己给自己创造任务:
把一句话中间的某个词遮住,然后尝试根据前后的词来预测这个被遮住的词。
通过亿万次这样的练习,模型就能够逐渐学习语言的规律。
它不需要人类手动给每句话标注:
"这是主语。"
"这是谓语。"
简单来说
自监督就是让模型从数据本身找规律,自己给自己当老师。
1.3 什么是半监督学习
半监督学习可以理解为:
"师父领进门,修行在个人"。
例如,你想学做菜。
师傅先教你几道招牌菜,比如:
- 麻婆豆腐;
- 宫保鸡丁。
这相当于给了你一些"有标注的数据"。
然后,师傅让你去尝遍天下各种美食,自己研究其中的门道。
这相当于接触海量的"无标注数据"。
你结合师傅教的基本功和自己尝遍天下美食的经验,最终不仅能完美复刻招牌菜,还能创新出新的菜式。
这就是"半监督"。
先用少量带标签的数据让模型"入门",掌握一些基本规则 ,然后再让它去海量的无标签数据中自我学习和提升。
这对于大语言模型来说也是一种常用的训练方式。
简单来说
半监督就是"少量指导 + 大量自学"的结合模式。
1.4 什么是语言模型
语言模型 可以理解成一个"超级自动补全 "或"语言预测器"。
例如,我们在用手机打字时,输入:
"今天天气真"
输入法可能会自动提示:
"好"
"不错"
"冷"
这个输入法 之所以能够提示,就是因为它内部有一个小型的"语言模型"。
它会根据我们输入的前文,计算下一个词最可能是什么。
语言模型的核心任务
预测下一个词。
一个强大的语言模型,能够根据一段话,预测出最合理、最通顺的下一个词是什么。
这样一个个词接下去,就能够生成一整段话、一篇文章。
简单来说
语言模型就是一个计算"接下来最可能说什么"的模型。
1.5 重新理解大语言模型
现在,我们再回头看"大语言模型"的描述,就会比较容易理解了。
翻译成大白话就是:
大语言模型是一个使用"超级团队工作流程"(大规模神经网络)搭建的,拥有数百亿甚至上万亿个"脑细胞"(参数)的"超级自动补全系统"(语言模型)。
它学习的方式,主要是通过:
- 自己玩"海量完形填空"(自监督学习);
- "少量名师指导 + 海量自学"(半监督学习)。
通过这些方式,它从海量文本数据中学习语言的规律。
2. 大语言模型的核心特点
2.1 规模巨大
大语言模型的"脑细胞",也就是参数特别多。
通常达到数十亿甚至万亿级别。
所以它能够处理更加复杂的问题。
这就像:
一支百万大军和一个小分队的区别。
2.2 通用性强
大语言模型不是为了单一任务训练的。
因为它通过"完形填空"学习的是整个语言世界的底层规律,包括:
- 语法;
- 逻辑;
- 知识关联。
而不是只背会了某一个具体任务。
所以,它能够举一反三,把底层能力灵活应用到不同任务中,例如:
- 聊天;
- 翻译;
- 写代码。
这种"涌现"能力,就像孩子通过大量阅读后,突然能够写出意想不到的优美句子一样。
2.3 训练方式不同
大语言模型主要使用自监督学习,从海量无标注的原始文本中学习。
它不依赖人工一张张地给图片标注:
"这是猫。"
而是直接从原始文本中自学。
这种方式效率很高,也能够支持非常大规模的训练。
2.4 交互方式发生变化
传统的软件使用方式,往往需要:
- 点击按钮;
- 输入固定内容;
- 编写代码。
而大语言模型带来了一种更加自然的交互方式。
我们可以直接像对人说话一样给它指令,也就是输入 Prompt(提示词)。
例如:
"写一首关于春天的诗。"
模型就能够根据我们的要求生成相应的内容。
3. 常见的大语言模型:
常见的大语言模型:
| 模型名称 | 简介 |
|---|---|
| GPT系列 | OpenAI(美国)开发的顶级多模态大模型,包含GPT‑5.1等版本,具备超强推理能力与原生音视频处理能力 |
| Claude系列 | Claude是由Anthropic公司开发的AI助手,以擅长编程辅助、处理长文档和进行细腻、拟人化的对话而著称。 |
| Gemini系列 | Gemini系列模型是Google推出的多模态AI模型,旨在提升对话系统和搜索引擎的智能表现,融合了文本、图像等多种数据处理能力。 |
| GLM | GLM(General Language Model)是智谱AI推出的大语言模型,以高效的上下文理解能力、优秀的多任务处理性能和本土化语言适配优势为特色。 |
| 通义千问系列 | 阿里巴巴(中国)开发,具备全栈AI能力,与阿里云生态深度绑定 |
| 混元大模型 | 腾讯(中国)推出,依托微信、腾讯云生态,企业级安全与生态打通能力优异,适合社交与企业应用场景 |
| 云雀大模型/豆包 | 字节跳动(中国)自研,驱动豆包AI助手,与抖音、今日头条等内容生态深度集成,用户量破亿 |
| DeepSeek | DeepSeek(中国)研发,被称为"国产推理之王",推理能力强,成本效益高,适合复杂逻辑任务 |
我们常用的豆包、cursor都是基于大语言模型来运行,向他人提供服务的。
4. 结合 AI应用 和 Agent
1.1 结合AI应用理解:
我的理解是:一个AI应用,能够做很多的事情,那么这个AI应用,真正决定怎么做,如何做,需要依赖大语言模型(LLM)
LLM 就是 AI 应用的大脑,负责思考、理解、做决策、生成文字逻辑。
但大脑不会动手干活,真正实际执行动作,要靠工具 / 外部能力。
- 用户给 AI 应用提需求:帮我写代码、查资料、编辑图片
- LLM(大脑):理解你的意图,思考要分几步完成,判断该调用什么工具,生成执行逻辑、输出回复文本。
- 但是 LLM 本身不能直接操作文件、不能调用画图接口、不能操作数据库、不能访问网络。
- 需要 AI 应用帮它调用对应的工具,把工具返回的结果再交给 LLM,LLM 再整理成最终答案返回给用户。
1.2 结合 Agent 智能体的角度
- 如果没有 Agent:LLM 只做问答,只输出文字,不会主动调用工具。
- 如果是 Agent 智能体应用:LLM 负责规划决策,然后指挥工具去干活。
5. 总结:
如果把前面的内容全部总结起来:
- 大语言模型是一个使用大规模神经网络搭建的语言模型,拥有数十亿甚至万亿级别的参数。
- 它通过自监督学习或者半监督学习 等方式,从海量文本数据中学习语言的规律。
- 它可以理解和预测语言,并将这些能力应用到聊天、翻译、写代码等不同任务中。
- 与传统的交互方式相比,我们可以直接通过自然语言 ,也就是 Prompt(提示词),向大语言模型提出要求。
因此,可以用一句话记住:
大语言模型 = 大规模神经网络 + 大量参数 + 海量文本训练 + 语言预测能力。
最后,如果这篇博客能帮到你的,请你点点赞,有写错了,写的不好的,欢迎评论指出,谢谢!