大模型,一般也称为 "大语言模型",是一种基于深度学习技术训练出来的人工智能系统,主要用于处理和生成人类语言
AI大模型特点
模型规模:通常包含数十亿到数千亿个参数,这些参数就像是模型的"大脑神经元"
训练数据:使用海量文本数据进行训练,包括书籍、文章、网页等各种形式的文字内容
大模型工作原理
通过学习大量文本,掌握了语言的规律和知识,然后根据输入的提示(prompt)生成相应的输出
深度学习就是用层数较多(深)的人工神经网络从数据中学习输入与输出之间映射关系的算法,而人工神经网络是受生物神经网络的结构和功能启发下设计的计算模型
用深度学习训练得到的网络就叫深度神经网络,它可以简单的看成一个函数,能够完成任何输入到输出的转换
大模型分类
语言大模型
语音大模型
图像处理大模型
多模态大模型
预训练大(语言)模型实现的核心机制
- 学会说话:通过海量数据训练,达到给出上文,能够接出下文
- 理解意图:识别用户的需求,并将用户需求作为上文,模型接下文
- 反馈择优:模型的回答可以有多个,通过算法,选择最优进行回答