【AI入门】大模型介绍全解析:从模型、LLM 到提示词与嵌入

👋 欢迎阅读

🏠个人主页: 愿旖旎

📘专栏传送门: 算法专栏

💻当前学习内容:LangChain


📑 目录

一、知识前置讲解

二、认识模型

三、认识大语言模型

四、提示词编写

[五、LLM 的接入方式](#五、LLM 的接入方式)

六、嵌入式模型

七、复盘(附答案)


一、前置讲解

在进入正文前,先花 10 秒了解本篇会反复用到的核心概念,带着印象去读正文,学习效率更高。

🧠 前置知识一:什么是模型

从数据中学习规律、能完成特定任务的"数学函数",是 AI 的基本单元

📐 前置知识二:神经网络与参数

模型的大脑:由大量参数组成的多层"判断流水线",规模决定能力。

📚 前置知识三:自监督学习与半监督学习

模型的学习方式:从无标注数据自己找规律,或用少量标注结合大量无标注。

⌨️ 前置知识四:语言模型与提示词

模型的交互接口:语言模型是"自动补全器",提示词是我们下指令的方式。

🧮 前置知识五:嵌入与向量

把文字/图片翻译成数字(向量)以便计算机计算,是语义搜索、RAG 的基础


二、认识模型

模型是一个从数据中学习规律 的"数学函数"或"程序"。给它喂入海量数据,它就能学会预测、生成文本或图像,从而增强各行各业的业务能力。

打个比方 ,可以把模型想象成一家**"超级加工厂"**:

  • 训练师先给它看海量例子(数据),并告诉它该怎么做;

  • 它看多了,自己摸索出一套规则 ,从此输入原料(数据)→ 输出成品(结果)

举个具体例子,给模型输入这些数据:

输入 输出
1, 2, 3 2
4, 5, 6 5

模型学会的规律是"输出中间那个数"。学成之后 ,再输入 [8, 9, 10],它就能预测输出 9

模型的三个关键属性

属性 说明
特定任务 一个模型通常只擅长一件事------识别图片里是不是猫、预测明天会不会下雨、判断评论是好评还是差评
需要标注数据 训练这类模型需要大量"标准答案"(如成千上万张标注好"是猫/不是猫"的图片)
参数较少 参数是模型从数据中学到的"内部规则",参数少 = 模型复杂度和能力相对有限

模型 = 学出来的规则,不是人写死的程序------给它数据,它自己总结规律,然后对新输入做预测。


三、认识大语言模型

3.1 什么是大语言模型

大语言模型(Large Language Model,LLM)是基于大规模神经网络 (参数规模通常达数十亿至万亿级别,如 GPT-3 有 1750 亿参数)、通过自监督或半监督方式在海量文本上训练的语言模型。

拆开来看,它由四个核心概念构成:

① 神经网络 ------ 模型的"大脑"

神经网络模仿人脑的工作方式,是一个**"团队工作流程"** 。教小朋友识别猫时,不会只给一条规则("有胡子就是猫"?兔子也有胡子),而是让他看很多猫的图片------视觉神经协同工作

神经元分工 负责识别
神经元 A 尖耳朵
神经元 B 胡须
神经元 C 毛茸茸的尾巴

这些神经元一层层传递和组合信息,最后大脑综合判断:"这是猫!"

神经网络就是模拟这个过程 :由大量虚拟的**"神经元"(参数)和连接** 组成,前一层输出作为后一层的输入 。通过海量数据训练,网络自动调整每个参数的值 ,最终形成一套复杂的**"判断流水线"**------有的参数负责识别猫的眼睛,有的负责识别轮廓。

② 自监督学习 ------ 自己给自己当老师

想象自学一门外语:没有老师出题批改,那就拿一本小说自己玩"完形填空" ------随机盖住一个词,根据上下文猜它是什么。一开始猜得乱七八糟,但看了成千上万本书后,语法、词汇搭配、上下文逻辑都了如指掌,甚至能自己写出流畅文章。

自监督学习就是"完形填空"的过程:

步骤 做法
面对数据 海量没有标签的原始文本(互联网上的文章、网页)
创造任务 遮住一句话中间的词,根据上下文预测
反复练习 亿万次练习后 ,深刻学会语言规律,完全不需要人工标注语法成分

自监督学习 = 让模型从数据本身找规律,自己给自己当老师。

③ 半监督学习 ------ 少量名师 + 海量自学

用学做菜打比方:

来源 相当于 作用
师傅教的招牌菜(麻婆豆腐、宫保鸡丁) 少量"有标注数据" 打下基本功
尝遍天下美食、自己研究门道 海量"无标注数据" 自己摸索规律

结合师傅教的基本功 + 自己的品尝经验,最后不仅能复刻招牌菜,还能创新出新菜式。

半监督学习 = 少量标注数据 + 大量无标注数据,共同提升学习效果。

④ 语言模型 ------ "超级自动补全"

手机打字时输入"今天天气真",输入法会自动提示"好、不错、冷"------输入法内部就有一个小型语言模型根据前文,计算下一个词最可能是什么。大语言模型就是这个逻辑的"超级放大版"。

3.2 大语言模型总结

大语言模型 = "大规模神经网络"(超级团队工作流程)+ 数百亿/万亿"参数"(脑细胞)+ "语言模型"(超级自动补全) ,通过自监督/半监督学习,从互联网海量文本中学会了语言规律

四大特点

特点 说明
规模巨大 参数数十亿至万亿级,能处理更复杂全面的信息(百万大军 vs 小分队)
通用性强 学到的是语言世界的底层规律 (语法、逻辑、知识关联),能举一反三,涌现出聊天、翻译、写代码等能力
训练方式不同 主要靠自监督学习 从无标注文本自学,不依赖昂贵的人工标注,所以能做很大
交互方式革命 不用点按钮/写代码,直接用自然语言下指令(Prompt),说"写一首关于春天的诗"就能写

四、提示词编写

4.1 核心思想:换位思考

假设 AI 对你的信息一无所知 ,你需要清晰、具体、无歧义地告诉它:

要素 说明
要什么 明确目标
在什么背景下 提供上下文
以什么方式呈现 指定输出形式

再配合示例、角色扮演、具体约束、迭代优化,沟通效果显著提升。

4.2 CO-STAR 结构化框架

先看对比,感受差距:

❌ 优化前(模糊低效)

我该怎么吃才能更健康?

✅ 优化后(清晰有效)

角色 :你是一个基于科学证据的 AI 营养顾问。重要约束:所有建议仅为通用信息,不能替代专业医疗诊断;给出具体建议前必须声明免责条款。

任务:基于以下用户信息,提供个性化每日饮食原则性建议。

用户信息:年龄 30 岁 · 男性 · 目标减脂增肌 · 办公室久坐,每周 3 次力量训练

回答要求

  1. 先输出免责声明

  2. 核心原则围绕"控制总热量摄入,确保充足蛋白质"

  3. 早餐/午餐/晚餐/训练加餐各给 1 条核心建议

  4. 推荐 2 种适合的健康零食

  5. 不推荐任何保健品或药物

输出格式:【免责声明】→【核心原则】→【分餐建议】→【健康零食推荐】

为什么有效 :把角色、约束、任务、背景、输出格式全部显式化,模型不再"猜"你的意图。

4.3 少样本提示(Few-shot Prompting)

给 AI 提供一两个**"输入-输出"示例** ,让它照葫芦画瓢 ------不是在"下指令",而是在"教"它你想要的格式、风格和逻辑

适用场景:格式固定、风格独特、逻辑复杂的任务(风格仿写、数据提取、复杂格式生成)。

示例对比

方式 提示词
❌ 零样本 2 🦜 9 等于多少?
✅ 少样本 根据以下示例处理问题。示例1:2 🦜 3 = 5;示例2:4 🦜 7 = 11;现在请分析:2 🦜 9 等于多少?

优势 :通过示例隐式传递规则,比文字描述更直观,尤其适合符号或自定义逻辑场景。

4.4 零样本链式思考(Zero-shot-CoT)

在提示词末尾加一句**"魔法短语"** ------"请一步步进行推理并得出结论",强制 AI 在给出答案前先进行内部推理。

适用场景:任何需要一点逻辑思考的问题,即使你不清楚具体步骤。

示例

罗杰有五个网球,他又买了两盒网球,每盒有3个网球,请问他现在总共有多少个网球?请一步步进行推理并得出结论。

AI 输出:

罗杰最初有5个网球。 买来的网球数量:2 × 3 = 6个。 因此总共有:5 + 6 = 11个。 答案:11个网球。

本质 :这句指令相当于引导模型的"注意力机制" ------告诉模型"在生成最终答案前,先在文本序列中模拟出一个缓慢、有序的推理上下文",从而减少跳跃式错误。

4.5 自我批判与迭代

要求 AI 生成答案后,从特定角度审查并优化自己的答案 ------把**"生成"和"评审"两个步骤分离**,利用 AI 的批判性思维提升质量。

适用场景:代码审查、文案优化、论证强化、安全检查。

示例:编写代码后自检

方式 提示词
❌ 优化前 写一个Python函数,计算列表中的最大值。
✅ 优化后 步骤一:写一个 Python 函数 find_max;步骤二:请从代码健壮性和可读性角度审查(空列表如何处理?命名是否清晰?给出优化后的最终版本)。

五、LLM 的接入方式

直接与大模型提供方交互的方式有三种:

方式 一句话概括
API 远程调用 调云端现成接口,最主流
开源模型本地部署 模型跑在自己机器上
SDK 官方客户端库 API 的封装,写代码更顺手
5.1 API 接入(最主流)

适合:快速开发、集成到现有应用、不想管理硬件资源。

通过 HTTP 请求(RESTful API)直接调用云端的模型服务。代表厂商:OpenAI (GPT-4o)、Anthropic (Claude)、Google (Gemini)、百度文心一言、阿里通义千问、智谱 AI 等。

典型流程

步骤 做法
1. 注册获取 API Key 平台注册,获得身份验证密钥
2. 查阅 API 文档 了解端点、参数(模型名/提示词/温度/最大长度)
3. 构建 HTTP 请求 requests 等库,Key 放 Header,提示词放 JSON 请求体
4. 发送并处理响应 解析 JSON,提取生成文本
5.2 本地部署(数据安全/离线)

把开源 LLM(Llama、ChatGLM、Qwen 等)部署在自己硬件上------下载权重,用推理框架加载运行,再按类似 API 的方式交互。

典型流程

步骤 做法
1. 获取模型 Hugging Face(国外)、魔搭社区(国内)下载权重
2. 准备环境 NVIDIA GPU + 驱动 + 推理框架
3. 选推理框架 见下表
4. 启动服务 本地 API 服务器(如 http://localhost:8000),像云端 API 一样调用
推理框架 特点
vLLM 高吞吐量推理,性能极佳
TGI Hugging Face 出品,功能全面
Ollama 一键拉取运行,小白友好
LM Studio 图形化界面,像用软件一样跑模型

以 Ollama 为例

① 下载 :官方地址 Ollama

② 拉取模型

事项 说明
默认存储路径 C:\Users\XXX\.ollama
改路径方式一 配置环境变量 OLLAMA_MODELS = ${自定义路径}
改路径方式二 Ollama 界面设置
查找模型 Ollama
下载并运行 ollama run deepseek-r1:1.5b
5.3 SDK 接入(API 的封装)

本质上是对 API 的封装简化------官方 SDK 封装底层 HTTP 细节,提供符合编程习惯的函数库。

cpp 复制代码
pip install openai



from openai import OpenAI
client = OpenAI(api_key="your-api-key")
response = client.responses.create(
    model="gpt-5",
    input="介绍一下你自己。"
)
print(response.output_text)

六、嵌入式模型

6.1 认识嵌入模型

先区分两类模型:

模型 目标
大语言模型(生成式) 理解输入并生成新文本(回答问题、写文章)。内部也使用嵌入技术,但目标是"创造"
嵌入模型(表示式) 不生成文本 ,而是为输入创建富含语义的数值表示(向量)

嵌入(Embedding)的核心思想 :计算机擅长数字,但不理解文字、图片 。嵌入就是把人类符号(单词、句子、产品、用户、图片)转换成数字列表(向量) ,并且保留原始语义和关系 ------相当于把人类语言**"翻译"成计算机的"数学语言"**。

关键结论 :既然是"数学语言",就能用数学方式比较向量 (相似度),从而实现"度量语义"

6.2 嵌入模型的应用场景

① 语义搜索(Semantic Search)

方式 原理 优势
传统搜索 关键词匹配 简单直接
语义搜索 查询和文档都转成向量,算相似度 即使没有确切关键词也能检索到

② 检索增强生成(RAG)------ 当前 LLM 应用的核心模式

环节 说明
用户提问 例如"今年新增的带薪育儿假政策具体怎样"
语义搜索 嵌入模型在知识库(人事制度文档、福利备忘录)中找到相关条款
交给 LLM 将【条款】+【问题】一起提交,生成准确具体的摘要

好处 :答案准确且时效性强(解决知识陈旧问题),而不是凭训练数据"瞎编"。

③ 推荐系统

原理 :用户和物品都转成向量------喜欢相似物品的用户向量接近,相似物品的向量也接近,算相似度即可精准推荐。

案例 :用户 A 喜欢《盗梦空间》《黑镜》,系统发现与"也喜欢这两部"的用户向量很接近,而这些用户普遍还喜欢《星际穿越》------尽管 A 从没看过,系统仍会推荐它。

④ 异常检测

原理正常数据的向量聚集在一起 ;新数据向量远离聚集区 = 可能是异常点(垃圾邮件、欺诈交易)。

案例 :信用卡反欺诈------海量正常交易的向量形成"正常聚集区",当一笔高额异地交易出现,向量落在聚集区外,系统自动标记为潜在欺诈并告警


七、复盘(附答案)

💡 思考题

  1. 什么是模型?为什么说"模型是一套从数据中学到的规则",而不是人为写死的程序?

  2. 大语言模型与"传统小模型"最核心的区别有哪些?(提示:规模、通用性、训练方式、交互方式)

  3. 为什么"自监督学习"能在不需要人工标注的情况下学会语言规律?请用"完形填空"比喻解释。

  4. 提示词为什么重要?"少样本提示"和"零样本链式思考(Zero-shot-CoT)"分别靠什么提升效果?

  5. LLM 的三种接入方式(API / 本地部署 / SDK)各适合什么场景?嵌入模型如何实现"语义搜索",RAG 又为什么能解决知识陈旧?

📝 答案

  1. 模型是从数据中学习规律的"数学函数" 。训练师给它看海量例子,它自己摸索出规则 ,而不是程序员手写规则。学成后给新输入,它能根据学到的规律预测输出------所以模型本质是"学出来的规则/模式"。

  2. 四点区别:规模巨大 (参数数十亿到万亿级);通用性强 (学到语言底层规律,能举一反三、涌现多种能力);训练方式不同 (自监督学习,无标注自学,不依赖人工标注);交互方式革命(自然语言 Prompt 直接对话,不用写代码)。

  3. 自监督学习 = "完形填空" :模型面对海量无标签文本,自己给自己创造任务 ------遮住一个词、根据上下文预测它。亿万次练习后,深刻学会语法、词汇搭配与逻辑,因此不需要人工标注,自己就能当自己的老师。

  4. 提示词是模型理解需求的唯一通道,"清晰、具体、无歧义"才能得到高质量输出少样本提示 给一两个"输入-输出"示例,让模型照葫芦画瓢、隐式传递格式规则零样本链式思考 在末尾加"请一步步推理",强制模型先生成有序推理过程再作答,显著提升逻辑题正确率。

  5. API :最主流,适合快速开发、不想管理硬件;本地部署 :适合数据敏感、需离线/高性能场景(vLLM/TGI/Ollama 等框架);SDK :本质是 API 封装,代码更符合编程习惯。嵌入模型把文本转成向量,用相似度做语义匹配 ------没有确切关键词也能检索到;RAG 先检索知识库相关内容、再连同问题交给 LLM,注入实时外部知识,从而解决训练数据过时的问题。


🎯 闭幕

从"模型是什么"到"大语言模型",从"提示词工程"到"LLM 接入方式",再到"嵌入模型与 RAG"------这一篇帮你把大模型的入门地图走了一遍

如果本文对你有帮助,欢迎:

👍 点赞 | ⭐ 收藏 | 👤 关注作者 | 💬 留言交流你的疑问或补充

你的每一次互动都是我继续更新的动力,我们下一篇见!🚀

相关推荐
牧羊人.33313 分钟前
计算机视觉基础 第13章 |背景建模与运动目标检测
图像处理·人工智能·目标检测·计算机视觉·目标跟踪
卷无止境13 分钟前
SIE:当一个推理引擎决定把100多个模型装进一个集群里
人工智能·python
阳明山水16 分钟前
概念漂移分类与自适应策略解析
人工智能·深度学习·算法·机器学习·架构
狂师17 分钟前
AI 测试提效 | 别搞万能 Skill,推荐5 个 Agent Skill 串起 UI 自动化执行到报告生成全流程
人工智能·agent·测试
动物园猫19 分钟前
超市空货架目标检测数据集:1,500张图像 | 目标检测
人工智能·目标检测·计算机视觉
IvanCodes20 分钟前
Python 基础语法(四):循环结构与流程控制
开发语言·python
卷无止境20 分钟前
Orca:当五个AI程序员同时给你打工
人工智能·python
王的宝库24 分钟前
【无标题】
笔记·restful
晴天1624 分钟前
操作系统开发入门-Day34
人工智能