基础演进:OpenAI 代表模型
OpenAI 标志性迭代节点:
- 2022 年 11 月:GPT-3.5,引爆大众 AI 热潮
- 2023 年 3 月:GPT-4 ,大幅提升逻辑、多模态能力 配套在线工具:
platform.openai.com/tokenizer(官方 Tokenizer 在线分词工具,可实时统计文本 Token 数量)
一、顶层基础:LLM 大语言模型
定义
LLM = Large Language Model,大语言模型,是当前生成式 AI 的核心载体,底层依托Transformer架构,依靠自注意力机制理解文字逻辑、自主生成文本。
分层训练流程(补充进阶)
- 预训练 Pre-training:使用全网海量通用文本训练,学习语法、常识、基础逻辑,赋予模型通用语言能力;
- 监督微调 SFT:人工标注标准问答数据,让模型学会贴合人类对话习惯;
- RLHF 人类反馈强化学习:人工打分优化模型输出,规避有害内容、减少编造、对齐人类偏好。
分类拓展
- 狭义 LLM:仅支持纯文本输入输出;
- 多模态大模型(Multi-Modal LLM):如 GPT-4V、Gemini,额外支持图片、音频、视频,多媒体内容会统一转成 Token 计算消耗。
二、文本最小单元:Token & Tokenizer
1. Token
核心定义 :大模型处理所有文本、多媒体内容的最基础单位,是模型唯一能识别的数据颗粒。
字符换算标准
- 英文:1 Token ≈ 0.75 个英文单词;长短单词、词根、标点会被拆分;
- 中文:1 Token ≈ 1.5~2 个汉字;常用成语、双字词会合并,生僻字、特殊符号单独占用 1 个 Token;
- 总量参考:40 万 Token ≈ 60~80 万汉字 / 30 万英文单词。
业务影响
主流厂商(OpenAI、国内各大模型)按 Token 计费,输入提问、AI 输出回答均会消耗 Token,Token 越多调用成本越高。
2. Tokenizer 分词器
核心定义:负责「人类可读文字 ↔ 模型数字 Token」双向编码、解码的工具。
- 编码:把句子切割、转换为数字序列,送入模型运算;
- 解码:将模型输出的数字序列还原成正常文字。
配套工具
- 在线工具:
platform.openai.com/tokenizerOpenAI 官方在线分词器,实时统计文本 Token 数量; - 本地工具:
tiktokenOpenAI 开源 Python 库,开发时本地精准计算 Token 消耗。
特殊 Token
内置控制标记(<|system|>、<|end_of_text|>等),用于区分系统指令、文本结尾,同样占用上下文额度。
三、模型短期记忆:Context & Context Window
1. Context 上下文
核心定义 :大模型单次任务过程中,接收的全部信息总和,等同于模型的短期临时记忆。 包含内容:System 系统指令、全部历史对话、参考文档、用户当前提问、工具返回结果。
2. Context Window 上下文窗口
核心定义 :Context 能够承载的最大 Token 上限,是模型记忆容量的硬性限制。超过上限会触发截断,丢失早期信息。
主流超大窗口模型容量
表格
| 模型 | 上下文窗口上限 |
|---|---|
| GPT-5.4 | 105 万 Token |
| Gemini 3.1 Pro | 100 万 Token |
| Claude Opus 4.6 | 100 万 Token |
关键进阶知识点
- 输入 Token / 输出 Token
- Input Token:所有前置上下文 + 用户提问,占用窗口容量;
- Output Token:AI 生成的回复内容,既占窗口,也单独计费。
- 截断机制(滑动窗口) 总 Token 超出窗口上限时,模型自动丢弃最早的历史消息,只保留最新对话;长文档场景会丢失前文信息。
- 两种窗口解决方案
- 原生长上下文:百万 Token 原生模型,可直接上传整本合同、完整代码库;
- RAG 检索增强:中小窗口模型搭配知识库检索,不用把全文塞进上下文,规避容量限制,工业落地主流方案。
四、指令交互体系:Prompt 提示词 & 提示词工程
Prompt 核心定义
用户 / 系统下发给大模型的全部指令、问题、约束条件,是驱动模型输出结果的入口,分为两大基础分类:
- System Prompt 系统提示词(后台配置) 预设底层规则,定义 AI 人设、输出规范、禁止行为,全局永久生效,优先级最高,用户不可修改。 示例:
你是专业Java架构师,输出必须提供完整可运行代码,禁止空话。 - User Prompt 用户提示词(用户输入) 用户实时输入的具体需求、提问、任务。
完整三层 Prompt 分层(进阶补充)
除系统 / 用户提示词外,工程中常用 Few-shot 少样本提示词:给模型提供多条标准答案范例,强制统一输出格式、逻辑标准。
Prompt Engineering 提示词工程
通过优化指令写法、增加约束、搭配参数,系统性提升模型输出质量的技术体系,核心常用技巧:
- 角色定义:限定 AI 身份与专业领域;
- 格式约束:强制 JSON/Markdown/ 表格结构化输出;
- CoT 思维链:引导模型分步推理,减少逻辑错误;
- 负面约束:明确禁止编造、冗余、违规内容;
- ToT 思维树、工具专用 Prompt:引导模型自主判断是否调用外部工具。
配套生成参数(提示词调参补充)
- Temperature 温度:0 = 严谨客观、低创造力;1 = 发散有创意;大于 1 易逻辑混乱;
- Top-P/Top-K:限制 AI 选词范围,配合温度控制回答随机性;
五、工具与智能体体系:Tool / MCP / Agent / Agent Skill
1. Tool 工具函数
核心定义:大模型对接外部真实世界的可调用函数,弥补模型静态知识、能力边界缺陷,让模型脱离纯文本限制。 工具细分类型:
- 检索类:联网搜索、知识库向量查询(RAG 核心工具);
- 计算类:计算器、SQL 数据库查询、数据统计;
- 操作类:文件读写、第三方系统接口调用;
- 多媒体类:文生图、语音转文字、视频解析。
2. MCP(Model Context Protocol 模型上下文协议)
核心定义:统一所有工具接入格式的标准协议。 解决痛点:不同厂商大模型(GPT、文心、通义等)原生工具调用语法不兼容,一套工具需要多套适配代码;MCP 标准化入参、返回值、调用流程,一套工具可对接全部兼容模型。
3. Agent AI 智能体
核心定义:具备自主思考、任务规划能力的程序,不局限单次问答,能自动拆解复杂任务、循环调用工具,直到完整解决用户需求。
Agent 标准工作循环
- 读取上下文 + 工具 Skill 说明文档;
- 拆解复杂需求为多步子任务;
- 自主判断:是否需要调用 Tool、调用哪一个 Tool;
- 通过 MCP 协议发起工具调用,获取外部数据;
- 整合工具结果生成答案;信息不足则重复调用工具。
衍生拓展:Multi-Agent 多智能体
多个分工不同的 Agent 协同工作(检索 Agent、代码 Agent、写作 Agent),处理企业级超复杂业务流程。
4. Agent Skill 智能体技能文档
核心定义:给 Agent 阅读的工具自然语言说明书,描述工具功能、入参含义、使用场景、限制条件;模型依靠 Skill 理解工具能力,自主触发调用。
六、工程落地高频衍生术语
1. RAG 检索增强生成
解决两大痛点:上下文窗口容量有限、大模型知识存在时效性滞后。 工作逻辑:用户提问后,先从私有知识库检索相关片段,仅把少量关联内容送入上下文,大幅降低 Token 消耗,减少模型编造内容。
2. Hallucination 模型幻觉
大模型天然缺陷:无依据编造虚假数据、案例、专业内容;可通过 RAG 检索、强约束 Prompt、接入工具查询缓解。
3. Embedding 向量嵌入
将文本、文档转换为数字向量的技术,是 RAG 知识库检索、文本相似度匹配的底层核心组件。
4. Self-Attention 自注意力机制
Transformer 架构的核心内核,让模型能够关联文本前后文字,理解长句、复杂上下文逻辑,是 LLM 拥有语言理解能力的根本。
七、全术语速查总表
| 术语 | 完整释义 |
|---|---|
| LLM | 大语言模型,基于 Transformer 架构的文本生成 AI |
| Token | 大模型处理数据的最小基础单位,计费、上下文容量统计单位 |
| Tokenizer | 分词器,实现文字与 Token 互相编码解码 |
| Context | 单次对话模型接收的全部信息,短期记忆 |
| Context Window | 上下文最大 Token 承载上限,模型记忆容量 |
| Prompt | 发给模型的指令,分为 System 系统、User 用户、Few-shot 少样本三类 |
| Prompt Engineering | 提示词工程,优化指令提升模型输出效果的技术 |
| Tool | 模型调用外部能力的函数,拓展模型边界 |
| MCP | 模型上下文协议,统一工具接入的标准化接口 |
| Agent | 自主规划、循环调用工具完成复杂任务的智能体程序 |
| Agent Skill | 给 Agent 阅读的工具使用说明文档 |
| Transformer | LLM 底层核心架构,核心是自注意力机制 |
| Self-Attention | 自注意力,让模型理解上下文逻辑 |
| Pre-training/SFT/RLHF | 大模型三阶段完整训练流程 |
| Multi-Modal | 多模态大模型,支持图文音视频输入 |
| RAG | 检索增强生成,外接私有知识库突破窗口限制 |
| Hallucination | 模型幻觉,AI 编造虚假信息的现象 |
| Temperature | 生成参数,控制回答严谨 / 创意程度 |
| Embedding | 文本向量化技术,用于知识库检索匹配 |
| Multi-Agent | 多智能体,多个 Agent 分工协同处理复杂业务 |
