前面20篇文章已经将aiAgent所有的东西都讲了一遍,从最基础的概念到最后的langGraph,还有监控软件、关系型数据库,对象型数据库,向量数据库。作为一名前端转ai agent的开发者,你不但要会做前端页面,还得会写后端代码,知道每一个工具背后的价值和存在的意义。
接下来我就将所有ai agent里面遇到的名字归纳总结一下:
AI 领域的核心概念从底层到顶层逐层拆解
① LLM(大语言模型)
- 本质是一个概率预测机器 ,基于
Transformer架构(2017年提出) - 核心工作方式 = "文字接龙" :根据已有内容预测下一个 Token,循环直到完成
- 输入输出都是数字(
Token ID),所有回答是一个Token一个Token生成的 - 局限:只会产生文本,无法联网、计算或操作文件
② Token(词元)
- LLM 处理文本的最小离散单位 ,由
Tokenizer通过BPE算法将文字编码为Token ID - ≠ 一个字 ≠ 一个词 :中文约
1~2个汉字,英文约0.75个单词 - 不同模型的
Tokenizer切分规则不同,同一段文本在不同模型中的Token数不同 - 是计费和长度限制的基本单位 ,输入
Token通常比输出Token贵,所以skill就显得很重要
③ Context & Context Window(上下文 / 上下文窗口)
- Context = 模型本轮"看到"的全部信息总和 =
System Prompt+ 历史对话 +User Prompt+ 工具返回结果 → 相当于临时记忆 - 关键认知:模型没有真正的记忆,每次都把历史对话重新发给它
- Context Window = 一次最多能处理的
Token数(如8K / 128K / 1M+) - 超长文本解决方案:RAG(检索增强生成) ------不塞全文,只取相关片段
④ Prompt(提示词)
- User Prompt:用户直接输入的问题或指令
- System Prompt:开发者预设的"人设/规则/输出格式",在对话开始时注入
- 好的
Prompt要清晰、具体、明确 → 提示词工程(Prompt Engineering) - 趋势:随着模型能力增强,模糊
Prompt也能被较好理解
⑤ Tool(工具)
- 赋予模型感知和影响外部世界的能力(搜索网页、计算、操作文件、查询位置天气等)
- 模型负责选择和生成指令,平台负责执行调用
- 类似给"大脑"装上了"手和脚"
⑥ MCP(Model Context Protocol,模型上下文协议)
- 大模型统一接入工具的协议 ------解决不同
AI平台重复适配工具的问题 - 类比手机的 Type-C 接口:工具按标准开发一次,多平台通用
- 包含
Tools、Resources、Prompts三类能力 - 比如一个
tool,在千问上能用,在chatGTP上也能用
⑦ Agent(智能体)
- 能自主规划、连续调用多个工具直到完成复杂任务的智能程序
- 核心特征:自主规划 + 循环决策(观察→思考→执行→再观察)
- 经典示例:用户问"帮我查天气和附近卖雨伞的店" →
Agent自动定位→查天气→搜索店铺→汇总输出 - 常见构建模式:
ReAct、Plan and Execute、Reflection、Multi-Agent
⑧ Agent Skill(智能体技能)
-
本质 = 提前写好、塞给
Agent的一份Markdown说明文档(SOP) -
两层结构:
- 元数据层 :
Name + Description(供系统判断何时调用) - 指令层:目标、执行步骤、判断规则、输出格式、示例
- 元数据层 :
-
核心机制 :渐进式披露(
Progressive Disclosure)------不相关时不占 Token,需要时再展开 -
存放规范(以
Claude Code为例):~/.claude/skills/go-out-checklist/SKILL.md
💡 核心洞见
| 类比 | 含义 |
|---|---|
| LLM 是发动机 | 一切能力的核心引擎 |
| Token 是燃料单位 | 文本处理的最小颗粒度 |
| Context 是燃料舱 | 临时记忆空间 |
| Prompt 是油门指令 | 告诉模型做什么 |
| Tool 是外挂机械臂 | 触达外部世界 |
| MCP 是 Type-C 接口 | 统一接入标准 |
| Agent 是能自己开车的司机 | 自主规划+执行 |
| Skill 是开车手册 | 沉淀为可复用的经验 |

最终结论 :理解这条链路后,再看 ChatGPT / Claude / Cursor / Claude Code 等产品,本质都在这个框架下运作------AI 不是魔法,是一层一层搭起来的工程概念。
