Agent & AI 名词大扫盲

文章目录

    • [1. 为什么需要这场"名词大扫盲"](#1. 为什么需要这场“名词大扫盲”)
    • [2. 第一层:AI 的"家谱"](#2. 第一层:AI 的“家谱”)
      • [2.1 AI(Artificial Intelligence,人工智能)](#2.1 AI(Artificial Intelligence,人工智能))
      • [2.2 机器学习(Machine Learning,ML)](#2.2 机器学习(Machine Learning,ML))
      • [2.3 深度学习(Deep Learning,DL)](#2.3 深度学习(Deep Learning,DL))
    • [3. 第二层:大模型相关名词](#3. 第二层:大模型相关名词)
      • [3.1 大模型 / 基座模型(Foundation Model)](#3.1 大模型 / 基座模型(Foundation Model))
      • [3.2 LLM(Large Language Model,大语言模型)](#3.2 LLM(Large Language Model,大语言模型))
      • [3.3 多模态模型(Multimodal Model)](#3.3 多模态模型(Multimodal Model))
      • [3.4 Transformer](#3.4 Transformer)
      • [3.5 Token(词元)](#3.5 Token(词元))
      • [3.6 Prompt(提示词)](#3.6 Prompt(提示词))
      • [3.7 上下文窗口(Context Window)](#3.7 上下文窗口(Context Window))
      • [3.8 幻觉(Hallucination)](#3.8 幻觉(Hallucination))
    • [4. 第三层:Agent 相关名词](#4. 第三层:Agent 相关名词)
      • [4.1 什么是 Agent(智能体)](#4.1 什么是 Agent(智能体))
      • [4.2 LLM 与 Agent 的关系](#4.2 LLM 与 Agent 的关系)
      • [4.3 Function Calling / Tool Calling(函数调用 / 工具调用)](#4.3 Function Calling / Tool Calling(函数调用 / 工具调用))
      • [4.4 RAG(Retrieval-Augmented Generation,检索增强生成)](#4.4 RAG(Retrieval-Augmented Generation,检索增强生成))
      • [4.5 多 Agent(Multi-Agent)](#4.5 多 Agent(Multi-Agent))
      • [4.6 Agent 工作流 / 编排(Orchestration)](#4.6 Agent 工作流 / 编排(Orchestration))
    • [5. 第四层:常见易混名词辨析](#5. 第四层:常见易混名词辨析)
      • [5.1 AIGC(AI Generated Content,人工智能生成内容)](#5.1 AIGC(AI Generated Content,人工智能生成内容))
      • [5.2 AGI(Artificial General Intelligence,通用人工智能)](#5.2 AGI(Artificial General Intelligence,通用人工智能))
      • [5.3 微调(Fine-Tuning)](#5.3 微调(Fine-Tuning))
      • [5.4 预训练 / 后训练 / 推理(Inference)](#5.4 预训练 / 后训练 / 推理(Inference))
      • [5.5 向量数据库(Vector Database)](#5.5 向量数据库(Vector Database))
      • [5.6 嵌入 / Embedding](#5.6 嵌入 / Embedding)
      • [5.7 对齐(Alignment)](#5.7 对齐(Alignment))
      • [5.8 温度 / Temperature](#5.8 温度 / Temperature)
    • [6. 一张表快速回顾](#6. 一张表快速回顾)
    • [7. 总结](#7. 总结)

1. 为什么需要这场"名词大扫盲"

过去一年,AI 领域的新词层出不穷:大模型、Agent、RAG、Prompt、微调、多模态、AGI......技术博客天天讨论,产品发布会轮番轰炸,运营号也总在说"我们接入了大模型""我们上了 Agent",但很多读者其实对这些词只有模糊的印象,甚至把几个概念混为一谈。

一个很典型的场景是:同事说"我们用 RAG 做知识库问答",你可能只知道它"跟 AI 有关";面试官问"Agent 和普通大模型应用有什么区别",你可能能说出一两句,却讲不清边界;看到"AGI 要来了"的标题党,你也不确定该不该焦虑。

这篇文章不堆公式、不讲论文,只做一件事:用最直白的语言,把 Agent 和 AI 领域的核心名词逐个讲清楚

我们会把这些词分四层来拆:

  1. 第一层:AI 的"家谱",先搞懂 AI、机器学习、深度学习、大模型之间到底是什么关系;
  2. 第二层:大模型相关名词,理解 Token、Prompt、上下文窗口、幻觉这些日常使用中的高频词;
  3. 第三层:Agent 相关名词,重点讲 Agent、工具调用、RAG、多 Agent、编排;
  4. 第四层:常见易混名词辨析,把 AIGC、AGI、微调、推理、向量数据库、Embedding、对齐、温度等容易混淆的词放在一起对比。

读完以后,你至少能听懂别人在聊什么,也能在选型、学习和面试时少踩坑。

2. 第一层:AI 的"家谱"

先建立一张概念地图,后面的名词都能挂在上面。
#mermaid-svg-VFCuAegcpgWZLQuE{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-VFCuAegcpgWZLQuE .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-VFCuAegcpgWZLQuE .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-VFCuAegcpgWZLQuE .error-icon{fill:#552222;}#mermaid-svg-VFCuAegcpgWZLQuE .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-VFCuAegcpgWZLQuE .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-VFCuAegcpgWZLQuE .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-VFCuAegcpgWZLQuE .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-VFCuAegcpgWZLQuE .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-VFCuAegcpgWZLQuE .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-VFCuAegcpgWZLQuE .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-VFCuAegcpgWZLQuE .marker{fill:#333333;stroke:#333333;}#mermaid-svg-VFCuAegcpgWZLQuE .marker.cross{stroke:#333333;}#mermaid-svg-VFCuAegcpgWZLQuE svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-VFCuAegcpgWZLQuE p{margin:0;}#mermaid-svg-VFCuAegcpgWZLQuE .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-VFCuAegcpgWZLQuE .cluster-label text{fill:#333;}#mermaid-svg-VFCuAegcpgWZLQuE .cluster-label span{color:#333;}#mermaid-svg-VFCuAegcpgWZLQuE .cluster-label span p{background-color:transparent;}#mermaid-svg-VFCuAegcpgWZLQuE .label text,#mermaid-svg-VFCuAegcpgWZLQuE span{fill:#333;color:#333;}#mermaid-svg-VFCuAegcpgWZLQuE .node rect,#mermaid-svg-VFCuAegcpgWZLQuE .node circle,#mermaid-svg-VFCuAegcpgWZLQuE .node ellipse,#mermaid-svg-VFCuAegcpgWZLQuE .node polygon,#mermaid-svg-VFCuAegcpgWZLQuE .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-VFCuAegcpgWZLQuE .rough-node .label text,#mermaid-svg-VFCuAegcpgWZLQuE .node .label text,#mermaid-svg-VFCuAegcpgWZLQuE .image-shape .label,#mermaid-svg-VFCuAegcpgWZLQuE .icon-shape .label{text-anchor:middle;}#mermaid-svg-VFCuAegcpgWZLQuE .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-VFCuAegcpgWZLQuE .rough-node .label,#mermaid-svg-VFCuAegcpgWZLQuE .node .label,#mermaid-svg-VFCuAegcpgWZLQuE .image-shape .label,#mermaid-svg-VFCuAegcpgWZLQuE .icon-shape .label{text-align:center;}#mermaid-svg-VFCuAegcpgWZLQuE .node.clickable{cursor:pointer;}#mermaid-svg-VFCuAegcpgWZLQuE .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-VFCuAegcpgWZLQuE .arrowheadPath{fill:#333333;}#mermaid-svg-VFCuAegcpgWZLQuE .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-VFCuAegcpgWZLQuE .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-VFCuAegcpgWZLQuE .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-VFCuAegcpgWZLQuE .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-VFCuAegcpgWZLQuE .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-VFCuAegcpgWZLQuE .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-VFCuAegcpgWZLQuE .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-VFCuAegcpgWZLQuE .cluster text{fill:#333;}#mermaid-svg-VFCuAegcpgWZLQuE .cluster span{color:#333;}#mermaid-svg-VFCuAegcpgWZLQuE div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-VFCuAegcpgWZLQuE .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-VFCuAegcpgWZLQuE rect.text{fill:none;stroke-width:0;}#mermaid-svg-VFCuAegcpgWZLQuE .icon-shape,#mermaid-svg-VFCuAegcpgWZLQuE .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-VFCuAegcpgWZLQuE .icon-shape p,#mermaid-svg-VFCuAegcpgWZLQuE .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-VFCuAegcpgWZLQuE .icon-shape .label rect,#mermaid-svg-VFCuAegcpgWZLQuE .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-VFCuAegcpgWZLQuE .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-VFCuAegcpgWZLQuE .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-VFCuAegcpgWZLQuE :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} AI(人工智能)
机器学习(ML)
深度学习(DL)
大模型 / LLM
Agent / 智能体

这张图可以这样理解:下面的每一项都属于上面那一项。AI 的范围最广,机器学习是 AI 的一种实现方式,深度学习是机器学习的一种方法,大模型通常又建立在深度学习之上。

2.1 AI(Artificial Intelligence,人工智能)

最上层的总称,指"让机器表现出类似人类的智能"。这个概念从 1956 年达特茅斯会议正式提出,范围非常宽:下棋、语音识别、图像分类、写代码、自动驾驶,都算 AI。

这里要破除一个误区:AI 不等于"机器人"。扫地机器人、聊天机器人只是 AI 的一种载体,AI 更核心的是背后的算法和模型。你手机里的语音助手、购物软件的推荐系统、地图的路线规划,背后都有 AI。

所以不要一听到 AI 就觉得它必须像"人一样思考"。很多 AI 只是在某个具体任务上做得比人快、比人稳,比如识别一张图里有没有猫,或者从一万篇文档里快速找到最相关的一段。

2.2 机器学习(Machine Learning,ML)

AI 的一个子集。传统程序是"人写规则,机器执行",而机器学习是人给数据,机器自己从数据里学出规则

打个比方:

  • 传统程序像是老师把每道题的解法一条条写下来,学生照着做;
  • 机器学习像是老师只给学生看大量例题和答案,学生自己总结规律,以后遇到新题也能做。

比如垃圾邮件分类,传统做法可能要写一大串规则:"包含'中奖'二字算垃圾""包含某个发件人算垃圾"。但垃圾邮件的花样天天变,规则很快就失效。机器学习的做法是:喂给模型大量"垃圾/非垃圾"邮件,它自己会找到那些隐含的信号,比如某些词汇组合、发送频率、链接特征等。

常见的机器学习任务包括:

  • 分类:这封邮件是垃圾还是正常?
  • 回归:预测明天的房价是多少?
  • 聚类:把用户分成几个兴趣群体?
  • 推荐:这个用户可能喜欢哪件商品?

2.3 深度学习(Deep Learning,DL)

机器学习的子集,核心是多层神经网络。层数多、参数规模大,表达能力就更强,适合处理图像、语音、文本这类复杂数据。

通俗理解:机器学习里,很多方法需要人先"手工挑特征",比如判断一只动物是不是猫,先让专家告诉程序要看耳朵、胡须、尾巴。而深度学习能自己从原始数据里一层层抽象出特征:第一层可能识别边缘和颜色,第二层识别眼睛、耳朵,第三层识别整张猫脸。

这个"层"就是神经网络里的层。层越多,能学到的模式就越复杂。今天我们看到的大模型,底层基本都是深度学习,而且模型规模巨大,所以训练时需要大量算力和数据。

一句话概括:AI ⊃ 机器学习 ⊃ 深度学习 ⊃ 大模型

3. 第二层:大模型相关名词

3.1 大模型 / 基座模型(Foundation Model)

在超大规模数据上预训练出来的通用模型。它的特点是"什么都会一点":能写作、能翻译、能写代码。ChatGPT 背后的 GPT 系列、文心一言、通义千问都属此类。

为什么叫"基座模型"?因为它像一个"半成品底座":已经学过了海量文本,具备通用的语言理解和生成能力,但未必擅长你的具体业务。你可以在这个基座上继续微调,或者通过 Prompt、RAG 等方式让它适配你的场景。

理解这个"预训练"很重要:大模型不是在回答你问题时才现学,而是在发布之前,已经用几千亿 Token 的文本"读过"了很大一部分互联网。你问它问题时,它是根据已经学到的知识来生成答案。

3.2 LLM(Large Language Model,大语言模型)

专门处理文本的大模型。GPT、Llama、Qwen、DeepSeek 等都是 LLM。LLM 是大模型中最主流的一类,日常说的"大模型"多数时候就是指 LLM。

严格来说,"大模型"的范围更大,除了语言模型,还有图像大模型、视频大模型、语音大模型等。但因为我们最常跟文本模型打交道,所以两个词经常被混用。你在看资料时只需要记住:LLM 一定是大模型,但大模型不一定是 LLM

LLM 的核心能力不是"搜索答案",而是"预测下一个 Token"。它生成文字时,本质上是在回答"这段话后面最可能接什么"。正因为整个过程是概率式的,所以它既可能很聪明,也可能出现后面要讲的"幻觉"。

3.3 多模态模型(Multimodal Model)

能同时处理多种数据类型的模型,比如文本 + 图片 + 音频 + 视频。GPT-4o、Gemini 都属于多模态,你发一张截图让它解读,就是多模态能力在起作用。

"模态"可以理解为信息的形式。文本是一种模态,图片是另一种。传统模型往往只擅长一种输入,而多模态模型可以把不同模态的信息放到同一个"理解空间"里,例如看到一张表格截图,直接输出分析结论;听到一段语音,直接整理成会议纪要。

多模态模型的价值在于更接近人类的感知方式:我们理解世界不是只看文字,而是眼睛、耳朵一起上。产品层面,多模态也极大扩展了 AI 的应用场景,从纯文本问答走向"看懂图片、听懂语音、看懂视频"。

3.4 Transformer

一种神经网络架构,2017 年由 Google 在论文《Attention Is All You Need》中提出,是目前几乎所有大模型的底座。它最大的贡献是并行处理能力强,并且靠"注意力机制"高效捕捉长文本里的关联。

普通人不一定需要懂 Transformer 的数学细节,但可以记住两个关键词:

  1. 注意力机制(Attention):模型能"知道"一句话里哪些词更应该关注。比如"小明把苹果给了小红,因为它很甜",这里的"它"指"苹果"而不是"小红",注意力机制就是帮模型建立这种关联。
  2. 并行计算:相比早期逐词处理的模型,Transformer 可以同时处理整段序列,训练效率大幅提升,这也让今天动辄几千亿参数的大模型成为可能。

你不需要会写 Transformer,但如果别人说"这个模型是基于 Transformer 的",你就能理解:它的底座是当前最主流的那套架构。

3.5 Token(词元)

模型处理文本的最小单位。一个 Token 大约对应一个英文单词,或一个汉字,或几个字符。模型并不是"一个字一个字"地读,而是把文本切成 Token 再计算。所以你会看到 API 按 Token 计费、上下文窗口按 Token 计算。

这里容易混淆的是:Token 不等于"字"。以中文为例,"我喜欢学习 AI"可能被切分成几个 Token,具体数量取决于分词方式;"ChatGPT"这个英文单词可能被拆成"Chat""G""PT"等多个 Token。不同模型的切分规则也不同。

为什么插件要关心这个?因为:

  • 计费按 Token 算,提示词越长,成本越高;
  • 上下文窗口也按 Token 算,长文本可能装不下;
  • 有些场景要估算 Token 数,才能判断该发多少内容给模型。

3.6 Prompt(提示词)

你给模型的那段输入,就是 Prompt。它可以是问题、指令或背景材料。同样一个模型,Prompt 写得好不好,结果差距巨大,这也是"提示工程(Prompt Engineering)"存在的意义。

举一个对比:

  • 差 Prompt:"写个方案。"
  • 好 Prompt:"你是资深产品经理,请为一家面向中小企业的 SaaS 公司写一份 2026 年三季度客户留存提升方案,要求包含现状分析、3 个可执行策略、成本预估和风险提示,控制在 1000 字以内。"

好的 Prompt 通常会包含:角色、任务、背景、约束、输出格式。这也是为什么很多公司招"提示词工程师",本质上是把业务需求翻译成模型最容易理解的形式。

3.7 上下文窗口(Context Window)

模型一次能"看见"多少 Token 的上限。输入 + 输出都算在里面。窗口越大,越能处理长文档、长对话,但也越贵、越慢。

举个例子:如果某个模型的上下文窗口是 128K Token,那么你发给它的文章、对话历史,加上它要生成的回复,合起来不能超过这个上限。超出的部分会被截断,模型就"记不住"了。

所以做长文档总结、多轮对话、超长代码分析时,上下文窗口是硬约束。现在虽然很多模型支持 100 万 Token 的超长窗口,但实践中仍要考虑成本、速度和注意力分散的问题。

3.8 幻觉(Hallucination)

模型一本正经地胡说八道。它不是在"故意骗人",而是生成式模型的固有特性:它擅长拼出通顺的文字,但不保证事实正确。解决幻觉的常见手段之一,就是下面要讲的 RAG。

典型的幻觉场景:你问"某公司 2026 年 Q2 财报显示营收多少",模型可能给出一个听起来很合理、实际上并不存在的数字。它不是在查资料,而是在"编一段像真的"的文字。

应对幻觉有三招:

  1. 让模型给来源:要求它引用原文或链接,方便你核对;
  2. 外挂知识库:用 RAG 先检索真实资料,再让模型基于资料回答;
  3. 重要信息人工复核:把模型输出当成"初稿",而不是最终事实。

4. 第三层:Agent 相关名词

4.1 什么是 Agent(智能体)

这是近来最火也最容易被神化的词。简单说:

Agent = 大模型 + 工具 + 自主决策。

普通的大模型用法是"一问一答":你提问,它回答。而 Agent 更进一步------它能自己规划步骤、调用工具、观察结果、再决定下一步,直到完成一个复杂目标。

举个例子:你问"帮我查一下北京明天的天气,如果不适合户外就改期到下周三"。普通对话模型会告诉你"我查不了实时天气",或者直接给个泛泛回答;而 Agent 会:

  1. 调用天气查询工具;
  2. 拿到明天的天气结果;
  3. 判断是否适合户外;
  4. 若不适合,再调用日历工具查下周三的安排;
  5. 给出最终建议。

这就是"自主决策"的差异:不是每一轮都等你下指令,而是自己拆解任务、自己找工具、自己根据执行结果调整计划。

但也要泼一盆冷水:Agent 的能力边界受制于模型本身和工具质量。如果模型推理能力不够,或者工具接口不好用,Agent 也可能在中间步骤卡住、跑偏,甚至越做越乱。所以它更适合流程相对清楚、步骤可以验证的任务,而不是完全开放式的"帮我搞定一切"。

4.2 LLM 与 Agent 的关系

LLM 是 Agent 的大脑,但不是全部。Agent 还需要:

  • 工具调用:查天气、搜网页、执行代码、读写数据库;
  • 记忆:记住对话历史、中间结果,避免重复劳动;
  • 规划:把大目标拆成小步骤,甚至随时调整计划。

所以:所有 Agent 都依赖 LLM,但不是所有 LLM 应用都是 Agent

判断一个应用是不是 Agent,可以问三个问题:

  1. 它会不会自己决定"下一步做什么"?
  2. 它会不会调用外部工具?
  3. 它会不会根据工具返回的结果调整后续动作?

如果都是"是",那它基本就是一个 Agent;如果只是"你问一句,它答一句",那还只是普通的大模型应用。

4.3 Function Calling / Tool Calling(函数调用 / 工具调用)

让模型"动手"的关键机制。开发者预先定义一批工具(比如 get_weather(city)search_web(query)),模型根据用户意图,决定要不要调用、调用哪个、传什么参数。调用完把结果塞回对话,模型再继续作答。

一个简化版流程大致是:

text 复制代码
用户输入
  ↓
模型判断:需要调用工具吗?
  ↓ 需要
模型输出:工具名 + 参数
  ↓
开发者执行工具,拿到结果
  ↓
把结果返回给模型
  ↓
模型参考结果,生成最终回答

需要注意:模型本身不直接执行代码或访问数据库。它只是"说"我要调用哪个函数、参数是什么,真正执行的是开发者的程序。因此,参数必须经过校验,尤其是涉及数据库写入、对外发送请求等危险操作时,应该加入权限控制和人工确认,避免模型"乱来"。

这是 Agent 能落地的基础能力。没有它,模型只能"说";有了它,模型才能"做"。

4.4 RAG(Retrieval-Augmented Generation,检索增强生成)

一种让模型"外挂知识库"的方法。流程是:

  1. 先从外部知识库检索相关文档片段;
  2. 把检索到的内容拼进 Prompt;
  3. 让模型基于这些资料生成回答。

好处是:能回答模型训练时没见过的最新信息、企业内部私密资料,同时大幅减少幻觉。很多企业知识库问答、智能客服都建立在 RAG 之上。

为什么 RAG 比"只靠模型自己记忆"更靠谱?因为模型的知识截止到某个训练时间点,而且不会记住你们公司内部的某个具体制度。RAG 相当于每次回答问题前,先"翻资料",再"照着资料说"。

一个典型的 RAG 问答流程是:

  1. 用户提问;
  2. 系统把问题转换成向量,去向量数据库检索最相似的文档片段;
  3. 把问题 + 检索到的片段拼进 Prompt;
  4. 模型基于这些资料生成答案,并可以标注引用来源。

4.5 多 Agent(Multi-Agent)

单个 Agent 能力有限,于是有人让多个 Agent 协作:一个负责规划,一个负责写代码,一个负责测试,一个负责审查。它们之间通过消息传递分工协作,像一个小团队。

举个例子,在一个"自动生成周报"的系统里,可以这样分工:

  • 规划 Agent:拆解任务,确定要收集哪些数据;
  • 数据 Agent:调用内部系统,拉取销售、项目、运营数据;
  • 写作 Agent:把数据整理成结构清晰的周报;
  • 审核 Agent:检查数字是否一致、语言是否得体。

典型场景包括软件开发、复杂研究任务。多 Agent 框架(如 AutoGen、CrewAI、LangGraph)就是用来编排这些角色的。

不过要提醒一句:多 Agent 并不是越多越好。每增加一个 Agent,就多一层沟通成本和出错概率,所以简单流程用单 Agent 往往更稳,只有任务真的足够复杂时,才值得上多 Agent。

4.6 Agent 工作流 / 编排(Orchestration)

用代码或框架把"调用模型、调用工具、判断分支、循环重试"串成一套可重复执行的流程。常见编排方式有链式(Chain)、图(Graph)、状态机等。

如果说单个 Agent 是"一个会思考的员工",那工作流就是"一套标准化作业流程"。它规定:先做什么、什么条件下跳到哪里、失败后重试几次、最后如何汇总结果。

常见的编排形态:

  • 链式(Chain):A 做完交给 B,B 做完交给 C,像流水线;
  • 图(Graph):有分支、有循环、有并行,像一张流程图;
  • 状态机:每个节点有明确输入输出状态,适合严格可控的业务流程。

工作中,大多数生产级 Agent 系统都不是"放一个模型自由发挥",而是用工作流把不确定性关进笼子里,保证它稳定、可控、可复现。

5. 第四层:常见易混名词辨析

5.1 AIGC(AI Generated Content,人工智能生成内容)

用 AI 生成的内容:文字、图片、音频、视频、代码。它是"结果",不是模型本身。ChatGPT 写的文章、Midjourney 画的图,都叫 AIGC。

容易混淆的是"AIGC"和"大模型":AIGC 是产出物,大模型是生产工具。就像"照片"和"相机"的关系。你让大模型写一篇文案,那篇文案就是 AIGC。

5.2 AGI(Artificial General Intelligence,通用人工智能)

指具备与人类相当的、能处理任何智力任务的通用智能。目前还没有实现,OpenAI 等公司在朝这个方向努力。简单理解:现在的 AI 是"专用选手",AGI 是"全能选手"。

现在的大模型虽然在很多任务上表现惊艳,但它们仍然不是 AGI:它们可能会在某些能力上很强,却缺乏持续学习、长期规划、与真实世界交互等通用能力。所以当你看到"AGI 已经实现"之类的说法时,要保持警惕,至少先用"它真的能像人一样处理从未见过的任意任务吗"来问一问。

5.3 微调(Fine-Tuning)

在已经训练好的大模型基础上,用特定领域的数据再训练一小段,让它更擅长某类任务。比如让通用模型更懂医疗问答、更符合某司文风。

对比:RAG 是"外挂资料",不改变模型本身;微调是"改造模型",把知识内化进权重。两者常结合使用。

什么时候选 RAG,什么时候选微调?一个简单的判断:

  • 知识更新频繁、需要可溯源 → 优先 RAG
  • 要求模型稳定地学会某种"风格"或"行为方式" → 考虑 微调
  • 两者不冲突,很多系统会"微调 + RAG"一起用。

5.4 预训练 / 后训练 / 推理(Inference)

  • 预训练:在海量数据上训练基座模型。这个阶段成本极高,动辄几千张 GPU、几个月的训练时间;
  • 后训练:包括微调、对齐(让模型更听话、更有用),可以理解为"出厂前的再加工";
  • 推理:模型训练完成后,实际用它生成结果的运行过程。你每问 ChatGPT 一次,背后就是一次推理。

打个比方:预训练像"上大学",后训练像"入职培训",推理像"正式上岗干活"。普通用户接触到的,通常只有推理这个阶段。

5.5 向量数据库(Vector Database)

专门存储和检索"向量"的数据库。文本、图片经过嵌入模型(Embedding)后变成一串数字向量,语义相近的内容向量也相近。RAG 检索时,就是在向量数据库里找"最相似的几段内容"。

为什么不能直接像普通数据库那样用关键词搜索?因为用户问法和文档写法往往不一样。比如文档里写"公司差旅报销政策",用户问"出差打车能报销吗"。关键词匹配可能命中不了,但向量检索可以理解两者语义相近,从而找到正确文档。

主流向量数据库包括 Milvus、Qdrant、Weaviate、Pinecone 等,传统的 PostgreSQL、Elasticsearch 也在逐步加入向量检索能力。

5.6 嵌入 / Embedding

把文本、图片等信息转换成高维向量的过程。它是 RAG、语义搜索、推荐系统的底层基础。

可以想象成给每段文字拍一张"语义照片",两张照片越相似,含义越接近。比如"猫"和"小猫"的向量很近,"猫"和"冰箱"的向量很远。

Embedding 本身不是数据库,也不是最终答案,它只是"把语义变成数字"这个步骤。后面再用向量数据库做检索,才能完成 RAG 的完整链路。

5.7 对齐(Alignment)

让模型的输出符合人类期望:回答问题要真实、有用、无害、不越界。RLHF(基于人类反馈的强化学习)是常见对齐方法之一。

为什么需要对齐?因为大模型在互联网文本上预训练时,不仅学到了有用的知识,也可能学到偏见、错误信息和不当表达。对齐就是通过人类反馈、规则约束等方式,把模型"掰回正轨"。

对齐是个持续的过程,它涉及价值判断,比单纯提升模型准确率要难得多。不同地区、不同产品对"什么是不越界"的标准也不同,所以现在这也是 AI 治理中最受关注的话题之一。

5.8 温度 / Temperature

控制模型输出"随机性"的参数。温度越低,答案越稳定保守;温度越高,答案越发散、有创意。写代码、做事实问答时通常设低,写诗、头脑风暴时设高。

可以用"稳"和"飘"来记:

  • 温度低 → 模型倾向选概率最高的词,输出更稳、更可预期;
  • 温度高 → 模型会更多尝试"不太常见"的词,输出更有变化、更有惊喜。

所以它没有绝对好坏,只取决于你的场景:需要准确,就调低;需要创意,就调高。

6. 一张表快速回顾

名词 一句话解释
AI 让机器表现出智能的总称
机器学习 从数据里自动学规则
深度学习 用多层神经网络学习
大模型 / LLM 海量数据预训练的通用(文本)模型
Token 模型处理文本的最小单位
Prompt 输入给模型的指令
上下文窗口 模型一次能处理的 Token 上限
幻觉 模型一本正经地乱说
Agent 大模型 + 工具 + 自主决策
Function Calling 让模型调用外部工具的机制
RAG 检索外部知识再生成答案
多 Agent 多个智能体分工协作
微调 用特定数据继续训练模型
推理 模型实际生成结果的运行过程
向量数据库 存和检索语义向量的数据库
Embedding 把语义转成向量的过程
对齐 让模型输出符合人类期望
温度 控制输出随机性的参数
AIGC AI 生成的内容
AGI 尚未实现的通用人工智能

7. 总结

这次扫盲可以归纳成一条清晰的主线:

  1. AI 是大树:机器学习、深度学习、大模型是层层递进的分支;
  2. 大模型是底座:Token、Prompt、上下文窗口、幻觉,是使用大模型时的基础概念;
  3. Agent 是大模型之上的"行动者":依靠工具调用、记忆和规划,从"会聊天"走向"能办事";
  4. RAG、微调、向量数据库是让大模型更懂"你的世界"的主流手段;
  5. AIGC 与 AGI 一个已遍地开花,一个仍是远方目标。

掌握这些名词,不是为了一显词汇量,而是为了在技术选型、产品设计和日常沟通中,真正搞清楚对方说的是什么、它能做什么、边界在哪里。下次再听到"我们上了 Agent""用 RAG 做知识库"时,你就能往下多问一句:它调用了哪些工具?知识库怎么更新?输出能不能溯源?

下一篇,我们可以挑一个具体场景,动手搭一个最小可用的 Agent。

相关推荐
iaku36 分钟前
Prompt 不是玄学:写给前端的 Prompt 工程指南
前端·人工智能
武子康38 分钟前
从 Pi 学习设计自己的 Agent Harness:一条可验证的垂直生产线
人工智能·llm·agent
HAHAXX840 分钟前
从传统RPA到AI增强RPA:内网离线部署、元素自愈与Prompt工程落地实践
人工智能·prompt·rpa
两万五千个小时40 分钟前
DeepSeek Harness 上下文压缩:长对话管理
人工智能·程序员·架构
有脚就行40 分钟前
第24篇-Go-gRPC推理服务-高性能跨语言通信
开发语言·人工智能·后端·golang
hyunbar77741 分钟前
玩转LlamaIndex:流式输出与并发执行
人工智能
哈__42 分钟前
Windows部署Next AI Draw.io:用大模型生成并修改draw.io图表
人工智能·draw.io
2301_7803567042 分钟前
【技术解码】全视通“物联数据中台”如何打通医养结合全链路?
大数据·人工智能·物联网
乔氪智造43 分钟前
21 个免费大模型入口,实测只有 9 个能用
人工智能