从 LLM 到 Agent:一篇文章课带你彻底搞懂 AI 智能体的核心逻辑

前言

最近上了一堂关于 AI Agent 的直播课,信息密度很高,把 LLM 的本质、Agent 的架构、工作流的设计思路完整串了一遍,还带了一个 Prompt 驱动的图文内容生成实战案例。

这篇文章不只是课堂笔记的整理------我还结合自己的理解,把每个概念拆开揉碎了讲,让你读完能真正理解:LLM 到底在做什么、Agent 凭什么能「干活」、以及怎么自己动手搭一个。


一、重新认识 LLM:它不是魔法,是数学

1.1 什么是 LLM

LLM(Large Language Model,大语言模型),一句话定义:一个能理解和生成自然语言的神经网络模型。

但这句话太抽象了。我们一层层拆开:

  • 「模型」 是什么?就是一份代码 + 一份权重文件。代码定义了网络结构(比如 Transformer),权重文件是一堆数字(参数量动辄几十亿到几千亿)。
  • 「大」 在哪?参数量大、训练数据量大、计算量大。GPT-4 据传有 1.76 万亿参数,训练数据超过 13 万亿 token。
  • 「语言」 为什么是语言?因为输入和输出都是自然语言文本,没有别的。

1.2 模型内部到底在干什么

很多人以为 LLM 在「思考」,其实不是。底层发生的只有一件事:高维向量空间中的矩阵运算。

整个过程分三步:

第一步:分词(Tokenization) --- 把文本切成 token。中文一个字可能是一个 token,「人工智能」可能是两个 token:「人工」+「智能」。一句话经过分词器变成一串数字 ID。

第二步:嵌入(Embedding) --- 每个 token ID 被映射到一个高维向量,比如 4096 维。这个向量的每个维度代表某种语义特征:是名词还是动词、积极还是消极、与哪些概念相关......这些都是模型在训练中自己学出来的,没人手动标注。

第三步:Transformer 计算 --- 所有 token 的向量在 Transformer 网络里经过多层计算,每一层做两件事:

  1. 自注意力(Self-Attention):让每个 token「看到」上下文中的其他 token,计算它们之间的相关性。这是 LLM 能理解语境的根源。
  2. 前馈网络(Feed-Forward Network):对每个 token 的表示做非线性变换,提取更深层的语义特征。

最后输出的,是下一个 token 的概率分布。模型做的事情就是:给定前面的文字,预测下一个最可能出现的 token。然后把这个 token 拼上去,再预测下一个......循环往复,就生成了一整段话。

核心认知:理解自然语言 = 做数字运算。 不要被「智能」两个字唬住。当然,当参数达到千亿级别时,涌现出的能力确实惊人,但底层原理始终是数学。

1.3 一个直观类比

把 LLM 想象成一个拥有几万个旋钮的收音机:

  • 训练阶段:调了几十亿次旋钮(反向传播 + 梯度下降),让收音机能收听到人类的语言频道。
  • 推理阶段:你输入一段文字(发出信号),收音机根据当前的旋钮状态调谐,输出最匹配的信号(生成文本)。

二、Agent:从「会聊天」到「能干活」

2.1 LLM 的局限

LLM 本身只是一个文本生成器,有致命缺陷:

  • 没有记忆:每次对话都是新的,上下文窗口之外的东西全忘
  • 无法行动:能告诉你「应该怎么做」,但不能实际去做
  • 不会规划:复杂任务需要拆解成多步,LLM 自己不会拆
  • 知识截止:训练数据有截止日期,不知道最新信息

2.2 Agent 的四大核心模块

Agent(智能体)就是来解决这些问题的。一个完整的 Agent 架构包含四个部分:

复制代码
┌──────────────────────────────────────┐
│              Agent 架构               │
├────────────┬─────────────────────────┤
│  🧠 LLM    │  大脑:理解和生成语言     │
│  🛠️ Tools  │  手脚:调用 API、搜索、代码 │
│  📝 Memory │  记忆:短期 + 长期记忆     │
│  📋 Planner │  规划:拆解任务、制定步骤  │
└────────────┴─────────────────────────┘

Tools(工具):Agent 可以调用外部工具来获取能力。比如:

  • 搜索引擎(获取最新信息)
  • 计算器(精确计算,不是「猜」)
  • 代码执行器(运行 Python 代码)
  • API 调用(发邮件、操作数据库)

Memory(记忆):两种记忆机制:

  • 短期记忆:当前对话的上下文窗口
  • 长期记忆:向量数据库(如 Pinecone、Milvus)存储历史交互,检索相关记忆注入当前对话

Planner(规划):把复杂任务拆成可执行的子任务。常见策略:

  • ReAct:思考(Reasoning)→ 行动(Action)→ 观察(Observation)→ 循环
  • Plan-and-Execute:先制定完整计划,再一步步执行
  • Tree of Thoughts:同时探索多条路径,选最优解

2.3 一句话总结

Agent = LLM + Tools + Memory + Planner

有了这四个组件,LLM 就能从「聊天机器人」进化成真正能「干活」的 AI 助手。


三、工作流:AI 应用的骨架

3.1 什么是工作流

工作流(Workflow)本质上就是一条 AI 流水线,把多个模型节点、工具节点、逻辑节点串联起来,数据在节点之间流转处理,最终产出结果。

类比工厂流水线:

  • 流水线上每个工位只做一件事(拧螺丝、喷漆、质检)
  • 工件从工位 A → B → C 依次流转
  • 最终产出完整产品

AI 工作流同理:节点 A 生成标题 → 节点 B 写正文 → 节点 C 配图 → 节点 D 审核 → 输出。

3.2 为什么需要工作流

单个 LLM 一把梭的问题:

  • 输出不可控:让模型一口气干太多事,质量波动大
  • 难以调试:出错了不知道卡在哪一步
  • 无法复用:每个场景都要从零写 Prompt

工作流的优势:

  • 分而治之:每个节点职责单一,好优化
  • 可观测:每个节点的输入输出都能看到,方便排查问题
  • 可复用:一个节点可以在多个工作流中重复使用
  • 可并行:独立节点可以并发执行,提高效率

3.3 一个典型的工作流结构

markdown 复制代码
开始节点(接收用户输入)
    │
    ▼
意图识别 → 约束方向(分类:养生 / 健身 / 美食 / 其他)
    │
    ▼
LLM 节点:根据方向生成核心内容(标题 + 导语 + 段落)
    │
    ▼
分支判断:需要配图吗?
    │
    ├── 需要 → LLM 生成绘画提示词 → 生图模型生成图片
    │
    └── 不需要 → 跳过
    │
    ▼
后处理节点:格式校验、敏感词过滤、字数限制
    │
    ▼
输出节点:返回最终结果

四、主流 Agent 搭建平台横评

现在不需要从零手写代码,有成熟的低代码/无代码平台可以直接拖拽搭建 Agent。

4.1 Dify(推荐新手)

  • 开源:可以私有部署,数据不出域
  • 可视化工作流编排:拖拽节点,连线即可
  • 内置 RAG 引擎:支持知识库问答,自动处理文档切分、向量化、检索
  • 丰富的工具插件:搜索、计算、代码执行、图片生成等
  • 适用场景:企业内部知识库问答、内容生成流水线、客服机器人

4.2 Coze(扣子)

  • 字节跳动出品:国内生态好,与飞书、抖音打通
  • Bot 商店:可以发布和分享自己的 Bot
  • 多模态支持:文字、图片、语音都能处理
  • 丰富的插件市场:天气、新闻、翻译等开箱即用
  • 适用场景:个人助手、社交媒体内容生成、轻量级业务自动化

4.3 FastGPT

  • 专注知识库问答:开源、轻量、部署简单
  • 支持多种 LLM:OpenAI、国产大模型都能接
  • 适用场景:文档问答、FAQ 机器人

4.4 LangChain / LangGraph(最灵活)

  • Python / JS SDK:代码级框架,灵活度最高
  • LangGraph:专为 Agent 工作流设计的图计算引擎,支持循环、分支、状态管理
  • 适用场景:复杂业务逻辑、需要高度定制的 Agent 系统
平台 上手难度 灵活度 是否开源 适合场景
Dify ⭐ 低 ⭐⭐⭐ 中 企业知识库、内容生成
Coze ⭐ 低 ⭐⭐ 中低 个人助手、社交媒体
FastGPT ⭐ 低 ⭐⭐ 中低 文档问答
LangChain ⭐⭐⭐ 高 ⭐⭐⭐⭐ 高 复杂定制化需求

五、实战拆解:一个养生内容生成 Agent 的 Prompt 工程

课上给出了一个完整案例:根据用户输入,自动生成 6 套健康养生图文内容 。这个案例的价值不在于 Prompt 本身有多长,而在于它的设计结构非常值得拆解。

5.1 角色设定

yaml 复制代码
Role: 健康养生专家
Background: 用户对中医养生理论、食物营养成分、常见疾病的预防和调理感兴趣
Profile: 精通中医养生理论,能提供个性化养生方案
Skills: 熟练运用中医理论、精通养生食品制作
Goals: 帮助用户改善健康状况,预防和调理常见疾病
Constrains: 基于中医理论和食物营养,避免未经科学验证的方法

设计要点分析:

  1. Role 精准定界:「健康养生专家」比「医生」或「营养师」更贴合需求,避免模型在「开药方」和「配食谱」之间摇摆。
  2. Profile 补充背景:告诉模型用户的画像,让它调整语言风格和专业深度。
  3. Constrains 是安全网 :明确排除未经科学验证的方法。这是 Prompt 工程中非常重要但经常被忽略的一环------告诉模型不能做什么,往往比告诉它要做什么更重要。
  4. Skills 关联能力:Skills 不是装饰,它暗示模型应该调用哪方面的知识------中医理论 + 食品制作,两条知识线并行。

5.2 生成规则

markdown 复制代码
1. 充分理解用户输入的意图
2. 生成主标题(5-10 字)如「煮苹果水」
3. 生成导语(有温度、有吸引力)
4. 生成 3-5 个副标题(序号开头,多样化不重复)
5. 每个副标题包含:食材 + 做法 + 功效 + 建议
6. 为食材生成 AI 绘画提示词(纯白背景、俯视拍摄)

设计要点:

  • 字数限制很关键:标题 5-10 字。不加这个约束,模型可能写出「苹果红枣枸杞养生水------传统中医食疗方法」这种又长又空洞的标题。越具体的约束,输出质量越高。
  • 导语有温度:不是机械的「下面介绍......」,而是有人情味的引导。这是区分「可用内容」和「好内容」的细节。
  • 每个副标题自成闭环:食材 → 做法 → 功效 → 建议,四要素齐全。用户不需要额外查资料,一段内容就是一份完整的攻略。
  • 绘画提示词联动食材 :食材内容直接驱动图片生成提示词,「纯白背景 + 俯视拍摄 + 食物摄影」保证图片风格统一。这是数据驱动 Prompt 的经典设计模式

5.3 工作流逻辑

markdown 复制代码
用户输入标题(如:「最近胃不好」)
    │
    ▼
约束方向:养生类
    │
    ▼
LLM 节点:生成主标题 + 导语 + 副标题 + 内容
    │
    ▼
循环节点(3-5 次):
    ├── LLM:生成单套食材+做法+功效+建议
    └── LLM:生成对应的 AI 绘画提示词
    │
    ▼
生图模型(调用 3-5 次)
    │
    ▼
合并输出:图文内容完整返回

为什么用循环而不是一次生成 5 套?

分开生成的每个副标题质量更稳定。一次生成 5 套,模型容易「偷懒」------后面几套的内容可能跟前几套高度相似。循环 + 独立的上下文,能保证每套内容的差异化和质量。

5.4 Prompt 工程三条铁律

从这个案例中能提炼出三条普适的 Prompt 设计原则:

  1. 约束比指令更重要 --- 明确字数、格式、不允许做什么,比泛泛的「写得好一点」有效得多
  2. 数据驱动 Prompt --- 让前面生成的内容作为后面 Prompt 的输入,形成链条。食材列表 → 绘画提示词,就是典型
  3. 拆解优于包办 --- 复杂任务拆成多个子任务,每个子任务有独立的 Prompt,比一个超长 Prompt 一把梭要好得多

六、总结:三个核心认知

学完这堂课,我认为最重要的不是记住了多少概念,而是建立了三个底层认知:

认知一:LLM 的本质是数学运算

别被「智能」这个词带偏。底层就是向量空间里的矩阵乘法 + 概率分布采样。理解了这一点,你就不会再问「AI 有没有意识」这种哲学问题,而是会问:「这个任务怎么拆解成它能处理的数学问题?」

认知二:Agent 是 LLM 的能力放大器

LLM 单打独斗只能聊天。加上工具(调用外部能力)、记忆(跨对话持久化)、规划(拆解复杂任务),它就能从「动嘴」变成「动手」。Agent 架构是 AI 落地的核心范式。

认知三:工作流设计比单个模型更重要

选什么模型(GPT-4 vs DeepSeek vs Qwen)的差异,远不如工作流设计得好不好的差异大。好的工作流可以让 GPT-3.5 跑出 GPT-4 的效果,烂的工作流可以让 GPT-4 输出小学生水平。 把精力花在任务拆解、节点设计、异常处理上,比纠结用哪个模型更有价值。


七、给你的动手建议

如果你也想入门 Agent 开发,建议按这个路径来:

  1. 先在 Dify 或 Coze 上搭一个最简单的 Agent --- 别一上来就写代码,先用可视化工具跑通「输入 → 处理 → 输出」的完整流程,建立感性认知。

  2. 从你熟悉的场景开始 --- 比如自动生成日报周报、自动回复客服问题、自动整理会议纪要。解决你自己的痛点,最有动力。

  3. 读懂一个开源 Agent 项目 --- 推荐 AutoGPTMetaGPT,看它们的架构是怎么设计的。

  4. 把 Prompt 设计当一门手艺来练 --- 多写、多测、多对比。同一个任务,不同 Prompt 的风格和质量差别巨大,这是你的核心竞争力。


本文内容来自一节直播课的学习总结,结合个人理解并查阅了一些学者的文献做了大量扩充。欢迎在评论区交流你的看法和踩坑经历~

相关推荐
mldong2 小时前
你的 Vue3 项目也能有钉钉同款审批流设计器:npm 装包,10 分钟画出第一条审批流
前端·vue.js
2分钟速写快排3 小时前
什么是 RAG?如何用 RAG 实现一个用户记忆?
前端·后端·ai编程
passerby60613 小时前
如何自己造一个时间处理库
前端·javascript·github
走到天涯海角4 小时前
react里面的长列表渲染优化
前端·react.js·前端框架
小羊没烦恼!4 小时前
Hello Web API系列教程——Web API与国际化
java·服务器·前端·javascript·php
北岛贰5 小时前
迷茫焦虑期,我做了一个带支付带官网的 AI 聊天虚拟恋人 App
前端·人工智能·后端
mayaairi6 小时前
Vue2 组件通讯(三):全局事件总线、PubSub、插槽与组件实例属性
前端·javascript·vue.js
kyriewen7 小时前
面试官问我:AI 都能写代码了,前端凭什么还值 25K
前端·javascript·人工智能
风骏时光牛马7 小时前
AI源码分析:拆解模型底层实现逻辑
前端
IT_陈寒8 小时前
React子组件莫名其妙重渲染?你可能漏了这个Hook
前端·人工智能·后端