AI Agent结构图例和工作流程描述

文章目录

  • [1. Agent架构图例](#1. Agent架构图例)
  • [2. 工作流程文字说明](#2. 工作流程文字说明)
    • [2.1. 输入 User Prompt](#2.1. 输入 User Prompt)
    • [2.2. 构建Prompt](#2.2. 构建Prompt)
    • [2.3. 调用 LLM(模型推理)](#2.3. 调用 LLM(模型推理))
    • [2.4. Tool Call 解析(Agent 决策)](#2.4. Tool Call 解析(Agent 决策))
    • [2.5. 调用 MCP Server(执行工具)](#2.5. 调用 MCP Server(执行工具))
    • [2.6. MCP Server 返回结果(Tool Result)](#2.6. MCP Server 返回结果(Tool Result))
    • [2.7. 结果注入上下文(Context Injection)](#2.7. 结果注入上下文(Context Injection))
    • [2.8. 再次调用 LLM(生成最终回答)](#2.8. 再次调用 LLM(生成最终回答))
    • [2.9. 返回最终答案给用户](#2.9. 返回最终答案给用户)
  • [3. 流程内可多轮循环](#3. 流程内可多轮循环)

1. Agent架构图例

一句话概括工作流程:用户提问 → Agent 构造上下文 → LLM 判断是否用工具 → Agent 执行工具 → 结果回注 → LLM 生成最终答案

2. 工作流程文字说明

2.1. 输入 User Prompt

用户输入自己的问题,如:女朋友肚子疼怎么办?

  • 流程开始
  • 输入是自然语言

2.2. 构建Prompt

Agent 会将用户输入加工为一个完整的 Prompt,其中包含:

  • System Prompt 系统提示词,角色设定
  • Memory 历史对话信息
  • 用户的当前问题
  • Tool Schema 可用工具列表

目的是让LLM知道:

  • 自己是谁
  • 能做什么(有哪些工具)
  • 当前任务是什么

2.3. 调用 LLM(模型推理)

Agent 把构造好的 Prompt 发给大模型,模型会返回两种可能:

  • 普通文本回答:多喝热水
  • Tool Call(结构化输出):
json 复制代码
{
  "type": "call",
  "name": "web_browse",
  "args": {
    "url": "https://xxx.com"
  }
}

注意:模型不会真的调用工具,只是"建议调用"

2.4. Tool Call 解析(Agent 决策)

Agent 接收到 LLM 输出后,会做:

  • 判断是不是 tool call
  • 解析 JSON / function call
  • 提取:
    • 工具名(name)
    • 参数(args)
  • 参数校验(防止乱调用)

注意:Agent 才是"执行者",模型只是"建议者"

2.5. 调用 MCP Server(执行工具)

如果需要调用工具:Agent 会通过 MCP 协议发送请求(本质类似:HTTP API)

txt 复制代码
Tool: web_browse
Args: { url: xxx }

2.6. MCP Server 返回结果(Tool Result)

工具执行完成后返回数据,可能是:

  • JSON(最常见)
  • HTML(网页内容)
  • Text(文本)
  • Binary(文件)

例如:

json 复制代码
{
  "title": "...",
  "content": "..."
}

2.7. 结果注入上下文(Context Injection)

Agent 不会直接把结果给用户,而是:把 Tool Result 加入 Prompt

  • 用户问题 + 工具返回结果

然后重新组织成新的输入给 LLM (关键机制),LLM 必须"看到工具结果"才能生成正确答案

2.8. 再次调用 LLM(生成最终回答)

Agent 再次调用模型:

  • 输入
    • 原问题
    • 工具结果
  • 输出
    • 更准确、更有依据的回答

例如:

txt 复制代码
根据查询结果,可能是胃部不适,建议......

2.9. 返回最终答案给用户

Agent 将模型最终生成的回答返回给用户

  • 流程结束

3. 流程内可多轮循环

如:LLM → Tool → LLM → Tool → LLM ...

相关推荐
云卷云舒___________7 小时前
搭载豆包助手!努比亚新机首发,GPT-6 Sol内测曝光,小米MiMo杀入桌面 | 9月9日 AI日报
ai·智能体·豆包·ai日报·gpt6·努比亚·小米mimo
熊猫钓鱼>_>9 小时前
免费域名的隐秘陷阱与网站稳定部署实战:火山引擎到底行不行?
人工智能·ai·llm·域名·火山引擎·引擎·火山
AI 思录10 小时前
Prompt 事故档案(八):日常表达被标为“待校准”,AI 的爹味语法从哪里来
大数据·人工智能·算法·prompt·用户体验·ai合规
、如果10 小时前
PDF图片文字提取零依赖方案:pymupdf+AI视觉实战
人工智能·数据分析·pdf·图片提取·文字提取·skills
阿祖zu11 小时前
训练师 Agent 小程序产品上线啦
微信小程序·llm·agent
slacker-kian11 小时前
[实践]-本地大模型Agent使用自定义MCP服务实现与SAP系统集成(二)
ai·llm·sap·agent·mcp·odata·qwen-agent
2601_9657422212 小时前
全媒体运营与短视频代运营,两者有什么区别?
大数据·数据结构·人工智能·算法·ai·媒体
樊小肆12 小时前
离谱,每轮请求 25% 的 token,竟在重发模型想完就扔的内心独白
前端·人工智能·agent
SamChan9013 小时前
PDF翻译后的格式完整性校验:用Python自动比对译文与原文档的表格与段落结构
开发语言·python·ai·pdf·机器翻译
七牛开发者13 小时前
告别反复调参,一个 Skill 让 AI 掌握论文图的视觉语法:以 DeepSeek V4.1 Flash 论文图为例
github·agent·deepseek