图解 AI Agent ①:大模型接上 API,为什么还不算 Agent?

很多人第一次做 AI 助手,都会有一个很自然的想法:

我已经把大模型 API 接上了,命令行里也能问答了。

那这是不是就算一个 AI Agent 了?

答案是:

还不算。

因为"能聊天"和"能行动",中间还差了一整层能力。

这一篇不讲复杂框架,也不啃大段代码。我们用 8 张图,先把这个问题讲明白。


01|我接上 API 了,它已经会回答问题了

用户输入问题,Node.js 把问题发送给大模型 API,再把模型的回答打印到终端。

看到这里,很多人会觉得:

"这不就是 AI Agent 了吗?"

但其实,它现在只是一个会聊天的 AI 程序。


02|它现在到底会什么?

接上 API 后,模型已经能理解问题、生成回答、做基础推理,也能按照提示词输出内容。

但它仍然不能读取你的项目文件、修改代码、运行命令,也不能检查执行结果。

本质上还是:

用户问一句,模型答一句。

它有"大脑",但还没有真正的"手"和"脚"。


03|为什么它还不算 Agent?

假设你对它说:

帮我修一下登录 Bug。

模型也许知道应该从哪里排查,但它看不到 login.ts、auth.ts 和 user.ts,更不能直接修改项目或运行测试。

所以,聪明不等于能动手。

它知道"应该做什么",却还做不到"真的去做"。


04|真正的 Agent,多了一层什么?

真正的 Agent,不只有大模型,还需要一层 Harness:

  • 大模型负责理解任务、推理分析、决定下一步。
  • Harness 负责提供工具、执行操作、管理上下文和约束行为。

可以先记住这个核心公式:

AI Agent ≈ 大模型(大脑)+ Harness(控制系统)

也就是:大模型决定做什么,Harness 负责把它做出来。


05|Harness 到底在干什么?

比如模型判断下一步应该读取 README,它并不会自己打开文件,而是发起一次 Tool Call。

Harness 收到请求后,再调用对应工具:

  • read_file:读取文件
  • edit_file:修改代码
  • bash:执行命令

这些操作最终都会落到真实的项目和运行环境中。

模型负责想,Harness 负责调用工具并执行。


06|为什么第一篇还要从"接 API"开始?

因为后面的所有复杂能力,都建立在这条最小链路上:

用户输入 → main.ts → chat.ts → 大模型 → 终端输出

其中:

  • config.ts 负责读取模型配置
  • chat.ts 负责请求大模型
  • main.ts 负责接收用户输入

虽然这一步还不算完整 Agent,但它是整个系统的地基。工具、Agent Loop、记忆和 Plan Mode,都会从这里逐步长出来。


07|所以现在这个东西更像什么?

现在的程序更像一个 CLI Chatbot:

用户提问 → 大模型回答

而真正的 Agent 还会通过工具系统接触项目和环境,并持续完成:

观察 → 行动 → 检查结果 → 继续执行

所以更准确的说法不是:

"我已经做完一个 Agent 了。"

而是:

"我已经做出了一个最小可用的 AI 命令行助手。"


08|这一篇你真正要记住什么?

这一篇只需要记住三点:

  1. 接上 API,不等于做完 Agent。
  2. 大模型负责思考,Harness 负责行动。
  3. 第一步先让它能说话,下一步再让它能动手。

如果只记住一句话,那就是:

一个只会回答问题的模型程序,还不是完整的 AI Agent。

真正的 Agent,需要开始接触真实环境,并通过工具完成任务。


下一篇

图解 AI Agent ②:模型到底是怎么读取文件的?

模型并不会自己打开 README,它只是申请调用一个工具:

text 复制代码
read_file

这篇图解先帮你建立对 AI Agent 的整体认识。

下一篇,我们就给这个"大脑"装上第一只"手",让它第一次真正看到你的项目文件。


如果你想继续用真实代码把这些能力做出来,可以接着看 《不用框架,手搓 AI Agent》系列我们会从接入模型 API 开始,逐步实现文件读取、Agent Loop、工具系统、记忆和 Plan Mode。

图解系列负责让你看懂,实战系列负责带你做出来。

相关推荐
鲲穹AI种草17 小时前
AI写真图像生成工具对比,多款人像创作工具能力与使用边界记录
人工智能·图像生成
W***259217 小时前
2026深度解读:Work Agent长程任务的执行机制与落地能力
大数据·人工智能
lank_M17 小时前
抠图换深色背景有白边?先分清直通和预乘alpha
图像处理·人工智能·计算机视觉·状态模式
feasibility.17 小时前
BeefTV:数据留在本地的 AI 视频工作台,和 ComfyUI 分工不同
人工智能·音视频
蒸蒸yyyyzwd17 小时前
CUDA 学习笔记
ai编程
正经教主17 小时前
【FDE系列】阶段3:Day 72:RAGFlow 平台 — 端到端知识库
人工智能·rag·fde
EatFan17 小时前
AI Agent 进入工程化下半场:从多智能体编排走向治理、标准化与运行沙箱
人工智能·多智能体·ai agent·开源框架·mcp·agents.md
一木 之林17 小时前
DDPM扩散模型代码实战:前向加噪造数据、U-Net噪声预测与反向生成手写数字
人工智能·算法·计算机视觉
Web3_Basketball17 小时前
Ollama本地函数调用发布72小时,我替你试完了
ai编程
foenix6617 小时前
AI 程序化建模:用数学构建一朵蘑菇云
人工智能