Agent 层比模型层更重要?从本周 AI 两件大事说起

Agent 层比模型层更重要?从本周 AI 两件大事说起

2026年8月25日 · 阅读约 6 分钟

这周 AI 圈发生了很多事,但真正让我停下来思考的只有两件:

  • 8月19日 ,OpenAI 以 Apache-2.0 协议开源了 Codex 底层执行框架 Codex Harness
  • 8月20日 ,Anthropic 将 Claude 的 Computer Use、Skills API、Files API 升级为全面可用(GA)。

两件事看似独立,但放在一起看,指向同一个结论:2026 年下半年,AI 行业的竞争焦点正在从"谁的模型更强"转向"谁的 Agent 基础设施更完善"。

这篇文章不是新闻搬运------我想聊聊这两件事对开发者到底意味着什么,以及我为什么认为 Agent 层可能比模型层更值得你投入时间


一、OpenAI 开源 Codex Harness:给 Agent 引擎做了一次"标准答案"

发生了什么

8月19日,OpenAI 在官方博客宣布开源驱动 Codex App / CLI / IDE 扩展的底层 Agent 执行框架------Codex Harness,采用 Apache-2.0 协议。这意味着开发者可以把 Agent 能力嵌入自己的产品,而不必依赖官方的 ChatGPT 界面。

Harness 管理的核心能力包括:对话状态管理、流式执行、工具调用、沙箱策略和审批流程。同时发布的还有一个示例应用 Relay,演示了如何在货运 Dashboard 中嵌入 Agent。

来源:OpenAI 官方博客 developers.openai.com/blog/codex-...

代码仓库:GitHub github.com/openai/code...

为什么我认为这比新模型发布更重要

大多数人在关注"哪个模型 benchmark 更高",但 OpenAI 自己公布了一组数据让我改变看法:

在 ARC-AGI-3 基准上,Harness 的 retained reasoning + context compaction 机制把 GPT-5.6 Sol 得分从 13.3% 提升到 38.3% ,同时输出 token 降低 6 倍

同样的模型,不同的 Agent 框架设计,得分差了将近 3 倍。这说明 Agent 层的工程优化空间比模型层的参数堆叠大得多。

打个比方:模型是发动机,Agent 框架是底盘和传动系统。你给一辆车换更好的发动机(新模型),可能提升 10%;但你优化底盘、减重、改进传动,提升可能是 200%。这就是 Harness 开源的价值------它给整个行业提供了一套"底盘设计参考实现"。

三种集成层级

OpenAI 提供了三个层级的集成方式,适配不同需求:

层级 定位 适用场景
codex exec 非交互式脚本执行 CI/CD 流水线中的自动化任务
Codex SDK 程序化 Agent 接口 嵌入自定义 Dashboard、工单系统
Codex app-server 产品级持久对话 + 审批流 需要人机协作的企业级应用

值得注意的是,Harness 本身只是运行时框架------模型访问和托管服务仍按 OpenAI API 收费,应用层 UI 也需要自研。但开源的意义不在于"免费用",而在于你可以审查、修改、扩展 Agent 的执行逻辑,这在企业级场景中至关重要。


二、Claude 生产级 Agent 三件套:让 Agent 真正能"交付工作"

发生了什么

就在 Codex Harness 开源第二天,Anthropic 宣布 Computer Use、Skills API 和 Files API 在 Claude Platform 全面可用(GA) ,同时新增了 Browser Use 工具。

这三个 API 组合起来,让 Claude 具备了一套完整的能力链:

能力组合 作用
Computer Use + Browser Use 让 Claude 操作软件和浏览器。新增的 Browser Use 通过读取页面结构定位元素,不再依赖像素坐标,可靠性大幅提升。
Skills API + Files API 让 Claude 加载团队知识(版本化管理)和管理持久文件(1TB/组织存储、自动过期、5 倍速率提升)。

来源:Anthropic 官方博客 claude.com/blog/comput...

为什么这比看起来重要

很多人的关注点在"AI 能不能操作电脑"上,但我觉得真正的突破在于:这是第一次有 Agent 能力从"实验性 beta"升级为"可规模化企业工具"。

Computer Use 现在支持 multi-action turns(每轮执行多个操作),减少了 API 调用次数和延迟。这意味着 Claude 不再是"一步一停"的玩具,而是可以连续执行多步操作的工作流引擎。

更关键的是,这套组合解决了一个实际问题:对于没有 API 的遗留系统(医疗门户、保险系统、老旧 ERP),Computer Use 可能是唯一的自动化入口。 不是所有系统都能给你一个 REST API,但几乎所有系统都有一个界面。

当然,这套方案也有它的局限。截图分辨率会直接影响元素识别准确率;Skills 在沙箱中运行,无法直接访问外部网络;无 API 的 Web 应用需要额外处理登录态、验证码和会话保持。这些都是在实际落地中需要面对的工程挑战,但它至少给了一条可行的路径。


三、两条路线:SDK 嵌入 vs 原生操作,你该选哪个?

把两件事放在一起看,你会发现 OpenAI 和 Anthropic 走的是两条不同的 Agent 基础设施路线:

OpenAI 路线:SDK 嵌入

  • 思路:提供 Agent 运行时框架(Harness),开发者用 SDK 把 Agent 能力嵌入自己的产品。
  • 优势:灵活度高,可以完全定制 UI 和工作流;开源,可以审查和修改执行逻辑。
  • 适合:想自己掌控 Agent 行为的团队,有 Node.js/TS 基础。

Anthropic 路线:原生操作

  • 思路:让模型直接操作软件界面,不需要目标系统提供 API,Claude 自己"看着屏幕操作"。
  • 优势:能处理无 API 的遗留系统;Skills + Files 让 Agent 具备"团队记忆"和"文件交付"能力。
  • 适合:需要自动化操作第三方系统、网页表单、文档处理流水线的企业。

我的判断是:这两条路线不是替代关系,而是互补关系。

如果你在做内部工具、开发者平台,Codex Harness 的 SDK 嵌入模式更适合------你掌控一切,模型只是引擎。如果你在做企业自动化、需要操作大量第三方 SaaS 和遗留系统,Claude 的 Computer Use 更合适------你不掌控目标系统,但可以让 Agent "看着操作"。


四、对开发者的实际影响:别只盯着模型参数了

最后说点实际的。这周还有几条定价新闻,也和 Agent 话题直接相关:

  • Anthropic Claude Fable 5.1 缓存读取价格从 1.00降到1.00 降到 1.00降到0.25 / 1M tokens(降幅 75%),重度 Agent 任务总成本可降低约 45%
  • Google Gemini 3.7 Flash 限时半价至年底,$0.75 / 1M input tokens
  • OpenAI GPT-5.6 Luna 输入价格从 1.00降到1.00 降到 1.00降到0.20(降幅 80%)

把它们和 Codex Harness / Computer Use 放在一起看,逻辑就很清楚了:

模型越来越便宜 → Agent 调用模型的次数可以更频繁 → Agent 框架的工程优化价值被放大 → Agent 层成为新的竞争焦点。

这就是为什么我认为 Agent 层比模型层更值得开发者关注 。模型降价是趋势,但降价之后谁用得好,取决于 Agent 框架的设计。Codex Harness 开源和 Claude Computer Use GA,本质上都在做同一件事:降低 Agent 的工程门槛,让更多开发者能基于 Agent 做出产品。

💡 我的几点思考

  1. 个人开发者:建议先从 Codex Harness 的 CLI 模式入手,理解 Agent 的对话状态、工具调用、审批流是怎么回事。不需要一上来就写 SDK,先用起来建立直觉。
  2. 企业应用团队:重点关注 Claude Computer Use 的 multi-action turns 能力。如果你的业务中有大量无 API 的遗留系统,这可能是目前唯一可行的自动化路径。
  3. 技术选型:不要只看模型 benchmark,要看 Agent 框架的沙箱策略、审批流设计和文件管理能力------这些才是决定产品能否上线的因素。

五、写在最后

这周最大的信号不是哪个模型又刷了新分,而是 OpenAI 和 Anthropic 同时把 Agent 基础设施从"实验室"推向了"生产环境"

Codex Harness 开源意味着你可以审查、修改、扩展 Agent 的执行逻辑;Claude Computer Use GA 意味着 Agent 可以真正操作你的软件、加载你的知识、管理你的文件。两条路线殊途同归,都指向一个未来:Agent 不再是聊天机器人,而是能交付工作的数字员工。

对开发者来说,这意味着一个新的技术栈正在成型:模型层(GPT-5.6 / Claude / Gemini)→ Agent 框架层(Codex Harness / Computer Use)→ 应用层(你的产品)。模型层在快速降价 commoditize,价值正在向 Agent 框架层和应用层转移。

如果你还在纠结选哪个模型,不如开始研究 Agent 框架------那才是接下来 2-3 年真正有技术壁垒的地方。


参考资料

  1. OpenAI, "Codex as a platform: build on the open agent harness". 2026-08-19. developers.openai.com/blog/codex-...
  2. GitHub 仓库:openai/codex (Apache-2.0). github.com/openai/code...
  3. Anthropic, "Build production agents with computer use, the Skills API, and the Files API". 2026-08-20. claude.com/blog/comput...
  4. Anthropic, Computer Use Tool Documentation. platform.claude.com/docs
  5. Anthropic, Skills API Overview. platform.claude.com/docs

以上就是本周 AI 领域两件大事的深度解读。我会每周整理 AI 领域的前沿动态和深度分析,发布在公众号 每一天都有倪。如果你觉得这篇文章有帮助,欢迎点赞收藏,也欢迎在评论区聊聊你对 Agent 框架的看法。

相关推荐
ClouGence21 分钟前
AI 定时任务火了?写日报、看新闻、做计划、盯价格,它都能自动跑
chatgpt·aigc·claude
Dawson Zhu35 分钟前
从虚拟内存到 Agent 记忆:把大模型的“脑补“变成“查表“
人工智能·语言模型·架构·aigc·agi
ServBay39 分钟前
Claude Fable 5.1正式上线:Claude 最强,还降价?
aigc·ai编程·claude
plainGeekDev1 小时前
软件工程术语库·系统与工程化篇
aigc·ai编程·claude
必须会一定会1 小时前
Agent Handoff v0.6.0 跨电脑同步:Git、EVENTS.jsonl、CONTEXT.md 使用方法
人工智能·git·ai编程
京东云开发者3 小时前
Codex 驱动的移动端AI全栈开发:从 Relay 原型图到可交付链路
ai编程
克里斯蒂亚诺更新3 小时前
AI编程Agent都有哪些
ai编程
ClouGence3 小时前
一句话直出可运行程序!GLM‑5.3 系列多任务实测
人工智能·agent·ai编程
zhangfeng11333 小时前
claude 默认授权启动,读写git权限
ai编程·cluade code