如果你最近一直在关注 AI 编程 Agent,这几天冒出来的 DeepSeek Harness 很值得留意。它不是一个简单的聊天界面,而是想回答一个更难的问题:怎么把一个大模型,变成一个能长期执行复杂开发任务的 Agent。
它的设计理念可以浓缩成一句话:
Everything is a Plugin ------ 万物皆插件。
模型可以换,工具可以换,Skill 可以换,Session 可以管理,甚至 Agent 的执行循环和 UI 都能靠插件扩展。这套思路和 Claude Code、Codex 那种「框架已定好、只能往里加东西」的路线,是有本质区别的。
先给你一个总的判断:
- DeepSeek Harness 目前还不是能全面取代 Claude Code、Codex 的成熟产品,它很新、还在快速迭代;
- 但它的「开放性和可组合性」,是当下几家主流 Agent 里做得最彻底的,值得当重点实验对象长期跟踪。
本文按它是什么、核心设计、四种模式、实测印象、和同类怎么比、值不值得装这个顺序写。
DeepSeek Harness 到底是什么
先澄清一件事:DeepSeek Harness 不是 DeepSeek V4 模型本身。
它更接近一个围绕大模型打造的 Agent Harness,也就是我们常说的「AI Agent 运行框架」。大模型负责「思考」,Harness 负责让模型真正「动起来」。
举个例子,你告诉它「帮我分析这个项目,然后修复这个 Bug,最后运行测试」,一个普通聊天机器人只会告诉你应该怎么改;而 AI Coding Agent 要真做一遍:分析项目结构 → 查找相关文件 → 阅读代码 → 制定方案 → 修改代码 → 执行命令 → 运行测试 → 根据结果继续改 → 汇总结果。
能不能走完这一整条链,靠的不只是模型本身。模型只是大脑,Harness 更像是身体和神经系统。 DeepSeek Harness 做的就是这一层,而它的公开版本采用插件化架构,核心组件可以被替换、扩展和重新组合。
为什么「插件化」特别重要
DeepSeek Harness 最值得关注的,不是它又多了一个 Web UI,而是它从底层就把插件设计做得非常激进。
它的核心理念不是「某个工具可以作为插件」,而是:模型、工具、Skill、Session、文件系统、Sandbox、执行循环、UI,全部都可以处于插件体系之中。
这会带来一个根本性的变化:
Agent 不再是一个固定产品,而是一个可以自己组装的工作平台。
你需要网页搜索,加一个插件;你需要某种代码分析能力,装对应插件;你有特殊的工作流,自己开发插件;你甚至能把自己常用的一套流程封装起来分享给别人。这种思路和 Claude Code、Codex 的扩展机制有相似之处,但 DeepSeek Harness 把插件化延伸到了 Agent 本身的组成部分------这也是为什么它未来可能不只是个「DeepSeek 专用编程工具」。
为什么它不选 TUI,而是 Web UI
过去很多 AI Coding Agent 都喜欢 TUI(终端界面),Claude Code、Codex 都能直接跑在 Terminal 里。TUI 的优点很实在:资源占用低、SSH 方便、适合开发者、可以直接操作当前项目、适合服务器环境。
但它对普通用户有个绕不开的门槛:学习成本偏高。
DeepSeek Harness 选了另一条路------提供一个独立的 Web UI,启动后直接用浏览器访问。这样做最大的好处,是Agent 与操作界面被彻底分开了:代码和 Agent 跑在电脑 A 上,你完全可以用电脑 B、Mac、iPad 甚至手机浏览器访问这个 Web UI,只要网络通,就能继续控制电脑 A 上正在跑的 Agent。

配合 ngrok:把 Harness 变成远程 AI 编程服务
这一点非常实用。假设你的主力机器是一台放在家里的 Mac mini,DeepSeek Harness 装在上面。出门在外想用它怎么办?传统终端型 Agent 通常要 SSH 或者额外配一套远程控制环境,而 DeepSeek Harness 的 Web UI 可以直接用内网穿透工具暴露出来,比如 ngrok。
配置完成之后,你会得到一个公网地址,在另一台电脑或手机浏览器打开它,就能访问家里那台 Mac mini 上的 DeepSeek Harness。整个工作流就变成:
家里的 Mac mini → DeepSeek Harness → Web UI → ngrok 内网穿透 → 手机 / 笔记本 / 平板
这实际上让 AI Coding Agent 变成了一个可以远程调用的「服务」,而不是只能坐在它面前用。
四种运行模式,怎么选
DeepSeek Harness 不是只有一种 Agent,目前提供四种主要运行模式:
Standard ------ 完整的 Coding Agent 模式。可以编辑文件、执行终端命令、搜索网络、使用 Skill、制定计划、使用目标、调用 Sub-agent、持续执行复杂任务。想把它当日常 AI 编程助手,选这个最直接。
Code ------ 在 Standard 基础上进一步强化。它不仅能执行传统 Agent 操作,还能把复杂的多步骤操作编译成可执行的代码,实现更强的自动化,适合比较复杂的开发任务。
Minimal ------ 更轻量,只保留最核心的工具和能力。适合 Benchmark、实验、Agent 能力测试、最小化运行环境这类场景。如果你想研究「一个 Agent 到底需要哪些工具才能完成任务」,Minimal 会很有意思。
Creator ------ 更偏向开发者。它允许你研究、创建和组合插件。如果你不是单纯想「使用 Agent」,而是想自己设计一个 Agent,Creator 模式就值得关注。
最让我印象深刻的是 Trajectory
用过 AI Coding Agent 的人,应该都遇到过同一个问题:Agent 到底做了什么? 很多时候我们只看到 Thinking... 然后 Done.,中间发生了什么完全不透明。
DeepSeek Harness 在这方面做得很好,它提供了 Trajectory(执行轨迹)。你可以看到 Agent 在整个任务里:用了什么系统提示、收到什么用户提示、调用了什么工具、每个工具什么时候调用、执行花了多久、产生什么结果、一共跑了几轮,甚至能逐条查看每一个具体步骤。
这条能力放到 AI Agent 上,价值比想象中大得多------它已经非常接近「Agent 调试器」的概念。

可追溯性为什么重要
假设 Agent 修改了你的项目,结果恰好是对的,你可能只知道「AI 帮我修好了」。但如果结果错了呢?没有轨迹,你很难知道它到底在哪一步出了问题。
Trajectory 提供了一条完整的执行链:用户任务 → 系统提示 → 分析项目 → 调用文件搜索工具 → 读取代码 → 制定方案 → 修改文件 → 执行测试 → 发现错误 → 再次修改 → 最终完成。
对普通用户,它让 AI 的工作过程更透明;对开发者,则意味着你可以研究 Agent 为什么成功,也可以研究它为什么失败。这种可观测性,是长期可靠使用 Agent 的基础。
名字叫 DeepSeek,但不是只能跑 DeepSeek 模型
这是个很容易被误解的地方。虽然叫 DeepSeek Harness,它并不是一个只能使用 DeepSeek 模型的封闭系统。在模型设置里可以添加其他模型提供商,比如通过 OpenRouter 接入其他模型。
这意味着 Harness 与模型本身是可以解耦的,你可以按任务选模型:复杂推理用 DeepSeek,编程用代码能力更强的模型,快速任务用更便宜的模型,特殊任务用其他供应商的模型。这一步,让 DeepSeek Harness 从一个「DeepSeek 专用工具」逐渐变成一个通用 Agent 平台。
插件体系,才是它最大的想象空间
模型可以换只是第一步,真正有想象空间的是插件。在插件列表里,你能查看当前已安装的插件,继续添加新的。
举个例子就能看出它的价值:
- 开发者可以配:Git、GitHub、Issue、PR、测试、浏览器、数据库、部署;
- 内容创作者可以配:搜索、网页抓取、图片生成、视频生成、TTS、SEO、WordPress;
- AI 自动化用户可以组合:Sub-agent、定时任务、浏览器、文件系统、API、外部服务。
最终得到的是完全不同的 Agent。所以 DeepSeek Harness 真正有意思的地方,不是「它能不能写代码」,而是 「我能不能把它改造成我自己的 Agent?」。
Slash 命令,进一步降低长任务的门槛
DeepSeek Harness 提供了一系列 Slash 命令,可以快速完成:压缩上下文、导出 Session、查看工作状态、进入计划模式、切换模型、管理任务。
对长时间运行的 Agent 来说这些很重要。真正使用 Coding Agent 时,往往不是「提问 → 得到答案」这么简单,而是持续几十分钟甚至几个小时的连续工作过程,Session 管理能力因此变得非常关键。
处理 GitHub Issue:实际很能打
除了写代码,你还能让 DeepSeek Harness 直接分析 GitHub Issue。把某个开源项目的 Issue 链接丢给它,它可以:阅读 Issue → 定位相关代码 → 分析问题原因 → 找出可能涉及的文件 → 给出修复建议。更进一步,它还能查看对应的 PR,形成「Issue → 代码定位 → 原因分析 → PR 检索 → 修复方案」的完整流程。对经常参与开源项目的人来说,这种能力相当有价值。
一个很好用的功能:从同一任务分叉多个 Session
假设你遇到一个 Bug,有两个思路:一是自己分析代码提出修复方案,二是去 GitHub 搜有没有人已经提交了 PR。以前你得先做完方案 A 再做方案 B,而 DeepSeek Harness 可以把同一个任务直接分叉成多个 Session,让两个 Agent 同时干活,最后再比较结果。
原任务 → 方案 A(分析代码并修复) / 方案 B(搜索已有 PR)
这已经非常接近多 Agent 协作的基本形态了。
最有意思的一次测试:让它开发一个游戏
为了看它的实际 Coding 能力,可以给它一个更复杂的任务------开发一个简单的 3D 游戏。用 DeepSeek 模型、选较高的推理级别,Agent 开始执行后会持续进行项目分析、代码编写和工具调用,而且整个过程都能通过 Trajectory 查看。最终它完成了一个可以实际运行的小游戏,包含可控制的人物、移动、武器、攻击动作、敌人、战斗、血量、场景、商店和飞行效果。

当然,这种测试不能直接等同于专业游戏开发能力。但它至少说明了一点:当模型拥有足够强的工具调用、规划和执行能力之后,Agent 可以独立完成相当复杂的多步骤开发任务。
和 Claude Code、Codex 最大的区别
如果只比「能不能写代码」,三者之间其实很难分出绝对高低。Claude Code 和 Codex 都已经是相当成熟的 AI Coding Agent,DeepSeek Harness 最大的区别在于更强调开放性和可组合性。
| 特性 | DeepSeek Harness | Claude Code | Codex |
|---|---|---|---|
| Coding Agent | ✅ | ✅ | ✅ |
| Web UI | ✅ | 主要以终端/生态为主 | 依使用方式而定 |
| 多模型 | ✅ | 有限制 | 有限制 |
| 插件化 | ★★★★★ | ★★★★ | ★★★ |
| Session | ✅ | ✅ | ✅ |
| Trajectory | ★★★★★ | 部分能力 | 部分能力 |
| Sub-agent | ✅ | ✅ | ✅ |
| 自定义 Agent | ★★★★★ | ★★★★ | ★★★ |
| 开放程度 | ★★★★★ | ★★★ | ★★★ |
需要强调:这不是说 DeepSeek Harness 已经全面击败 Claude Code 或 Codex。 恰恰相反,它目前还是一个非常新的项目。社区反馈里,用户对它的 Web UI、Code 模式和 DeepSeek 模型适配评价较高,但 Sub-agent 等部分能力仍有问题,项目还在快速迭代。更准确的说法是:它是一个非常有潜力的新玩家,而不是已经全面取代前两者的成熟产品。
一个很特别的用法:被其他 AI Agent 调用
这可能是整个测试里最有意思的一部分。因为 DeepSeek Harness 用的是 Web UI,它理论上不只是给人用------其他 AI Agent 也可以使用它。 比如打开 Codex,让 Codex 通过浏览器访问 DeepSeek Harness 的 Web UI。
这样一来,Codex 就相当于变成了一个「总调度 Agent」,负责整体规划;DeepSeek Harness 负责分析项目架构;另一个 Agent 负责测试;最后由 Codex 汇总结果。这其实就是多 Agent 协作,而且是跨工具、跨厂商的组合方式。
这背后,是 AI 编程形态的转变
过去的 AI Coding 工具更像「一个产品 + 一个模型 + 一套工作流」,未来可能变成「一个主 Agent + 多个专业 Agent + 多个模型 + 多个插件」的组合。比如 Codex 负责项目总规划,DeepSeek Harness 负责代码分析,Claude Code 负责复杂重构,本地 Qwen 负责大量低成本任务,ComfyUI 负责图片生成,浏览器 Agent 负责网页操作------最终组成一个属于自己的 AI 开发团队。
这才是 Harness 这类东西真正值得关注的方向:把原本绑定在一起的东西拆开,让用户可以自由重组。
它最大的价值,可能并不是「DeepSeek」
名字里虽然有 DeepSeek,但它真正值得关注的地方,其实是 Harness 本身。因为模型能力一直在变:今天最强的是模型 A,几个月后可能就是模型 B。如果 Agent 和模型高度绑定,每次模型换代都意味着重新换工具。
而 Harness 把模型、工具、插件、工作流、UI、Agent Loop 尽可能拆开。以后即使模型变了,整个工作环境也不需要推倒重来。这也是「Everything is a Plugin」这个设计理念最核心的价值。
现在值不值得装
如果你只是偶尔让 AI 帮你写几行代码,那没必要为了体验它专门折腾,Claude Code、Codex、Cursor 这些成熟工具已经足够好用。
但如果你属于下面几类人,非常值得尝试:
- AI Coding Agent 重度用户:每天用 Claude Code、Codex、OpenCode 的人,值得把它当新的实验对象;
- DeepSeek 用户:本来就在用 DeepSeek 系列模型的话,用官方 Harness 能进一步发挥模型能力;
- 喜欢折腾 Agent 的人:如果你爱玩 MCP、Skill、Plugin、Sub-agent、Workflow、自动化,它很可能会让你玩得开心;
- 想建立自己 AI 工作流的人:这类用户反而最值得关注,因为 DeepSeek Harness 真正的优势,就是你可以按自己的需求重新组装它。
现在有哪些不足
DeepSeek Harness 并不完美。
首先,它仍处于比较早期的开发阶段。官方发布后社区增长很快,GitHub Star 数量短时间内迅速上升,但这不等于它已经达到成熟产品的稳定程度,Sub-agent、Skill、文档以及部分交互仍在完善中。
其次,功能丰富对新手也意味着复杂。Plugin、Session、Skill、Agent、Trajectory、Sub-agent、Runtime 这些概念集中出现后,学习成本并不低。另外,让 Agent 执行非常复杂的任务可能产生大量 Token 消耗------Harness 能力越强,不代表成本一定越低,合理的做法是根据任务难度选模型和 Agent。
智算工坊的评分
| 维度 | 评分 |
|---|---|
| 插件化 / 可组合性 | ★★★★★ |
| 开放性 | ★★★★★ |
| Trajectory 可观测性 | ★★★★★ |
| Web UI | ★★★★☆ |
| Coding 能力 | ★★★★☆ |
| 多模型支持 | ★★★★☆ |
| 易用性(新手) | ★★★☆☆ |
| 生态成熟度 | ★★★☆☆ |
| 文档完善度 | ★★★☆☆ |
综合评价:4.0 / 5
说明:以上评分基于公开功能与体验整理的实验室评估,项目仍在快速迭代,部分能力(如 Sub-agent)存在已知问题,以你实际使用时的版本为准。
最终怎么看
如果只把 DeepSeek Harness 看成「DeepSeek 推出的又一个 AI 编程工具」,它其实没那么特殊。但如果把它理解成**「一个可以重新组合模型、工具、插件、Agent Loop 和 UI 的开放式 Agent 平台」**,它的意义就完全不一样了。
它最大的创新不是某一个按钮,也不是 Web UI,而是试图改变 AI Agent 的产品形态:从一个固定的软件,变成一个可以自己组装的系统。
AI Coding Agent 的竞争可能正在进入下一阶段:第一阶段比「谁的模型更聪明」,第二阶段比「谁的 Agent 更能完成任务」,接下来可能要比「谁能让用户自己创造 Agent」。DeepSeek Harness 的「Everything is a Plugin」正好踩中了这个方向。
模型只是基础,真正决定 AI 能做什么的,是它拥有怎样的工具、怎样的工作流、怎样的记忆、怎样的执行循环,以及用户能不能按自己的需求重新组合这些能力。如果这个方向继续发展,未来我们使用 AI 的方式,可能不再是「打开一个 AI 软件然后问它问题」,而是「建立一个属于自己的 AI 工作团队」。
DeepSeek Harness 还远没到最终形态,但它已经把这个方向展示了出来。对喜欢 AI Agent、AI 编程和自动化工作流的人来说,这个项目值得持续跟踪。
文章内容参考:DeepSeek Harness 深度体验:把「万物皆插件」做到极致的 AI 编程 Agent | 智算工坊