深入理解 DeepSeek Harness(dsh):让模型真正“动手干活“的开源 Agent 框架

一行命令启动、一切皆插件、MIT 协议、5 天 GitHub 14.9 万 Star------这篇文章带你搞清楚 DeepSeek Harness 到底是什么,以及怎么在 30 分钟内跑起来。

写在前面

2026 年 8 月 13 日晚,DeepSeek 做了两件事:宣布 API 调价,然后开源了 DeepSeek Harness (命令行名 dsh)。代码公开后的反应可以用"炸裂"形容------不到 2 小时 Star 破万,12 小时突破 5 万,发布第五天达到 14.9 万 Star,Fork 超 1.5 万。社区里有人把它称为 Agent 领域的"Linux 时刻"。

热度归热度,很多人看完新闻还是一头雾水:Harness 到底是什么?它是新模型吗?和 Claude Code、Copilot 有什么区别?我该不该学?

这篇文章不堆术语,只讲清楚三件事:它解决了什么问题、它是怎么设计的、以及怎么快速上手。

一、Harness 不是模型,是模型的"执行系统"

先澄清一个最常见的误解:DeepSeek Harness 不是新的 DeepSeek 模型,也不是一个聊天界面或 API 客户端。

回想一下你平时用大模型的体验:你让它处理一个 Excel,它能给你写段 Python 代码------然后呢?复制代码、新建文件、装环境、跑程序、调报错......活还是你自己干。传统 AI 应用停留在"问答层",擅长给文字结果,不擅长处理一整套连续动作:

  • 先读哪个文件、改哪几行代码?

  • 执行什么命令?

  • 出错后怎么回溯、怎么恢复?

  • 复杂任务怎么拆成多步?

Harness 这个词直译是"马具"。马负责奔跑,马具负责让人驾驭它、让它朝正确的方向跑。放到 AI 世界里,模型是大脑,Harness 是手脚、眼睛、神经系统和工作流控制

DeepSeek 官方给了一个公式:

复制代码
Agent = Model + Harness

你调用 DeepSeek API,得到的是一个会推理的模型;加上 Harness,你得到的是一整套能真正执行任务的智能体系统------读取项目、修改文件、运行命令、管理任务、分配子任务,直到把活干完。

一句话总结:Harness 不是让模型更聪明了,而是让模型能动手了。

二、和 Claude Code、Copilot 有什么本质区别?

区别在于定位。

Copilot / Claude Code DeepSeek Harness
形态 成品工具,开箱即用 开发者的工作台,可自由组装
架构 内核由厂商写死,功能封装固定 微内核 + 插件,一切可替换
模型绑定 各自绑定自家模型 支持近 40 家模型厂商,含本地私有化
定位 "编辑器里怎么更好地写代码" "如何围绕模型搭建可扩展的 Agent 工程系统"

打个比方:Copilot 像一台组装好的品牌电脑,Claude Code 像性能很强的一体机,而 Harness 像一堆主板、CPU、内存和接口------你可以攒出一台完全适合自己的机器。

三、核心设计:一切皆插件(Everything is a Plugin)

这是 Harness 最核心的主张,也是它和市面上其他 Agent 框架拉开差距的地方。

在 dsh 里,没有任何模块是特权内置的。 模型适配器、工具注册表、会话日志、沙箱、存储、调度、界面------连 Agent 循环(agent loop)本身,都是插件。

底层是 Cordis 微内核(源自 Koishi 聊天机器人框架,配套发表了一篇关于"时空可组合编程范式"的论文)。运行中的 Harness 本质上就是一个 Cordis Context,不同包向 Context 注册服务、事件和能力,最终由配置文件组合成一套可运行的智能体。

Cordis 有个很关键的特性叫**"可逆副作用"**:插件注册时产生的所有副作用都会被追踪,卸载插件时自动回收,从而实现真正的热插拔------安装/卸载插件不需要重启。

这种设计带来的自由度非常直接:

  • 不想用某个模型?换。DeepSeek、Anthropic、OpenAI、AWS Bedrock、Azure、Gemini 都支持

  • 不想用默认工具?自己加,或者去社区找(GitHub 搜 dsh-plugin 标签)

  • 不想把数据传到公网?接本地模型(Ollama、vLLM、llama.cpp 等 OpenAI 兼容服务)

  • 觉得界面不顺手?连界面都能换

生态数据也验证了这个方向:发布后五天内,社区开发了超过 5100 个插件,涉及 3500 多位作者,还出现了社区桌面版、TUI 终端界面、插件市场等衍生项目。Harness 的价值不在于"它现在能做什么",而在于"它能被改成什么样子"。

四、四种运行模式:不同的"插件组合包"

Harness 提供四种预置模式,可以理解为四套默认插件组合(本质上是"工具集 + 提示词 + 循环策略"的不同搭配)。

1. 标准模式:日常主力

默认打开文件编辑、Shell、文件检索、网页检索、计划模式、目标追踪、子代理和工作流等能力。模型可以真正进入项目目录,读代码、理解结构、改文件、执行命令。

适合:阅读陌生项目、写单元测试、代码审查、搭脚手架、批量整理文件、分析日志。

普通日常开发,标准模式就够了。

2. PTC 模式:复杂流程一键执行

传统 Agent 处理复杂任务往往要多轮对话:查文件 → 读内容 → 写修改 → 跑测试,每一步都可能来回等待。PTC 模式允许模型编写 TypeScript 程序,把多个工具调用组合成一段完整执行逻辑,将多次往返压缩成一次执行。

适合:跨多文件重构、自动化测试流水线、编译-测试-分析-报告一条龙、批量数据处理、多步骤部署。

3. 极简模式:只保留最基础能力

只有 bash 和文件编辑两个核心工具。目的是排除干扰,做干净的对照实验。

适合:模型对比评测、提示词实验、Agent 原理教学、最小化问题复现。

4. 创造模式:给二次开发者准备

在标准模式基础上额外提供运行时检查、插件实验和预设创作指导。不是拿来直接干活的,是用来"造工具"的。

适合:开发自定义插件、接入企业内部系统、打通 CI/CD、做技术栈二次开发。

选型口诀:普通用标准,复杂用 PTC,做实验用极简,二次开发用创造。

五、每一步都能被追踪:Trajectory 全链路日志

Agent 最难的不是跑起来,而是出事之后不知道为什么。很多自动化任务失败后,你只能看到一句报错------至于模型当时怎么想的、调了什么工具、为什么做出下一步判断,一概不知。

Harness 维护一份只追加的会话日志(append-only),围绕同一条事件流记录:

  • 系统提示词

  • 模型的思考过程

  • 每次工具调用及返回结果

  • 子任务调度与上下文变化

  • 失败和恢复过程

开发者可以回溯、回放、分叉调试。这相当于给 Agent 装了个"黑匣子"------它不一定让 Agent 更聪明,但一定让它更可控。对于生产环境和企业落地来说,这个能力比多几个花哨功能重要得多。

六、30 分钟快速上手

第一步:检查 Node.js 环境

Harness 基于 Node.js 构建,建议 Node.js 22.19+ 或 24.x(当前推荐 24,注意 24.9 有已知内部问题,建议规避):

复制代码
node --version

第二步:一行命令启动 Web UI

复制代码
npx @deepseek-ai/dsh web

首次启动会下载依赖,可能需要一两分钟。启动后浏览器访问:

复制代码
http://127.0.0.1:3080

不想自动打开浏览器可以加 --no-open 参数。也可以验证一下 CLI 版本:

复制代码
dsh --version

第三步:配置模型

进入设置页面 → 模型 → 添加提供方:

  • 填入 DeepSeek API Key(在 platform.deepseek.com 申请,先充十几块钱就足够跑完入门示例)

  • 或添加其他厂商:Anthropic、OpenAI、Bedrock、Azure、Gemini......

  • 或配置本地模型:Ollama、vLLM、llama.cpp 等兼容 OpenAI 接口的服务

第四步:选择工作区,开工

选择一个本地项目目录作为工作区------这个目录就是 AI 允许操作的文件范围。然后在界面顶部选择运行模式(新手无脑选标准模式),输入任务即可。

一个实际的使用范例,给模型一句交代同事式的任务:

复制代码
阅读 files 目录下四个 Excel,合并成统一字段的文件,并生成图表帮助分析。

接下来你会看到它自己拆任务、装缺失的依赖(python-pptx、Chart.js 都是自己装上的)、写代码、跑命令。每个动作在界面上从 pending 变成 completed,你看得见、控得住。基于合并后的数据,还能继续让它生成可筛选的 HTML 看板、汇报 PPT 甚至汇报视频------手动做这一套至少一个下午,用 Harness 中间环节几乎不用盯。

安装方式补充

源码安装(适合二次开发):

复制代码
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web

Docker 安装

复制代码
docker run -d --name dsh -p 3080:3080 ghcr.io/huoxue1/deepseek-harness

社区桌面版:GitHub 上有社区打包的桌面应用(anywhere-labs/deepseek-harness-desktop),解压即用,不需要 Node.js 和命令行。

七、必须知道的安全注意事项

这部分很多人会跳过,但强烈建议读完:

  1. 它是实验性项目。目前处于 Developer Preview 阶段,迭代很快,接口可能有破坏性变更,生产使用请持续关注版本更新。

  2. 沙箱不是绝对安全 。官方 SAFETY.md 说得很诚实:Harness 会运行模型生成的代码并加载第三方插件,沙箱能降低但不能保证隔离。推荐姿势是最小权限 + 一次性虚拟机

  3. 工作区即边界。AI 能操作的文件范围就是你指定的工作区目录,不要图省事把整个用户目录设成工作区。

  4. 第三方插件要审查。生态爆发期泥沙俱下,装插件前看一眼源码和作者。

八、谁适合用?

  • 普通开发者:想要一个能真正进项目干活的 AI 助手,而不是只会聊天------标准模式直接用

  • 企业/敏感数据团队:接入本地私有化模型,数据不出网,这是很多团队等了很久的能力

  • Agent 框架选型中的架构师:如果纠结"该基于哪个 Agent 框架做二次开发",dsh 的可替换架构值得认真评估

  • 想蹭生态红利的插件作者:基础设施成型期就是红利期,热度会退,但基础设施会留下来

硬件门槛方面,只是用 Harness + API 的话,一台普通开发机就够;想跑本地模型,7B 笔记本能跑,33B 代码模型需要单张 RTX 4090 级别的显卡。

写在最后

DeepSeek Harness 的意义,不是又多了一个 AI 编码工具。它代表的方向是:AI 从"回答问题"走向"完成任务",而且这套让 AI 干活的"脚手架"本身,也是开放和可拥有的。

闭源 Agent 产品把 scaffolding(脚手架)锁在厂商内部,而 DeepSeek 把脚手架本身开源了------模型可以换、工具可以换、循环可以换,整个系统团队可以自己 fork、自己掌控。真正的约束从"模型能力够不够"变成了"如何安全地运行不受信任的插件",这反而是工程社区更擅长解决的问题。

参考链接


如果这篇文章帮你搞懂了 DeepSeek Harness,欢迎点赞收藏。上手过程中遇到任何坑,欢迎在评论区交流。

相关推荐
大模型真好玩2 小时前
DeepSeek Harness 入门很简单(二)——DeepSeek Harness通用设置及Agent预设详解
人工智能·agent·deepseek
武子康6 小时前
Seedream 5.0 Pro 进入 Vercel AI Gateway:图像生成开始网关化
人工智能·ai·chatgpt·gateway·agent·claude·harness
仙魁XAN7 小时前
【Codex + Deepseek】第 7 篇:如何把一个模糊想法变成可执行开发需求
人工智能·codex·deepseek·vibe coding
AbrahamCS8 小时前
告别无脑召回与死规则:基于国家标准(GB/T 48000.3)与大模型自主编排的 App 智能运营实战
大数据·人工智能·智能体·ontology
智码看视界9 小时前
Apodex-1.1-mini 部署实测:Int4 量化 18GB 单卡跑通 Agent Team,35B 开源逼近 1T Kimi
开源·agent·模型量化·智能体·开源大模型·大模型本地部署·apodex
长谷深风1119 小时前
AI 的 Memory 到底该记什么?
大数据·人工智能·ai agent·智能体·工具调用·用户偏好·长期memory
夏文强9 小时前
DeepSeek Harness 底层探秘:Cordis 元框架与「一切皆插件」的实现
人工智能·开源·大模型·agent·deepseek
仙魁XAN9 小时前
【Codex + Deepseek】第 2 篇:什么是 vibe coding:自然语言驱动开发的真实含义
人工智能·codex·deepseek·vibe coding
夏文强10 小时前
DeepSeek Harness 可追溯性实战:会话日志的 resume、fork 与 replay
人工智能·开源·大模型·agent·deepseek