一切皆插件,DeepSeek Harness 来了,模型终于配上自己的马具

DeepSeek 在放出 V4-Pro 正式版的同一天,把 Agent 的另一半也开源了。 模型、工具、循环、UI 全部是插件。四天 14 万星之后,看它把「Agent 应该如何被组装」公开到了哪一步。


2026 年 8 月 13 日,DeepSeek 同一天做了两件事。把 V4-Pro 正式版 推到 APP、网页和 API,并把一套叫 DeepSeek Harness(dsh 的 Agent 运行时以 MIT 协议开源。前者决定模型能多聪明,后者决定这聪明劲儿怎么进文件系统、怎么调工具、怎么留下可回放的痕迹。

官方把公式写在产品页上。Agent = Model + Harness。过去一年,社区已经反复验证过这句话。同一颗模型塞进 Claude Code、Codex、OpenCode 或自研脚手架,成绩可以差出一截。DeepSeek 这次把自家内部用的那一层摊开了。

截稿时,仓库 deepseek-ai/deepseek-harness14.4 万 star、1.47 万 fork 。它仍是开发者预览版。README 第一句警告写得很直。THERE WILL BE COMPATIBILITY-BREAKING CHANGES.

图 1 官方产品页。一句话口号,一条启动命令。


一、发布当天,一条推文、一个预览版

官方账号 @deepseek_ai 在 8 月 13 日 13 时 02 分 UTC 发帖。Harness v0.1 进入 Developer Preview,面向「正在做 agent harness 的开发者」,源码 MIT 开源。核心句子只有一句。

Everything is a plugin. Models, tools, skills, sessions, sandboxes, filesystems, loops, orchestration, and UI are ALL implemented as plugins.

截稿时这条帖约 1.97 万赞、2400 转、414 万浏览。

图 2 @deepseek_ai 的发布帖。

同一天的 API 更新日志 则在讲另一半。deepseek-v4-pro 正式版上线,并给出一串 Agent 向数字。Terminal Bench 2.1 87.9 、Cybergym 83.3 、DeepSWE 62.7 、HLE(无工具 / 有工具)42.7 / 60.0 。日志还写明,V4-Flash 的公开 Code Agent 评测,用的是「即将发布的 DeepSeek Harness 极简模式」。

Harness 已经在官方成绩单里了。

图 3 与 Harness 同日发布的 API 更新日志。


二、Harness 的本义是马具

Harness 负责把力量接到能干活的机构上,同时不让它脱缰。落到 Agent 上,它负责的是让模型看见工作区、Shell、浏览器、子 Agent;决定一次工具调用能不能执行、失败了怎么办;把「模型当时到底看见了什么」写成可回放的日志;在权限边界内持续工作。

DeepSeek Harness 是一套 构建、运行、替换 Agent 的宿主 。默认接 DeepSeek,也可以换成任何 OpenAI 兼容端点。交互可以是 Web UI(默认 http://127.0.0.1:3080)、终端、Headless,或给别的程序调用的 ACP / JSON-RPC。

仓库把这件事切得很细。packages/ 下按能力分开。session、system-prompt、tools、agent-loop、llm、fs、shell、subprocess、terminal、lsp、web、skill、subagent、workflow。架构文档的说法是,没有一块不能动的核心,新行为靠往 Cordis 上下文上挂插件。


三、「一切皆插件」,设置页里已经有 132 个

官方落地页把设计压缩成三句话。

  1. Cordis 内核只负责插件的加载、卸载和依赖,不承载具体 Agent 能力。
  2. 能力全部由插件提供。模型、工具、技能、会话、沙箱、存储、循环、调度、UI。
  3. 在配置层组合,不必改 DeepSeek Harness 源码。

产品页配的设置截图能说明问题。一个默认 Web 部署的插件列表已经到 132sessionllmtypert-registryapi-gateway 并排躺着,某一个可以单独停用。

图 4 产品页的设计段。能力由插件提供,配置层替换。

图 5 设置 → 插件。默认部署里,绝大多数条目处于已启用。

运行时本身是一棵按层叠起来的插件树。架构文档把它拆成三层。

概念 作用
profile 一种命名组合,例如自带的 webheadless
bundle 一组可打补丁的 Cordis 配置 + 代码,如 dsh-basedsh-web-app
patch 按 id 整段替换某一行配置;个人 cordis.patch.yml 叠在最上面

社区里已经有人可以「不改仓库源码、只写 patch」扩能力。@lencx_ 做桌面套壳时写过,新增功能都走 cordis patch,源码保持干净。这正是官方想要的使用方式。


四、内核带一篇论文

Harness 底下的元框架叫 Cordis。配套论文 A Programming Paradigm for Spatiotemporal Composability 标注为 2026 年 8 月 13 日草稿,作者是史一凡(北京大学 / DeepSeek)、张伟(北京大学)、崔添翼(DeepSeek-AI)。

论文要处理的不是怎么写一个 Agent loop。它处理的是插件系统一直含糊过去的两件事。

  • 时间可组合(temporal)。卸掉一个组件时,它造成的副作用能不能完整撤回。
  • 空间可组合(spatial)。组件之间的依赖能不能声明出来,并随上下文变化被动更新。

实现上,Cordis 把可逆 effect 和响应式 coeffect 收到同一个 context type 里,再做成可热替换的组件加载器。翻译成工程语言,挂上一个插件,它注册服务和事件;卸掉时,这些注册应当顺着 effect 栈退回去。

图 6 论文首页。北京大学与 DeepSeek-AI 联名,预印本仍可能修订。

多数 Agent 框架不会为卸载一个工具发一篇带形式化证明的论文。DeepSeek 愿意发,说明它把赌注押在「可拆」。


五、四种模式,同一套宿主、四套能力面

Web UI 里的「模式」给当前会话装配不同的工具、提示词和运行时。官方定义如下。

模式 是什么 适合
标准模式 完整编码 Agent。文件、Shell、检索、Skills、计划、目标、子 Agent、工作流 日常开发
PTC / Code 模式 标准模式全部能力 + Code Mode SDK,模型用一段 TypeScript 组合多步工具 调用链很长的任务
极简模式 只留持久 bash 和 str_replace_editor 评测、路径清楚的改码
创造模式 标准模式 + 运行时检查、内存里试插件、写新 preset 高信任、改自己的高级玩家

极简模式值得单独看。官方在 V4-Flash 更新日志里承认,公开 Code Agent 基准就是用极简模式跑的。社区里 @AYi_AInotes 随后补了一刀更刺耳的观察。同一颗 V4 Pro,第一轮塞 25 个工具,分数可能掉到 91;只给 bash 加编辑器,能到 96 至 99。训练时模型见到的就是窄接口,一上来把整只工具箱倒进去,等于把它推出分布。

「四种模式」在承认一件事。同一模型,工具面不同,就不是同一个 Agent。 官方评测用的脚手架,和用户打开 Web UI 默认看到的标准模式,并不是同一套东西。


六、每一次运行都有迹可循

第二句口号和第一句同样硬。Every run is traceable.

模型看见的一切写进一份只追加的会话日志。系统提示、思维链、工具调用与结果、子 Agent 调度、每一次上下文注入。界面上的 Trajectory 视图按来源展开这些事件。恢复、分叉、检索、回放共用同一条事件流。

架构文档把它写成一条不变量。Model-visible means logged. 任何进到模型请求里的东西,都必须能从日志重建。这在修 Agent 工程里最常见的事故。任务跑飞了,你却说不清当时模型到底看见了哪一段 workspace、哪一次工具结果被裁过、用户中途插进来的话进没进下一跳。

图 7 Trajectory 视图。界面、回放和审计读的是同一份事件流。

一次用户输入打开一个 Turn ,Turn 里可以有多个 Step ;一个 Step 对应一次模型请求及其后的工具执行。工具拿到函数名,前置策略、不可逆安全守卫、执行、后置处理排成流水线。被守卫拒绝的操作,后面的插件不能再放行。默认文件策略是 workspace-write,把改动关在当前工作区;更松的 danger-full-access 必须显式打开。隔离如果确认不了是否生效,系统选择失败关闭。


七、十分钟能跑起来,但第一屏会卡住

启动路径短得像演示。

sh 复制代码
npx @deepseek-ai/dsh web

源码安装则是 clone 之后 pnpm install && pnpm run build && pnpm dsh web。Web UI 默认听 127.0.0.1:3080

图 8 两种入口。多数人会先走左边那条。

文档写得很清楚,第一次打开有两处会让人以为「坏了」。

  1. 打开 设置 → 模型,填 DeepSeek API Key。路由立刻可用,不用重启。
  2. 选择工作区 ,把启动 dsh 时所在的项目加进去。没选中工作区之前,会话输入框是灰的。

官方建议的第一句任务也很克制。Summarize this repository and identify its main packages. Agent 可以读改文件、跑命令、委派子任务;碰到当前权限策略要审批的操作,UI 会先问你。

图 9 文档把第一屏的两个坑写在最前面。先配模型,再选工作区。


八、四天十四万星,插件话题已经六千多个仓库

GitHub 仓库页截稿数字。

  • Star 144k(侧栏写 144.3k)
  • Fork 14.7k
  • Watch 603
  • 许可证 MIT
  • 主题标签。ai-agents · cordis · dsh · dsh-plugin
  • 提交历史上能看到 release(dsh) 0.1.0-rc.5

图 10 2026 年 8 月 17 日的仓库页。计数之后会变。

官方让社区插件打上 dsh-plugin topic。同一时刻这个话题下有 6,317 个公开仓库。四天时间,密度已经不像「等等看」的预览项目。

图 11 官方推荐的插件发现入口。

社区动作也很快,大多没有去 fork 主仓库。

  • 有人在官方 Web UI 之外补终端体验。DSH 发布时主推 Web,TUI 相关包后来从主仓清掉过。
  • @OomolShaun 开源 dsh-oomol,把 Harness 接到 1400+ SaaS,走原生 Connections 侧栏。
  • 有人做了给新手的 Windows 一键安装包,目标是「申请一个 API Key,其余全点鼠标」。
  • @AYi_AInotes 指出仓库里还带了 DeepSeek 内部工程团队自己用的一批 Skill。code review 标准、pre-push 最小检查、stacked PR 合并、文档双语门禁、清思维链泄漏、归档决策笔记。这些比「又能写代码」更像在教 Agent 按一套 SOP 干活。

Rohan Paul 在第三天写下当时的观感。122k star,上升速度进了 GitHub 史册候选;同时又指出一个刺眼的并行事件。同一周 cache-hit 输入价涨了 6 到 12 倍,而 Agent loop 每一步都在回放系统提示和累积历史,吃的正是缓存输入。

图 12 社区里最清楚的一则并存观察。开源宿主把 Agent 调用变成常规动作之后,缓存补贴很难再按「偶尔有人跑 agent」来定价。

定价是不是和 Harness 组协调过,外人看不到。能确定的是,8 月 17 日 0 时(北京时间)起,官方 API 启用峰谷定价,闲时为高峰的一半。


九、现在还不该把它当生产主力

几个限制值得写进正文。

它是开发者预览。 官方中英文 README 都用大写警告破坏性变更。会话格式没有兼容承诺,升级后旧会话可能读不出来。适合评估和试验。

主仓库不是社区广场。 二手报道称主仓暂不收外部 PR,问题走 Discussions,能力请做成插件。官方想要的贡献形态是仓外的 dsh-plugin

模型对脚手架敏感。 上面极简 vs 标准的分差,说明换个 harness 换个系统提示,分数能掉一截。社区已经出现 dsh-anchored-standard 一类补丁,第一轮只暴露两个核心工具,模型实际调用后再解锁完整工具面。这是权宜之计。

插件生态的阴影来得一样快。 @seclink 8 月 17 日提到,针对 DeepSeek Harness 的插件黑产已经在 V2EX 上被讨论。开放安装面 + 本地 Shell + 文件系统,安全边界会迅速从「模型会不会乱删文件」扩到「你装的插件是不是在给你的 Agent 加料」。

创造模式能改自己的运行时。 它可以检查插件树、动态挂临时插件。官方没有把它放进标准 / PTC / 极简,就是因为它相当于让汽车在高速公路上换发动机。研究很好用,默认打开则不是。


十、它回答的不是「又一个 Claude Code」

仓库和论文想做的明显更靠下。

  • 成品 Agent 是这套 SDK 的第一位客户,不是唯一形态
  • 循环、工具、UI、存储、审批都可以换
  • 会话是运行事实
  • 子 Agent 可以是新实例、从历史边界 fork,或经 ACP 接到外部进程

有人已经在讨论把 Claude Code / Codex 挂成插件,让 Harness 按步骤分流。

2026 年夏天的 Agent 竞赛,已经不太是「谁的模型更会做题」。同一模型换一套马具,表现可以判若两人;同一套马具换模型,产品形态还可以保持。DeepSeek 把模型开源过很多次,这一次开源的是它认为 Agent 应该如何被组装。

四天 14 万星证明这句话击中了社区。预览版的破碎接口、评测脚手架和默认脚手架不一致、插件安全、API 计价,则会决定它三个月后是变成 Android 那样的底座,还是停在一次漂亮的开发者预览。

眼下最诚实的用法大概是这样。

  1. npx @deepseek-ai/dsh web,用极简模式先摸自己的仓库
  2. 打开 Trajectory,看模型实际吃进了什么
  3. 需要额外能力时写插件或 patch,不要 fork 主仓
  4. 把 star 数当成气温计,别当成生产合格证

配图来自 2026 年 8 月 17 日对官网、GitHub、文档与 X 的截取,以及官网静态产品图`。Star 与插件仓库计数以当日页面为准。

相关推荐
TunerT_TQ1 小时前
Valhalla静态工程审阅|源码尽调|162 个科学 Agent Skills 值不值得用?从源码静态证据拆解 scientific-agent-skills 的工程结构与风险边界【Agent Sk
开源·github
盖伦发发1 小时前
RAG 能跑≠能用:用 EDD 把 Eval 做成基础设施 (附源码)
人工智能·后端·python·功能测试
_codeOH1 小时前
大模型上下文窗口管理:从滑动窗口到 RAG
人工智能·ai编程
XTurnV0071 小时前
一文讲明白DeepSeek Harness 是什么,怎么用
人工智能
Robot_Nav1 小时前
前沿 | DeepSeek Harness 完整指南:架构原理、Windows/Linux 安装、插件生态与实战配置
人工智能·ai编辑器·deepseekharness
李舜臣1 小时前
Dart 3.13 更新,一起看看新特性
github
数据智研1 小时前
【数据分享】全国农产品成本收益资料汇编(1953-2025)
大数据·人工智能·信息可视化·数据分析
daad7772 小时前
802.11 前导码与 STF 深度解析(含检测算法与 5G 对比
人工智能·算法·5g·wifi·802.11·前导码
fail_to_code2 小时前
感受deepseek-harness那极端的工程纪律性
人工智能