8月12号到13号这两天,DeepSeek 搞了个大新闻,又搞砸了一个大新闻。
大家关注的都是 V4 Pro 正式版发布不到 24 小时就被紧急撤回------实测性能和官方宣传差距太大,翻了车。
但很少有人注意到,就在 V4 Pro 翻车的同一个晚上,DeepSeek 悄悄开源了另一个东西,叫 DeepSeek Harness(简称 DSH)。

这才是真正值得聊的。
如果说 V4 Pro 是 DeepSeek 想证明"我的模型也能打",那 Harness 就是 DeepSeek 在说------模型之外,我还要把 Agent 的那层壳也给开源了。
R1 当年把闭源模型的推理溢价打了下来。这一次,DSH 想把闭源 Agent 外壳的溢价也打下来。
Harness 到底是个什么东西?
先搞清楚一个最朴素的问题:大模型能思考,但它没有手脚。
你让 GPT 写一段代码,它能写出来,但不能自己跑起来、不能调试、不能改文件、不能联网查资料。ChatGPT 加了 Code Interpreter 倒是能跑了,但那个沙箱是黑盒的,你没法往里插自己的工具。
Harness 就是那个"手脚"。
官方给的定位很简单:Model + Harness = Agent。模型负责思考推理,Harness 负责实际执行。
你可以把它理解成一个"Agent 操作系统"。管理项目和文件、跑长任务、调度多个子 Agent、管理上下文、联网搜索、调用外部工具------所有这些本该由 Agent 干的事,Harness 都给你搭好了架子。
但这不是重点。
重点是它的设计哲学:一切皆插件(Everything is a Plugin)。
这句话不是营销话术,是字面事实。拆过源码的开发者确认:模型、工具、技能、会话、沙箱、存储、Agent Loop、调度、UI,全是插件,挂在同一个 Cordis 底座上,没有特权内核 CSDN。
现在市面上几乎所有 Agent 产品------Claude Code、OpenAI Codex、Cursor------都是"整机"交付的。模型、工具、执行循环、UI 全部耦合在一起。厂商给你什么,你用什么。
Harness 把这事反过来做了。
"一切皆插件"到底是什么意思?
DeepSeek Harness 基于 Cordis 插件系统构建。Cordis 不是个 Agent 框架,它是个元框架------只负责插件的加载、卸载和依赖关系,不掺和任何具体业务。
它的设计思想来自北京大学和 DeepSeek 联合署名的论文《A Programming Paradigm for Spatiotemporal Composability》(时空可组合性编程范式)。核心回答一个问题:当系统里的每个模块都可能被替换时,怎么保证它们还能正确协作? CSDN
整个架构分三层:
第一层:Cordis 内核。 极简,只管插件的加载、卸载、依赖注入和事件通信。它什么具体活都不干,但所有插件都挂在它上面。
第二层:插件层。 所有 Agent 能力全在这里------模型适配器、文件系统、Shell 执行、网页检索、技能(Skills)、会话管理、沙箱、存储、循环调度、Web UI......目前官方仓库里有 238 个工作区项目、219 个包 人人都是产品经理。
第三层:配置层。 开发者通过 YAML 配置文件组合插件,不用碰源码。想换模型?改一行配置。想换工具?换一个插件。想换 UI?社区已经有 TUI、移动端 UI 的插件了 头条。

更狠的是,连 Agent Loop 本身都是插件。也就是说,你觉得 DeepSeek 默认的执行循环不好?你可以自己写一个换掉它,其他模块不用动。
这跟传统 Agent 框架的区别,可以用一个比方:
传统 Agent 是一台出厂装好的电脑,你最多插个 U 盘。
Harness 是一块巨大的洞洞板------芯片、内存、硬盘、屏幕、键盘,全靠你自己插。
四个模式,覆盖从极简到全功能
DeepSeek Harness 提供了四种执行模式,适合不同场景 Gigazine:
Standard 模式:全套工具集,日常开发用这个。
Code 模式:用模型生成的代码来协调多次工具调用,更灵活但也更复杂。
Minimal 模式:只给 Shell 和文件编辑器,用来做基准测试,排除框架差异测模型本身的能力。
Creator 模式:可以检查当前执行环境、在内存里测试 Cordis 插件,适合做插件开发。
特别有意思的是 Minimal 模式------DeepSeek 自己在 7 月 31 日 V4 Flash 更新的时候,就已经用 Harness 的 Minimal 模式来做代码智能体评测了,相当于"用自家的框架跑自家的模型测自家的分",内部验证早就做了 深科技。
另一个值得单独说的设计是可追溯性。Harness 采用只追加(append-only)的会话日志,模型看到的一切------系统提示词、思维链、工具调用与结果、子 Agent 调度、每一次上下文压缩------全部完整记录。
上下文压缩不会删除原始历史,只是用"替换事件"改变模型此后看到的表象。你可以在 Trajectory 视图里按来源追溯,支持恢复、分叉、检索和回放。
官方把这个原则概括成一句话:模型可见,即已记录。 百科
最狠的一步:把竞争对手变成你的插件
DeepSeek Harness 有个很鸡贼的设计:它可以把 Claude Code 和 OpenAI Codex 当成子 Agent 来调用 MindStudio。

什么意思?就是你在 DSH 里面编排工作流,遇到难搞的任务,可以直接丢给 Claude Code 去做,做完了结果再回到你的主流程里。
这一下,DSH 的定位就变了------它不是 Claude Code 的竞品,它是Claude Code 的调度器。
你想啊,DeepSeek 为什么要这么做?
因为它卖的是模型,不是外壳。Claude Code 再好用,用的也是 Anthropic 的模型。但如果 DSH 成了事实标准,开发者都用 DSH 来编排 Agent 工作流,那模型选型就变成了一个配置问题------今天你用 Claude,明天觉得 DeepSeek 够好了,换一行配置就行。
外壳越开放,模型的竞争就越激烈。而价格战,恰好是 DeepSeek 的主场。
这步棋,有点像安卓当年的策略------我不靠操作系统赚钱,我靠生态和规模赚钱。操作系统越开放,用的人越多,我的核心盈利点(对 DeepSeek 来说就是模型 API)就越吃香。
这不是技术发布,是战略布局
把 V4 Pro 和 Harness 放在一起看,你会发现 DeepSeek 的套路非常清晰。
V4 Pro 想证明的是:我的模型能力已经接近第一梯队了,但价格只有几十分之一。
Harness 想证明的是:Agent 的外壳不值钱,应该开源变成公共品,竞争回到模型本身的能力和价格上。
两步棋,一个目的------把 AI Agent 的成本打下来。
R1 当年把推理的溢价打下来了,让全世界知道"推理不是闭源的特权"。现在 DSH 想把 Agent 外壳的溢价也打下来,告诉大家"这层壳也不是闭源的特权" 博客园。
而且从实测来看,自己的模型配自己的 Harness,确实比硬套别人家的壳顺手。在 DSH 里,模型、工具、缓存、Trajectory 日志是一套一起设计的,有开发者跑出来 99% 的缓存命中率------这不是随便哪个第三方外壳都能喂出来的。
缓存命中率意味着什么?意味着成本。Agent 编程场景里,大部分 Token 都花在重复读取上下文上。缓存命中率从 80% 提到 99%,成本可能差一个数量级。
写在最后:Agent 的"安卓时刻"来了吗?
DeepSeek Harness 上线不到一天,GitHub Star 就冲到了9万。上一个这么猛的还是全民小龙虾OpenClaw.

这个热度说明什么?说明开发者等这套东西等很久了。
现在的 Agent 市场,有点像智能手机早期的功能机时代------每个厂商都做整机,你买了诺基亚就不能用安卓的应用,换品牌意味着全部重来。Claude Code 有 Claude Code 的生态,Codex 有 Codex 的生态,互相不通。
DSH 想做的,是 Agent 时代的安卓------一个开放的、可插拔的、不绑定任何厂商的运行时底座。
当然,v0.1 开发者预览版,路还很长。Bug 肯定有,生态还在早期,插件质量参差不齐。安卓也不是第一天就打败塞班的。
但方向这个东西,一旦走对了,速度会比所有人想象的都快。
R1 让推理变得便宜,DSH 想让 Agent 变得自由。
如果这两步都走成了,DeepSeek 就不只是一个"便宜的模型厂商"了。
它会成为 Agent 时代的底层玩家。