导语
DeepSeek Harness 开源 12 小时破 5 万 Star,但多数解读停留在"马鞍"比喻,未能揭示其架构本质。本文换一个角度------把智能体比作台式机,模型是软件,Harness 是硬件加操作系统------并以此为主线,完成九项 Agent 能力横向对比、四大先进性分析、七项本地实测验证,以及与其他主流工具的客观差异评估。
一句话总结:AI 工具竞争正从"模型层"转向"Harness 层",而 Harness 不是中性包装纸,它直接决定效率。
品牌机 vs 半兼容机 vs 兼容机
用"电脑"比喻,当前主流 AI 编程工具清晰分为三类:
| 类型 | 代表 | 特点 |
|---|---|---|
| 品牌机 | Codex / Claude Code | 整机封装,主板(内核)不可改动 |
| 半兼容机 | WorkBuddy | 可换 CPU(模型)、可装 App(Skill),主板厂商定 |
| 兼容机 | DeepSeek Harness | CPU、电源、机箱、屏幕全散件,用户自行组装 |
核心差异不在高低,而在"省心 vs 自由"的取舍。
九项能力清单横向对比
DeepSeek 官方列出九项 Agent 能力------模型、工具、技能、会话、沙箱、存储、循环、调度、UI------声明全部由插件组合,可自由替换。
| 模块 | DeepSeek Harness | Codex / Claude Code | WorkBuddy |
|---|---|---|---|
| 模型 | 任意换(OpenAI 格式) | 锁厂商自家模型 | 可切换、自定义 |
| 工具 | 插件随便加 | 内置固定,MCP 扩展 | 内置固定,连接器+MCP 扩展 |
| 技能 | 插件 | 自定义指令、subagents | skillhub 装/写 |
| 会话 | 仅追加日志,可回放分叉 | 产品定,部分可导入导出 | 产品定 |
| 沙箱 | 插件(提供方可换) | 云端沙箱写死 | 执行环境产品定 |
| 存储 | 插件 | 产品定 | 资料库、记忆产品架构 |
| 循环 | 主循环也是插件 | 写死 | 厂商定,不开放替换 |
| 调度 | 插件 | 无用户级定时调度 | 有自动化 |
| UI | 插件(连界面都能换) | 给啥用啥 | 产品界面 |
Codex 仅开放技能、工具(MCP)、模型三个接口;WorkBuddy 多开一个"调度"接口;DeepSeek Harness 九项全开放,主循环和界面均为可替换插件。
四大先进性
1. 全插件架构
模型、工具、技能、循环、UI 全部插件化。发布数日社区已产出 1000+ 插件(飞书机器人、企业微信网关、语音朗读、桌面封装)。品牌机需新能力要等厂商排期,兼容机当天即可协作完成。
2. 过程全透明
每一步工具调用、思维链、返回结果均写入 append-only 日志,支持回放、分叉、重跑。业界称为"Agent 的 DevTools",品牌机黑盒无法提供同等可观测性。
注意:Harness 框架运行于本地,但模型推理走 DeepSeek API,prompt 与上下文仍需送出。准确表述为"执行过程透明、环境可控",非"数据完全不出本地"。
3. 模型无关
兼容任意 OpenAI 格式模型,轻量任务用 Flash,高难度切 Pro,缓存命中成本极低。实测 5,661,568 tokens 缓存读取,费用近乎为零。
4. 工具执行本地完成
磁盘扫描、文件写入、Python 运行、网页抓取均在本地执行,非云端沙箱周转,对本地文件操作场景为硬性优势。
行业影响
官方实测同一 V4 Flash 模型在 8 个框架运行 30 个任务,完成次数 14 至 20,差距近三分之一。模型一致,Harness 不同,结果显著差异------Harness 不是中性包装纸,是直接决定效率的变量。
笔者在公益培训中验证了同一逻辑:同一讲师(模型),叠加"课程设计 Skill"(Harness 层),耗时从 1 小时降至 5 分钟。价值积累发生在 Harness 层,非模型层。DeepSeek 将这一层开源,实质是将竞争从模型层拉至 Harness 层。
未来方向:AI 工具竞争主战场将从"谁的模型更聪明"转向"谁的 Harness 更高效、更开放、更可控"。
本地实盘:七项验证
安装(Node.js ≥ 22.19):
bash
mkdir D:\deepseek-harness && cd D:\deepseek-harness
npx -y @deepseek-ai/dsh web
浏览器访问 http://127.0.0.1:3080,填入 DeepSeek 官网创建的 API Key。



验证一:跨项目磁盘扫描 指令:扫描 D:\development,按修改时间倒序列出今日改过的 md 文件,每条给一句话摘要。结果:跨项目读取文件,自动生成摘要,通过。

验证二:真实写盘验证 指令:写入 test.md(我是谁 + 当前时间 + 测试目标),读回确认。步骤链:Think → Pwsh Get date → Write → Read。说明先调系统时间再写,非"假装"执行。

验证三:自建 Skill 按 skill-creator 规范创建 test-harness-skill,创建成功,Skill 系统真实运行。

验证四:跨平台 Skill 复用 调用 WorkBuddy 上的 gzh-writer-enhanced 生成短文,Harness 可直接读取使用。说明 Skill 格式跨 Harness 通用,非私有协议。

验证五:长链路全自动抓取 curl 抓取 workbuddy.cn 首页 → 提取标题副标题 → 写入 md → 读回确认,5 步一气呵成。对比品牌机常见的中途询问"是否继续",Harness 完成度更高。

验证六:并行子任务执行 并行计算 1-100 的偶数和与奇数和,分叉两个上下文并行执行,汇总后自动交叉验证(2550+2500=5050=100×101/2),非简单输出两个数等用户核对。

验证七:自我出账 复盘完整对话:9 条提问 / 105 次工具调用(pwsh 55 + read 28 + write 8 + job_output 6 + grep 4 + glob 3 + job_kill 1)/ 活跃耗时 16.5 分钟 / 输入 70,502 + 输出 38,805 = 109,307 tokens / 缓存读取 5,661,568 tokens。AI 首次交出自身运行明细账。



客观评价与适用边界
- 门槛仍偏高:命令行 + Web 起步,对非开发者不够友好。
- 仍在快速迭代:官方声明"会有破坏兼容性的变更",插件稳定性存不确定性。
- 品牌机亦有其价值:Codex、Claude Code 对仅需完成任务的普通用户更省心。
- 强 Harness 不能弥补弱模型:小模型 + 强 Harness 的天花板由模型逻辑能力决定。
品牌机与兼容机不是高低之分,而是"省心 vs 自由"的取舍。用户是否愿意投入学习成本换取任意拼装能力,才是选择 Harness 的真正门槛。
结语
DeepSeek 将"怎么攒这台电脑"的图纸开源,意味着普通人不再被动等待厂商提供功能,可自行拼装趁手工具。AI 工具竞争正从模型层向 Harness 层转移,这对开发者生态和工具开放性而言,是值得关注的信号。
