DeepSeek Harness 技术拆解:全插件架构、九项能力对比与本地实测

导语

DeepSeek Harness 开源 12 小时破 5 万 Star,但多数解读停留在"马鞍"比喻,未能揭示其架构本质。本文换一个角度------把智能体比作台式机,模型是软件,Harness 是硬件加操作系统------并以此为主线,完成九项 Agent 能力横向对比、四大先进性分析、七项本地实测验证,以及与其他主流工具的客观差异评估。

一句话总结:AI 工具竞争正从"模型层"转向"Harness 层",而 Harness 不是中性包装纸,它直接决定效率。

品牌机 vs 半兼容机 vs 兼容机

用"电脑"比喻,当前主流 AI 编程工具清晰分为三类:

类型 代表 特点
品牌机 Codex / Claude Code 整机封装,主板(内核)不可改动
半兼容机 WorkBuddy 可换 CPU(模型)、可装 App(Skill),主板厂商定
兼容机 DeepSeek Harness CPU、电源、机箱、屏幕全散件,用户自行组装

核心差异不在高低,而在"省心 vs 自由"的取舍。

九项能力清单横向对比

DeepSeek 官方列出九项 Agent 能力------模型、工具、技能、会话、沙箱、存储、循环、调度、UI------声明全部由插件组合,可自由替换。

模块 DeepSeek Harness Codex / Claude Code WorkBuddy
模型 任意换(OpenAI 格式) 锁厂商自家模型 可切换、自定义
工具 插件随便加 内置固定,MCP 扩展 内置固定,连接器+MCP 扩展
技能 插件 自定义指令、subagents skillhub 装/写
会话 仅追加日志,可回放分叉 产品定,部分可导入导出 产品定
沙箱 插件(提供方可换) 云端沙箱写死 执行环境产品定
存储 插件 产品定 资料库、记忆产品架构
循环 主循环也是插件 写死 厂商定,不开放替换
调度 插件 无用户级定时调度 有自动化
UI 插件(连界面都能换) 给啥用啥 产品界面

Codex 仅开放技能、工具(MCP)、模型三个接口;WorkBuddy 多开一个"调度"接口;DeepSeek Harness 九项全开放,主循环和界面均为可替换插件。

四大先进性

1. 全插件架构

模型、工具、技能、循环、UI 全部插件化。发布数日社区已产出 1000+ 插件(飞书机器人、企业微信网关、语音朗读、桌面封装)。品牌机需新能力要等厂商排期,兼容机当天即可协作完成。

2. 过程全透明

每一步工具调用、思维链、返回结果均写入 append-only 日志,支持回放、分叉、重跑。业界称为"Agent 的 DevTools",品牌机黑盒无法提供同等可观测性。

注意:Harness 框架运行于本地,但模型推理走 DeepSeek API,prompt 与上下文仍需送出。准确表述为"执行过程透明、环境可控",非"数据完全不出本地"。

3. 模型无关

兼容任意 OpenAI 格式模型,轻量任务用 Flash,高难度切 Pro,缓存命中成本极低。实测 5,661,568 tokens 缓存读取,费用近乎为零。

4. 工具执行本地完成

磁盘扫描、文件写入、Python 运行、网页抓取均在本地执行,非云端沙箱周转,对本地文件操作场景为硬性优势。

行业影响

官方实测同一 V4 Flash 模型在 8 个框架运行 30 个任务,完成次数 14 至 20,差距近三分之一。模型一致,Harness 不同,结果显著差异------Harness 不是中性包装纸,是直接决定效率的变量。

笔者在公益培训中验证了同一逻辑:同一讲师(模型),叠加"课程设计 Skill"(Harness 层),耗时从 1 小时降至 5 分钟。价值积累发生在 Harness 层,非模型层。DeepSeek 将这一层开源,实质是将竞争从模型层拉至 Harness 层。

未来方向:AI 工具竞争主战场将从"谁的模型更聪明"转向"谁的 Harness 更高效、更开放、更可控"。

本地实盘:七项验证

安装(Node.js ≥ 22.19):

bash 复制代码
mkdir D:\deepseek-harness && cd D:\deepseek-harness
npx -y @deepseek-ai/dsh web

浏览器访问 http://127.0.0.1:3080,填入 DeepSeek 官网创建的 API Key。

验证一:跨项目磁盘扫描 指令:扫描 D:\development,按修改时间倒序列出今日改过的 md 文件,每条给一句话摘要。结果:跨项目读取文件,自动生成摘要,通过。

验证二:真实写盘验证 指令:写入 test.md(我是谁 + 当前时间 + 测试目标),读回确认。步骤链:Think → Pwsh Get date → Write → Read。说明先调系统时间再写,非"假装"执行。

验证三:自建 Skill 按 skill-creator 规范创建 test-harness-skill,创建成功,Skill 系统真实运行。

验证四:跨平台 Skill 复用 调用 WorkBuddy 上的 gzh-writer-enhanced 生成短文,Harness 可直接读取使用。说明 Skill 格式跨 Harness 通用,非私有协议。

验证五:长链路全自动抓取 curl 抓取 workbuddy.cn 首页 → 提取标题副标题 → 写入 md → 读回确认,5 步一气呵成。对比品牌机常见的中途询问"是否继续",Harness 完成度更高。

验证六:并行子任务执行 并行计算 1-100 的偶数和与奇数和,分叉两个上下文并行执行,汇总后自动交叉验证(2550+2500=5050=100×101/2),非简单输出两个数等用户核对。

验证七:自我出账 复盘完整对话:9 条提问 / 105 次工具调用(pwsh 55 + read 28 + write 8 + job_output 6 + grep 4 + glob 3 + job_kill 1)/ 活跃耗时 16.5 分钟 / 输入 70,502 + 输出 38,805 = 109,307 tokens / 缓存读取 5,661,568 tokens。AI 首次交出自身运行明细账。

客观评价与适用边界

  1. 门槛仍偏高:命令行 + Web 起步,对非开发者不够友好。
  2. 仍在快速迭代:官方声明"会有破坏兼容性的变更",插件稳定性存不确定性。
  3. 品牌机亦有其价值:Codex、Claude Code 对仅需完成任务的普通用户更省心。
  4. 强 Harness 不能弥补弱模型:小模型 + 强 Harness 的天花板由模型逻辑能力决定。

品牌机与兼容机不是高低之分,而是"省心 vs 自由"的取舍。用户是否愿意投入学习成本换取任意拼装能力,才是选择 Harness 的真正门槛。

结语

DeepSeek 将"怎么攒这台电脑"的图纸开源,意味着普通人不再被动等待厂商提供功能,可自行拼装趁手工具。AI 工具竞争正从模型层向 Harness 层转移,这对开发者生态和工具开放性而言,是值得关注的信号。

相关推荐
ServBay1 小时前
DeepSeek Harness 实战:如何搭建完整的 AI Agent 本地开发环境
aigc·ai编程·deepseek
plainGeekDev2 小时前
从设计到实现:登录模块的 Loop 实战记录
ai编程·claude
土豆12503 小时前
半年 20 万 Star 的「反 Vibe Coding」:Matt Pocock 是如何用一套 Skill 驯服 AI 编程代理的
人工智能·ai编程
9i编程3 小时前
四大准则也还是不靠谱啊:定好了铁律,AI 照样偷懒给你看
人工智能·openai·ai编程
名不经传的养虾人4 小时前
从0到1:企业级AI项目迭代日记 Vol.87|记忆链路切换了,系统接管有了质量门
大数据·人工智能·ai编程·企业ai·多agent协作
Mr_liu_6664 小时前
Claude非专业入门实战笔记(4):Claude运行方式简单解析——从RAG到代理循环
笔记·ai编程·claude
黑科技iOS上架5 小时前
摆脱Appstore4.3拒审泥潭
经验分享·ai编程
今天你AiPy了吗6 小时前
AI桌面助手的隐私底线 数据可落本地不出域,还能一键切换云端,全能智能体
人工智能·python·ai·ai编程·智能体
一只叫煤球的猫7 小时前
Spring AI 2.0 源码解析(一):一次 ChatClient 调用到底经历了什么?
后端·面试·ai编程