1. 定义
模型驾驭工程(harness engineering)研究的是:如何把一个只能"单次推理"的大型语言模型,组织成一个可运行、可控制、可组合、可复现的智能体系统。
这里的核心区别在于作用对象。提示词工程(prompt engineering)调整的是模型的输入输出------教它"说什么";而驾驭工程构造的是模型之外的运行时------决定它"能做什么、以什么方式做、在什么边界内做"。一个裸模型只提供 model(input) → output 的一次性映射;harness 的职责是把这层映射包进一个有状态的执行环境,让它能够行动、记忆、编排,并接受约束。
2. 为什么需要驾驭层
裸模型存在三类结构性缺陷,它们无法通过提示词本身解决,而必须在模型之外的系统层处理:
- 缺乏行动能力。 模型只能生成文本,不能执行命令、读写文件或访问网络,也无法验证自己给出的结论。它需要对真实世界的"执行通道"才能产生闭环。
- 缺乏持久状态。 模型调用之间是无状态的。跨多轮、跨会话的任务需要外部的会话存储、上下文压缩与视角控制,才能维持连续性和一致性。(缓存命中)
- 缺乏安全边界。 模型没有对自身行为的风险意识,可能执行危险操作、无限循环或耗尽预算。约束必须由外部的沙箱、审批与策略机制强制施加,而非依赖模型自觉。
驾驭工程的价值,就是把这三类问题系统性地交给一个可控的运行时去承担。
3. Harness 的组成部分
一个完整的 agent 驾驭层通常由以下五部分构成:
(1)执行循环
系统的核心。将"一问一答"改为"感知---决策---工具调用---观察结果---再决策"的循环,直到达成目标、被中断或判定为阻塞。这是 agent 与普通"单轮普通对话"最根本的区别。
(2)工具层
为模型提供对现实世界的操作接口:命令行、文件系统、网络检索、子代理、工作流等。模型的输出被解析为结构化的工具调用,由 harness 实际执行,再将执行结果回传。
(3)会话与记忆
负责状态管理。会话层持久化完整对话;压缩(compaction)在上下文接近上限时将其摘要化以释放空间。
(4)控制面(Sandbox / Plan Mode / Approval)
负责安全与约束。沙箱按权限分级隔离危险操作;计划模式要求先提交方案、经确认后再执行(权限的高低);审批流在高风险动作前进行人工拦截。约束层是系统"可信任"的基础。
(5)编排层(Subagent / Workflow / Goal / Ralph)
负责扩展性与长期性。单 agent 受上下文与注意力上限约束,因此需要多智能体编排:subagent并行分解任务,workflow以多阶段流水线组织扇出并汇总结构化结果,目标(goal)驱动跨轮次的长期推进,Ralph 通过"每轮更换执行者、以共享工作区作为长期记忆"实现记忆外置的迭代。(这里以一个工作区多个对话口,通过共享记忆来提取上下文工作,缓存命中更高理解)
4. DeepSeek Harness 的架构特征:可组合的驾驭内核
在工程实现上,@deepseek-ai/dsh 不是一整套写死的逻辑,而是一套以插件为单位的可组合系统。其设计围绕三个核心概念展开:
- Profile:一个"运行时组合",由有序的插件组合包列表加上用户自身的覆盖配置构成。
- Patch 层叠加 :配置树从空根开始,按序叠加各 bundle 的默认层、profile 自身的
cordis.patch.yml、home 级覆盖,最后是--patch指定的最上层覆盖。层越靠后优先级越高,因此用户只需追加一个补丁层即可覆盖默认行为,无需修改源码。 - 不可变快照:启动器只解析自身参数,将其余参数原样交由 profile 内注入的应用插件,各插件共享一份不可变的命令行快照进行独立解析。命令语法的归属因此清晰可判定,无效命令、配置错误与启动失败均以非零状态退出,保证系统可脚本化、可复现。
因此,DeepSeek Harness 的驾驭模型可以概括为:通过插件与补丁层的叠加装配能力,通过执行循环、工具、会话与编排放大能力,通过沙箱、审批与边界约束能力。
5. 与 Codex、OpenClaw 的对比
本节基于各项目公开的 GitHub 与文档信息整理,版本迭代较快,结论应以当前时点和具体场景为准。
本节源自于本人长期使用不同AI工具的思考,针对不同的任务适合用不同的AI工具。
5.1 定位差异
三者并非同一条赛道,差异主要体现在 harness 的构造方式与目标问题域:
| 工具 | 定位 | 驾驭形态 |
|---|---|---|
| Codex | 开源、终端优先的编码 agent | 单机 CLI + 审批模式(只读/建议/全自动)+ OS 级沙箱(macOS Seatbelt、Linux Landlock/容器)+ AGENTS.md 约定 + sub-agent + MCP |
| OpenClaw | 开源个人 AI 助理,跨系统、跨平台 | 常驻 gateway + 工具/插件/skills + 多渠道接入(微信飞书等)+ 浏览器控制 + 定时任务 + 多模型即插即用 |
| DeepSeek Harness | 可组合的 agent 驾驭内核 | 插件式+ profile/patch 层叠加 + web/headless/TUI 同内核 + 内建 goal/subagent/workflow/ralph 编排原语 + 分层沙箱与审批 |
Codex 的 harness 面向单机、编码优先、以仓库与 Git 为中心 ;OpenClaw 的 harness 面向常驻、事件与调度驱动、多渠道消息 ;DeepSeek Harness 的 harness 面向可组合内核、多形态入口、长程目标、编排与受控。
5.2 适用场景
DeepSeek Harness 在以下问题上更具优势:
- 同一 agent 内核需要部署为多种形态(协作 GUI、无人值守 headless、脚本嵌入);
- 需要精细、可叠加的配置覆盖与多环境、多 profile 管理;
- 长程、多轮、需要目标生命周期管理与自动续跑的任务;
- 大规模多智能体编排(并行扇出、多阶段流水线、结构化结果汇总);
- 需要强审批、分级沙箱与可脚本化、失败显式化的生产场景。
(个人使用习惯:工程化项目用dsh;需要操作本机比如排查问题用codex;想要追求使用方便快捷用openclaw/hermes,接入飞书可随时处理工作文件)
5.4 边界
- 仅需处理单一仓库、看重 Git 深度集成与编码流畅度时,Codex 更轻量。
- 需要常驻个人助理、家用设备部署、多渠道消息与定时任务时,OpenClaw 更贴合。
- DSH 的可组合性、长程与编排能力以更高的复杂度与心智成本为代价,对短平快的单点编码任务可能显得过重。
选择工具的核心原则仍是先明确问题域,再选择对应的驾驭形态。
6. 结论
模型驾驭工程的本质,是把一次性的模型推理改造成一个受控、有记忆、可编排、可组合、可复现的闭环系统。
DeepSeek Harness 的价值不在于"模型更强",而在于它把这套驾驭能力本身工程化了:以插件与补丁层实现可组合装配,以多形态入口覆盖协作、无人值守与嵌入三类场景,以长程目标与编排原语支撑复杂任务,以分层沙箱、审批与不可变快照保证受控与可复现。
相比之下,Codex 强在编码场景的顺手,OpenClaw 强在个人助理的常驻与多渠道,而 DeepSeek Harness 强在"驾驭"这一层本身。