模型驾驭工程(Harness Engineering)与 DeepSeek Harness 的定位

1. 定义

模型驾驭工程(harness engineering)研究的是:如何把一个只能"单次推理"的大型语言模型,组织成一个可运行、可控制、可组合、可复现的智能体系统

这里的核心区别在于作用对象。提示词工程(prompt engineering)调整的是模型的输入输出------教它"说什么";而驾驭工程构造的是模型之外的运行时------决定它"能做什么、以什么方式做、在什么边界内做"。一个裸模型只提供 model(input) → output 的一次性映射;harness 的职责是把这层映射包进一个有状态的执行环境,让它能够行动、记忆、编排,并接受约束。

2. 为什么需要驾驭层

裸模型存在三类结构性缺陷,它们无法通过提示词本身解决,而必须在模型之外的系统层处理:

  1. 缺乏行动能力。 模型只能生成文本,不能执行命令、读写文件或访问网络,也无法验证自己给出的结论。它需要对真实世界的"执行通道"才能产生闭环。
  2. 缺乏持久状态。 模型调用之间是无状态的。跨多轮、跨会话的任务需要外部的会话存储、上下文压缩与视角控制,才能维持连续性和一致性。(缓存命中)
  3. 缺乏安全边界。 模型没有对自身行为的风险意识,可能执行危险操作、无限循环或耗尽预算。约束必须由外部的沙箱、审批与策略机制强制施加,而非依赖模型自觉。

驾驭工程的价值,就是把这三类问题系统性地交给一个可控的运行时去承担。

3. Harness 的组成部分

一个完整的 agent 驾驭层通常由以下五部分构成:

(1)执行循环

系统的核心。将"一问一答"改为"感知---决策---工具调用---观察结果---再决策"的循环,直到达成目标、被中断或判定为阻塞。这是 agent 与普通"单轮普通对话"最根本的区别。

(2)工具层

为模型提供对现实世界的操作接口:命令行、文件系统、网络检索、子代理、工作流等。模型的输出被解析为结构化的工具调用,由 harness 实际执行,再将执行结果回传。

(3)会话与记忆

负责状态管理。会话层持久化完整对话;压缩(compaction)在上下文接近上限时将其摘要化以释放空间。

(4)控制面(Sandbox / Plan Mode / Approval)

负责安全与约束。沙箱按权限分级隔离危险操作;计划模式要求先提交方案、经确认后再执行(权限的高低);审批流在高风险动作前进行人工拦截。约束层是系统"可信任"的基础。

(5)编排层(Subagent / Workflow / Goal / Ralph)

负责扩展性与长期性。单 agent 受上下文与注意力上限约束,因此需要多智能体编排:subagent并行分解任务,workflow以多阶段流水线组织扇出并汇总结构化结果,目标(goal)驱动跨轮次的长期推进,Ralph 通过"每轮更换执行者、以共享工作区作为长期记忆"实现记忆外置的迭代。(这里以一个工作区多个对话口,通过共享记忆来提取上下文工作,缓存命中更高理解)

4. DeepSeek Harness 的架构特征:可组合的驾驭内核

在工程实现上,@deepseek-ai/dsh 不是一整套写死的逻辑,而是一套以插件为单位的可组合系统。其设计围绕三个核心概念展开:

  • Profile:一个"运行时组合",由有序的插件组合包列表加上用户自身的覆盖配置构成。
  • Patch 层叠加 :配置树从空根开始,按序叠加各 bundle 的默认层、profile 自身的 cordis.patch.yml、home 级覆盖,最后是 --patch 指定的最上层覆盖。层越靠后优先级越高,因此用户只需追加一个补丁层即可覆盖默认行为,无需修改源码。
  • 不可变快照:启动器只解析自身参数,将其余参数原样交由 profile 内注入的应用插件,各插件共享一份不可变的命令行快照进行独立解析。命令语法的归属因此清晰可判定,无效命令、配置错误与启动失败均以非零状态退出,保证系统可脚本化、可复现。

因此,DeepSeek Harness 的驾驭模型可以概括为:通过插件与补丁层的叠加装配能力,通过执行循环、工具、会话与编排放大能力,通过沙箱、审批与边界约束能力。

5. 与 Codex、OpenClaw 的对比

本节基于各项目公开的 GitHub 与文档信息整理,版本迭代较快,结论应以当前时点和具体场景为准。

本节源自于本人长期使用不同AI工具的思考,针对不同的任务适合用不同的AI工具。

5.1 定位差异

三者并非同一条赛道,差异主要体现在 harness 的构造方式与目标问题域:

工具 定位 驾驭形态
Codex 开源、终端优先的编码 agent 单机 CLI + 审批模式(只读/建议/全自动)+ OS 级沙箱(macOS Seatbelt、Linux Landlock/容器)+ AGENTS.md 约定 + sub-agent + MCP
OpenClaw 开源个人 AI 助理,跨系统、跨平台 常驻 gateway + 工具/插件/skills + 多渠道接入(微信飞书等)+ 浏览器控制 + 定时任务 + 多模型即插即用
DeepSeek Harness 可组合的 agent 驾驭内核 插件式+ profile/patch 层叠加 + web/headless/TUI 同内核 + 内建 goal/subagent/workflow/ralph 编排原语 + 分层沙箱与审批

Codex 的 harness 面向单机、编码优先、以仓库与 Git 为中心 ;OpenClaw 的 harness 面向常驻、事件与调度驱动、多渠道消息 ;DeepSeek Harness 的 harness 面向可组合内核、多形态入口、长程目标、编排与受控

5.2 适用场景

DeepSeek Harness 在以下问题上更具优势:

  • 同一 agent 内核需要部署为多种形态(协作 GUI、无人值守 headless、脚本嵌入);
  • 需要精细、可叠加的配置覆盖与多环境、多 profile 管理;
  • 长程、多轮、需要目标生命周期管理与自动续跑的任务;
  • 大规模多智能体编排(并行扇出、多阶段流水线、结构化结果汇总);
  • 需要强审批、分级沙箱与可脚本化、失败显式化的生产场景。

个人使用习惯:工程化项目用dsh;需要操作本机比如排查问题用codex;想要追求使用方便快捷用openclaw/hermes,接入飞书可随时处理工作文件

5.4 边界

  • 仅需处理单一仓库、看重 Git 深度集成与编码流畅度时,Codex 更轻量。
  • 需要常驻个人助理、家用设备部署、多渠道消息与定时任务时,OpenClaw 更贴合。
  • DSH 的可组合性、长程与编排能力以更高的复杂度与心智成本为代价,对短平快的单点编码任务可能显得过重。

选择工具的核心原则仍是先明确问题域,再选择对应的驾驭形态

6. 结论

模型驾驭工程的本质,是把一次性的模型推理改造成一个受控、有记忆、可编排、可组合、可复现的闭环系统。

DeepSeek Harness 的价值不在于"模型更强",而在于它把这套驾驭能力本身工程化了:以插件与补丁层实现可组合装配,以多形态入口覆盖协作、无人值守与嵌入三类场景,以长程目标与编排原语支撑复杂任务,以分层沙箱、审批与不可变快照保证受控与可复现。

相比之下,Codex 强在编码场景的顺手,OpenClaw 强在个人助理的常驻与多渠道,而 DeepSeek Harness 强在"驾驭"这一层本身。

相关推荐
EEET智选44 分钟前
科技晨间速报 | 苹果折叠屏deepseek新模型同日发布
人工智能·科技·ai·aigc·手机
智购科技无人售货机工厂44 分钟前
2026 AI视觉货柜渗透率突破48%:从技术选型到规模化部署的工程实践~YH
人工智能
CIO_Alliance1 小时前
AI微调系列(1)| 全量微调、LoRA、QLoRA 三种方案怎么选
前端·人工智能·神经网络·机器学习·embedding·企业ai转型
真上帝的左手1 小时前
27. 数据产品- BI - AI 应用实战终篇-从 RAG 架构到企业级平台落地
大数据·人工智能·架构
桃西西呀1 小时前
苹果刚发布 iPhone Duo,可 3104 款手机参数一聚类,参数分了档,价格却不匹配
人工智能·机器学习·llm
Ai小way1 小时前
【deepseek 实战·22】把键盘变成钢琴:五声音阶保底,怎么按都不难听
人工智能
Mr数据杨1 小时前
CIFAR10 图像分类实战复盘 从 Kaggle 练习赛到可落地视觉基线
人工智能·数据分析·kaggle竞赛
zzzll11111 小时前
LLM 学习第 24 课:Agent Harness
前端·人工智能·学习
水境传感 李兆栋1 小时前
无需走航!水平固定式 ADCP 实现河道连续测流
人工智能