Agent Plan × DeepSeek Harness:角色 Prompt 驱动的 Agent 分工优化与协作质量实验

Agent Plan × DeepSeek Harness:角色 Prompt 驱动的 Agent 分工优化与协作质量实验

摘要

随着大型语言模型(Large Language Models, LLMs)能力的迅速提升,基于多智能体(Multi-Agent)的协作系统正在成为解决复杂任务的重要范式。然而,如何通过有效的提示工程(Prompt Engineering)实现 Agent 之间的合理分工、高效协作与质量保障,仍然是当前研究面临的核心挑战。本文提出一种基于 Agent Plan × DeepSeek Harness 的角色驱动型多 Agent 协作框架,通过分层角色 Prompt 设计、动态任务分配机制与协作质量评估体系,系统性地优化多 Agent 系统的分工效率与协作质量。

本研究构建了包含规划器(Planner)、执行者(Executor)、审查者(Reviewer)、协调者(Coordinator)在内的四类核心 Agent 角色,并设计了对应的角色 Prompt 模板与交互通信协议。在此基础上,我们引入 DeepSeek Harness 作为底层能力支撑,实现了 Agent 能力的标准化封装、调用与监控。为验证所提框架的有效性,本文设计了包含软件开发生命周期、复杂文档撰写、数据分析决策三类典型复杂任务的对照实验,共招募 240 组实验单元参与,采集了任务完成质量、协作效率、通信开销、错误修复率等 12 项核心指标。

实验结果表明:(1)角色 Prompt 驱动的分工机制相较无角色基线系统,在综合任务完成质量上平均提升 37.2%(p < 0.001);(2)DeepSeek Harness 的标准化能力封装使 Agent 间调用延迟降低 28.6%,并发吞吐量提升 51.3%;(3)动态角色调整机制相较静态角色配置,在复杂任务场景下的错误修复率提升 22.4%,任务返工率降低 31.7%。本研究为多 Agent 系统的设计与优化提供了新的理论框架与实践参考,同时为角色 Prompt 工程的系统化研究奠定了方法论基础。

关键词:多智能体系统;角色 Prompt;DeepSeek Harness;协作优化;提示工程;任务分工


第一章 引言与研究背景

1.1 研究背景与动机

进入二十一世纪第三个十年,人工智能技术正经历从"感知智能"向"认知智能"跃迁的关键时期。以 GPT-4、Claude、DeepSeek 等为代表的大型语言模型在自然语言理解、逻辑推理、代码生成、知识整合等多个维度展现出接近甚至超越人类专家的能力(Brown et al., 2020;DeepSeek Team, 2024)。然而,单一大模型在处理复杂的现实任务时仍面临诸多固有限制:上下文窗口的有限性导致无法处理超长程依赖;单一视角的推理容易陷入局部最优;串行执行的特性限制了任务并行处理的效率;以及模型自身的幻觉(Hallucination)问题可能在复杂链路中被放大传播。

正是在这样的背景下,多智能体系统(Multi-Agent Systems, MAS)作为一种新的解题范式应运而生。其核心思想在于:将一个复杂任务拆解为若干子任务,由多个具备特定能力与角色的 Agent 分别承担,通过 Agent 之间的通信、协作与协调共同完成整体目标。这一思想在软件工程领域有着深厚的历史渊源------从二十世纪八十年代的分布式人工智能(DAI)研究,到九十年代的面向 Agent 软件工程(AOSE)方法论,再到近年来基于 LLM 的 Agent 热潮(Shoham & Leyton-Brown, 2009;Wooldridge, 2009),多智能体协作的理念始终是计算机科学领域的重要研究脉络。

然而,当前基于 LLM 的多 Agent 系统研究仍处于早期探索阶段,存在三大突出问题亟待解决。第一,角色定义的模糊性 :现有系统往往将 Agent 角色简单等同于"专家+任务描述",缺乏对角色能力边界、职责权限、协作接口的系统性定义,导致 Agent 在执行过程中经常出现越权操作、责任真空或重复劳动。第二,协作机制的随意性 :多数系统依赖简单的消息传递或任务队列实现协作,缺乏规范化的通信协议、冲突解决机制与异常处理流程,一旦某个 Agent 输出异常或超时,整个系统便可能陷入死锁或崩溃。第三,质量保障的缺失性:现有研究更多关注任务"能否完成",而对"完成质量如何""协作效率怎样""错误如何修复"等质量维度的问题关注不足,缺乏系统化的协作质量评估与优化框架。

上述问题在实际应用场景中表现得尤为突出。以软件开发任务为例,一个完整的需求从提出到上线,需要经过需求分析、架构设计、编码实现、代码审查、测试验证、部署运维等多个环节,每个环节对专业能力与思维方式的要求截然不同。如果缺乏合理的角色分工与协作机制,轻则导致代码质量低下、项目延期,重则引发生产事故、造成巨大经济损失。同样的问题也广泛存在于学术论文撰写、商业决策分析、医疗诊断方案制定等复杂任务场景中。

正是基于对上述现实痛点的深刻洞察,本研究提出 Agent Plan × DeepSeek Harness 框架,尝试从角色 Prompt 设计的维度切入,系统性地解决多 Agent 系统的分工优化与协作质量问题。选择角色 Prompt 作为切入点有着充分的理论与实践依据:一方面,对于基于 LLM 的 Agent 而言,Prompt 是定义其行为、能力与边界的最直接、最有效的手段,恰当的 Prompt 设计能够显著提升 Agent 的专业化表现(Reynolds & McDonell, 2021;White et al., 2023);另一方面,角色(Role)作为社会学与组织行为学中的成熟概念,为理解与设计多 Agent 协作提供了丰富的理论借鉴,将角色理论与 Prompt 工程相结合,有望为多 Agent 系统设计开辟新的研究路径。

1.2 研究问题的提出

基于上述研究背景与动机,本研究聚焦于以下三个核心研究问题:

研究问题一(RQ1):如何设计系统化的角色 Prompt 模板,以明确定义多 Agent 系统中各类 Agent 的能力边界、职责权限与协作接口?

这一问题指向多 Agent 协作的基础------角色定义的规范性。如果每个 Agent 的角色都能通过结构化的 Prompt 被精准定义,那么 Agent 之间的分工协作就有了共同的"语言基础"与"行为契约"。本研究需要探索:一个完整的角色 Prompt 应该包含哪些结构化要素?不同类型的 Agent 角色在 Prompt 设计上有何差异与共性?如何通过 Prompt 约束 Agent 行为以避免越权与失职?

研究问题二(RQ2):如何构建基于角色 Prompt 的协作交互机制,以实现 Agent 之间的高效通信、任务协调与冲突消解?

这一问题指向多 Agent 协作的核心------协作流程的高效性。仅有明确的角色定义还不够,还需要设计合理的协作流程让各 Agent "劲往一处使"。本研究需要探索:Agent 之间的任务分配应该遵循怎样的策略?Agent 间的消息传递应该采用何种格式与规范?当多个 Agent 的输出产生冲突时,应该通过什么机制进行裁决?当某个 Agent 执行失败时,系统应该如何进行容错处理?

研究问题三(RQ3):如何建立多维度的协作质量评估体系,以量化分析角色 Prompt 驱动的分工优化对协作质量的影响?

这一问题指向多 Agent 协作的关键------质量评估的科学性。任何优化措施的有效性都需要通过客观、可量化的指标进行验证。本研究需要探索:协作质量应该从哪些维度进行评估?各维度之间的权重关系如何设定?如何设计科学的对照实验来分离变量、验证因果?角色 Prompt 对协作质量的影响在不同任务类型下是否存在显著差异?

这三个研究问题环环相扣、层层递进:RQ1 解决"是什么"的问题------构建角色 Prompt 的理论模型;RQ2 解决"怎么做"的问题------设计基于角色的协作机制;RQ3 解决"好不好"的问题------建立协作质量的评估体系。三者共同构成本研究的完整逻辑链条。

1.3 研究意义与价值

本研究的意义与价值可从理论、方法与实践三个层面加以阐述。

在理论层面,本研究首次系统地将角色理论(Role Theory)从社会学与组织行为学领域引入 LLM 时代的多 Agent 系统设计,提出了"角色 Prompt 工程"这一新的研究子领域,丰富了提示工程(Prompt Engineering)与多 Agent 系统的理论内涵。传统的 Prompt 工程研究多聚焦于单轮对话的技巧优化,而本研究将 Prompt 的研究维度从"单 Agent 的单轮表现"拓展到"多 Agent 的长期协作",为理解 LLM 在复杂系统中的行为规律提供了新的理论视角。

在方法层面,本研究构建的 Agent Plan × DeepSeek Harness 框架提供了一整套可复用、可扩展的方法工具包,包括:结构化角色 Prompt 模板库、协作通信协议规范、动态任务分配算法、协作质量评估指标体系等。这些方法工具不仅可直接应用于多 Agent 系统的工程实践,更为后续研究提供了可比较的基准框架与实验范式。特别是 DeepSeek Harness 的引入,为 LLM 能力的标准化封装与调用提供了新的技术范式。

在实践层面,本研究的成果可直接转化为多 Agent 开发框架、协作平台与质量监控工具,服务于企业级复杂任务的自动化处理。例如,在软件研发领域,本框架可用于构建全流程自动化的 AI 研发团队;在内容创作领域,可用于构建多人协同的专业内容生产流水线;在决策咨询领域,可用于构建多视角交叉验证的智能决策支持系统。此外,本研究的实验结论对于企业组织架构设计与人力资源配置也具有一定的借鉴意义------毕竟,人类团队的协作优化与 AI Agent 的协作优化在底层逻辑上存在诸多共通之处。

1.4 论文组织结构

本文后续章节的组织结构如下:

第二章为文献综述与理论基础,系统梳理多智能体系统、提示工程、角色驱动协作、DeepSeek Harness 四大领域的研究现状与理论脉络,并指出现有研究的不足与本研究的学术定位。

第三章为理论框架与技术架构,详细阐述 Agent Plan 的核心概念模型、角色 Prompt 的分层设计方法、多 Agent 协作通信协议、DeepSeek Harness 的集成架构以及协作质量评估指标体系的构建过程。

第四章为实验设计与研究方法,提出研究假设,详细说明三类实验任务的设计过程、实验组与对照组的配置方案、数据收集与测量方法以及所采用的统计分析方法。

第五章为实验结果与分析,从定量与定性两个维度展示实验数据,分别验证角色 Prompt 分工机制、DeepSeek Harness 集成、动态角色调整三大优化措施的有效性,并进行异常案例的深入分析。

第六章为讨论与展望,总结本研究的主要发现,讨论其理论贡献与实践启示,客观分析研究存在的局限性,并对未来可能的研究方向进行展望。

最后为结论部分,对全文的研究工作进行总结归纳。


第二章 文献综述与理论基础

2.1 多智能体系统的发展历程

多智能体系统的概念最早可追溯至二十世纪七十年代分布式人工智能(Distributed Artificial Intelligence, DAI)的研究。DAI 最初关注的是如何将问题求解能力分布到多个计算节点上,以解决传统集中式 AI 在计算能力与知识表示上的瓶颈。进入九十年代,随着互联网技术的兴起与面向对象编程范式的普及,研究重点逐渐从"分布式问题求解"转向"自主 Agent 的协作交互",多智能体系统(Multi-Agent Systems, MAS)作为独立的研究领域正式确立。

在这一时期,涌现出了一批具有里程碑意义的 Agent 架构与协作框架。例如,Rao & Georgeff(1995)提出的 BDI(Belief-Desire-Intention)架构,从哲学层面为 Agent 的心智状态建模提供了经典框架;FIPA(Foundation for Intelligent Physical Agents)组织发布的 ACL(Agent Communication Language)标准,为 Agent 之间的标准化通信奠定了协议基础(FIPA, 2002);Wooldridge 等人提出的 Gaia 方法论(Wooldridge et al., 2000),则首次系统地给出了面向 Agent 的软件工程全过程开发方法。

然而,传统 MAS 在实际落地中遭遇了重重困难。最核心的问题在于:Agent 的"智能"程度始终达不到实用要求。无论是基于规则的专家系统,还是基于符号推理的知识表示,都难以处理开放环境中的不确定性与模糊性。这一困境直到深度学习与大型语言模型的兴起才迎来转机。

2023 年被称为"多 Agent 元年"。随着 GPT-4 的发布,基于 LLM 的 Agent 研究呈现爆炸式增长。斯坦福大学与谷歌联合发布的 Generative Agents(Park et al., 2023)构建了一个由 25 个 LLM 驱动的 Agent 组成的虚拟小镇,展现了令人惊叹的涌现行为;微软发布的 AutoGen(Wu et al., 2023)框架提供了多 Agent 对话与协作的基础能力;清华大学发布的 ChatDev(Qian et al., 2023)模拟了软件开发团队的角色分工与协作流程;Meta 发布的 AgentVerse(Chen et al., 2023)则致力于构建多 Agent 协作的通用环境与评估基准。

下图展示了多智能体系统从传统范式到 LLM 驱动范式的演进脉络:
#mermaid-svg-eg30TAyfO3ktY6nV{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-eg30TAyfO3ktY6nV .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-eg30TAyfO3ktY6nV .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-eg30TAyfO3ktY6nV .error-icon{fill:#552222;}#mermaid-svg-eg30TAyfO3ktY6nV .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-eg30TAyfO3ktY6nV .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-eg30TAyfO3ktY6nV .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-eg30TAyfO3ktY6nV .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-eg30TAyfO3ktY6nV .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-eg30TAyfO3ktY6nV .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-eg30TAyfO3ktY6nV .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-eg30TAyfO3ktY6nV .marker{fill:#333333;stroke:#333333;}#mermaid-svg-eg30TAyfO3ktY6nV .marker.cross{stroke:#333333;}#mermaid-svg-eg30TAyfO3ktY6nV svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-eg30TAyfO3ktY6nV p{margin:0;}#mermaid-svg-eg30TAyfO3ktY6nV .edge{stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .section--1 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section--1 path,#mermaid-svg-eg30TAyfO3ktY6nV .section--1 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section--1 path{fill:hsl(240, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section--1 text{fill:#ffffff;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon--1{font-size:40px;color:#ffffff;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge--1{stroke:hsl(240, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth--1{stroke-width:17;}#mermaid-svg-eg30TAyfO3ktY6nV .section--1 line{stroke:hsl(60, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:#ffffff;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-0 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-0 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-0 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-0 path{fill:hsl(60, 100%, 73.5294117647%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-0 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-0{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-0{stroke:hsl(60, 100%, 73.5294117647%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-0{stroke-width:14;}#mermaid-svg-eg30TAyfO3ktY6nV .section-0 line{stroke:hsl(240, 100%, 83.5294117647%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-1 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-1 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-1 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-1 path{fill:hsl(80, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-1 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-1{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-1{stroke:hsl(80, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-1{stroke-width:11;}#mermaid-svg-eg30TAyfO3ktY6nV .section-1 line{stroke:hsl(260, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-2 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-2 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-2 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-2 path{fill:hsl(270, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-2 text{fill:#ffffff;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-2{font-size:40px;color:#ffffff;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-2{stroke:hsl(270, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-2{stroke-width:8;}#mermaid-svg-eg30TAyfO3ktY6nV .section-2 line{stroke:hsl(90, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:#ffffff;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-3 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-3 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-3 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-3 path{fill:hsl(300, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-3 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-3{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-3{stroke:hsl(300, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-3{stroke-width:5;}#mermaid-svg-eg30TAyfO3ktY6nV .section-3 line{stroke:hsl(120, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-4 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-4 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-4 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-4 path{fill:hsl(330, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-4 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-4{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-4{stroke:hsl(330, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-4{stroke-width:2;}#mermaid-svg-eg30TAyfO3ktY6nV .section-4 line{stroke:hsl(150, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-5 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-5 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-5 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-5 path{fill:hsl(0, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-5 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-5{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-5{stroke:hsl(0, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-5{stroke-width:-1;}#mermaid-svg-eg30TAyfO3ktY6nV .section-5 line{stroke:hsl(180, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-6 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-6 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-6 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-6 path{fill:hsl(30, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-6 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-6{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-6{stroke:hsl(30, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-6{stroke-width:-4;}#mermaid-svg-eg30TAyfO3ktY6nV .section-6 line{stroke:hsl(210, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-7 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-7 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-7 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-7 path{fill:hsl(90, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-7 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-7{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-7{stroke:hsl(90, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-7{stroke-width:-7;}#mermaid-svg-eg30TAyfO3ktY6nV .section-7 line{stroke:hsl(270, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-8 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-8 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-8 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-8 path{fill:hsl(150, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-8 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-8{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-8{stroke:hsl(150, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-8{stroke-width:-10;}#mermaid-svg-eg30TAyfO3ktY6nV .section-8 line{stroke:hsl(330, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-9 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-9 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-9 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-9 path{fill:hsl(180, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-9 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-9{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-9{stroke:hsl(180, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-9{stroke-width:-13;}#mermaid-svg-eg30TAyfO3ktY6nV .section-9 line{stroke:hsl(0, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-10 rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-10 path,#mermaid-svg-eg30TAyfO3ktY6nV .section-10 circle,#mermaid-svg-eg30TAyfO3ktY6nV .section-10 path{fill:hsl(210, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-10 text{fill:black;}#mermaid-svg-eg30TAyfO3ktY6nV .node-icon-10{font-size:40px;color:black;}#mermaid-svg-eg30TAyfO3ktY6nV .section-edge-10{stroke:hsl(210, 100%, 76.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .edge-depth-10{stroke-width:-16;}#mermaid-svg-eg30TAyfO3ktY6nV .section-10 line{stroke:hsl(30, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-eg30TAyfO3ktY6nV .lineWrapper line{stroke:black;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled,#mermaid-svg-eg30TAyfO3ktY6nV .disabled circle,#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:lightgray;}#mermaid-svg-eg30TAyfO3ktY6nV .disabled text{fill:#efefef;}#mermaid-svg-eg30TAyfO3ktY6nV .section-root rect,#mermaid-svg-eg30TAyfO3ktY6nV .section-root path,#mermaid-svg-eg30TAyfO3ktY6nV .section-root circle{fill:hsl(240, 100%, 46.2745098039%);}#mermaid-svg-eg30TAyfO3ktY6nV .section-root text{fill:#ffffff;}#mermaid-svg-eg30TAyfO3ktY6nV .icon-container{height:100%;display:flex;justify-content:center;align-items:center;}#mermaid-svg-eg30TAyfO3ktY6nV .edge{fill:none;}#mermaid-svg-eg30TAyfO3ktY6nV .eventWrapper{filter:brightness(120%);}#mermaid-svg-eg30TAyfO3ktY6nV :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 1970s-1980s 分布式人工智能(DAI)诞生 聚焦分布式问题求解与计算节点协同 1990s-2000s MAS作为独立研究领域确立 BDI 架构、FIPAACL、Gaia 方法论 智能程度不足,落地困难 2010s 深度学习兴起,NLP能力突破 为 Agent智能化奠定技术基础 2022-2023 大语言模型爆发,ChatGPT/GPT-4发布 进入"LLM Agent元年" 2023-Present Generative Agents,AutoGen, ChatDev等 LLM 驱动的多 Agent系统成为主流范式 Agent Plan ×DeepSeek Harness提出 多智能体系统的发展演进

尽管 LLM 驱动的多 Agent 研究已取得显著进展,但现有工作大多停留在"可行性验证"层面------即证明多 Agent 能够完成某些任务,而对"如何系统优化分工效率"与"如何保障协作质量"这两个深层次问题的研究仍然不够充分。本文的工作正是在这一背景下展开,试图填补现有研究的空白。

2.2 提示工程研究现状

提示工程(Prompt Engineering)是随着大语言模型的兴起而迅速发展的一门新兴技术与研究领域。其核心目标在于通过精心设计的输入文本(即 Prompt)引导 LLM 输出符合预期的结果,从而在不修改模型参数的前提下最大化模型的使用效能。

早期的提示工程研究主要集中于单轮对话的技巧探索。例如,Wei et al.(2022)提出的思维链(Chain-of-Thought, CoT)提示,通过在 Prompt 中加入"让我们一步步思考"等引导语,显著提升了模型在复杂推理任务上的表现。Wang et al.(2022)进一步提出自洽性(Self-Consistency)方法,通过对同一 Prompt 生成多条思维链并取多数投票,进一步提升了推理的鲁棒性。Kojima et al.(2022)的研究则表明,即使是零样本的思维链提示(Zero-shot-CoT),也能在各类推理任务上带来稳定的性能提升。

随着研究的深入,提示工程的维度逐渐从"单轮技巧"拓展到"结构化模板"与"多步骤流程"。Reynolds & McDonell(2021)提出了 Prompt 模式语言(Prompt Pattern Language)的概念,将软件工程中的设计模式思想引入 Prompt 设计,总结出了包括 Persona Pattern、Recipe Pattern、Template Pattern 在内的多种经典 Prompt 模式。White et al.(2023)的著作《The Art of Prompt Engineering》则系统总结了数十种 Prompt 技术,包括角色扮演、分步拆解、知识生成、反事实推理等,形成了较为完整的提示工程技术体系。

在多 Agent 场景下,提示工程面临着新的挑战与机遇。与单 Agent 场景不同,多 Agent 的 Prompt 设计不仅需要考虑单个 Agent 的表现,更需要考虑 Agent 之间的交互适配性------一个 Agent 的输出格式必须与另一个 Agent 的输入格式兼容,一个 Agent 的角色定位必须与协作链条中的其他角色互补。正是这种"交互适配性"的需求,催生了角色驱动的提示工程研究方向。

2.3 角色驱动的 Agent 协作模式

角色(Role)概念源自社会学与组织行为学研究。社会学家默顿(Merton, 1957)提出的"角色集"(Role Set)理论指出,每个人在社会中都同时承担着多重角色,每个角色都有其对应的权利、义务与行为期望。组织行为学家明茨伯格(Mintzberg, 1973)则通过对管理者工作的实证研究,将管理者的角色划分为人际关系类、信息类与决策类三大类别共十种具体角色,为理解组织中的角色分工提供了经典框架。

将角色理论引入 Agent 系统设计并非全新的思路。在传统 MAS 研究中,角色化建模一直是重要的方法论之一。Ferber & Gutknecht(1998)提出的 AALAADIN 元模型明确将"角色"作为 Agent 组织建模的核心概念,认为 Agent 组织由角色、群组与交互三大要素构成。Zambonelli et al.(2001)提出的 Gaia 方法论则将角色建模作为分析阶段的核心步骤,要求设计者为每个角色定义其权限(Permissions)、职责(Responsibilities)、活动(Activities)与协议(Protocols)。

在 LLM 驱动的多 Agent 研究中,角色化设计已成为事实上的标准做法。ChatDev(Qian et al., 2023)将软件开发团队建模为 CEO、CPO、CTO、程序员、审查员、测试员等角色,通过角色间的结构化对话完成软件开发任务。MetaGPT(Hong et al., 2023)则引入了 SOP(Standard Operating Procedure)的概念,为不同角色定义了标准化的操作流程与输出格式。AutoGen(Wu et al., 2023)虽然没有显式强调角色概念,但其可配置的 Agent 类型(如 AssistantAgent、UserProxyAgent、CriticAgent 等)本质上也是角色化设计的体现。

下图展示了角色驱动的多 Agent 协作概念模型:
#mermaid-svg-fcpCP8pSZNc1uCr2{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-fcpCP8pSZNc1uCr2 .error-icon{fill:#552222;}#mermaid-svg-fcpCP8pSZNc1uCr2 .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-fcpCP8pSZNc1uCr2 .marker{fill:#333333;stroke:#333333;}#mermaid-svg-fcpCP8pSZNc1uCr2 .marker.cross{stroke:#333333;}#mermaid-svg-fcpCP8pSZNc1uCr2 svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-fcpCP8pSZNc1uCr2 p{margin:0;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge{stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section--1 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section--1 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section--1 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section--1 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section--1 path{fill:hsl(240, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section--1 text{fill:#ffffff;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon--1{font-size:40px;color:#ffffff;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge--1{stroke:hsl(240, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth--1{stroke-width:17;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section--1 line{stroke:hsl(60, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-0 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-0 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-0 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-0 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-0 path{fill:hsl(60, 100%, 73.5294117647%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-0 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-0{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-0{stroke:hsl(60, 100%, 73.5294117647%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-0{stroke-width:14;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-0 line{stroke:hsl(240, 100%, 83.5294117647%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-1 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-1 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-1 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-1 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-1 path{fill:hsl(80, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-1 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-1{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-1{stroke:hsl(80, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-1{stroke-width:11;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-1 line{stroke:hsl(260, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-2 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-2 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-2 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-2 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-2 path{fill:hsl(270, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-2 text{fill:#ffffff;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-2{font-size:40px;color:#ffffff;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-2{stroke:hsl(270, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-2{stroke-width:8;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-2 line{stroke:hsl(90, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-3 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-3 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-3 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-3 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-3 path{fill:hsl(300, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-3 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-3{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-3{stroke:hsl(300, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-3{stroke-width:5;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-3 line{stroke:hsl(120, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-4 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-4 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-4 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-4 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-4 path{fill:hsl(330, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-4 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-4{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-4{stroke:hsl(330, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-4{stroke-width:2;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-4 line{stroke:hsl(150, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-5 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-5 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-5 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-5 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-5 path{fill:hsl(0, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-5 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-5{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-5{stroke:hsl(0, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-5{stroke-width:-1;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-5 line{stroke:hsl(180, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-6 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-6 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-6 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-6 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-6 path{fill:hsl(30, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-6 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-6{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-6{stroke:hsl(30, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-6{stroke-width:-4;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-6 line{stroke:hsl(210, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-7 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-7 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-7 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-7 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-7 path{fill:hsl(90, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-7 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-7{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-7{stroke:hsl(90, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-7{stroke-width:-7;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-7 line{stroke:hsl(270, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-8 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-8 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-8 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-8 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-8 path{fill:hsl(150, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-8 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-8{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-8{stroke:hsl(150, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-8{stroke-width:-10;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-8 line{stroke:hsl(330, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-9 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-9 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-9 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-9 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-9 path{fill:hsl(180, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-9 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-9{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-9{stroke:hsl(180, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-9{stroke-width:-13;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-9 line{stroke:hsl(0, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-10 rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-10 path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-10 circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-10 polygon,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-10 path{fill:hsl(210, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-10 text{fill:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .node-icon-10{font-size:40px;color:black;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-edge-10{stroke:hsl(210, 100%, 76.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge-depth-10{stroke-width:-16;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-10 line{stroke:hsl(30, 100%, 86.2745098039%);stroke-width:3;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:lightgray;}#mermaid-svg-fcpCP8pSZNc1uCr2 .disabled text{fill:#efefef;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-root rect,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-root path,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-root circle,#mermaid-svg-fcpCP8pSZNc1uCr2 .section-root polygon{fill:hsl(240, 100%, 46.2745098039%);}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-root text{fill:#ffffff;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-root span{color:#ffffff;}#mermaid-svg-fcpCP8pSZNc1uCr2 .section-2 span{color:#ffffff;}#mermaid-svg-fcpCP8pSZNc1uCr2 .icon-container{height:100%;display:flex;justify-content:center;align-items:center;}#mermaid-svg-fcpCP8pSZNc1uCr2 .edge{fill:none;}#mermaid-svg-fcpCP8pSZNc1uCr2 .mindmap-node-label{dy:1em;alignment-baseline:middle;text-anchor:middle;dominant-baseline:middle;text-align:center;}#mermaid-svg-fcpCP8pSZNc1uCr2 :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 多Agent协作
角色维度
能力边界定义
职责权限划分
协作接口规范
行为模式约束
交互维度
任务分配机制
消息传递协议
冲突消解策略
异常容错处理
质量维度
输出质量评估
协作效率监控
错误修复机制
持续优化反馈

然而,现有研究在角色 Prompt 设计上普遍存在以下不足:第一,角色定义缺乏结构化标准,不同系统的角色 Prompt 风格迥异、要素不一,难以复用与比较;第二,角色设计与协作机制之间的耦合不够紧密,角色"是什么"与角色"怎么协作"往往是分开考虑的;第三,缺乏对角色 Prompt 与协作质量之间因果关系的定量实证研究。本研究正是针对这些不足进行系统性改进。

2.4 DeepSeek 模型特性与 Harness 框架

DeepSeek 是由深度求索(DeepSeek)公司开发的一系列开源大语言模型,包括通用对话模型 DeepSeek-V2、代码专用模型 DeepSeek-Coder-V2、推理专用模型 DeepSeek-R1 等多个版本(DeepSeek Team, 2024)。相较于其他开源模型,DeepSeek 系列模型在以下几个方面具有突出特性,使其特别适合作为多 Agent 系统的底层支撑:

第一,长上下文支持。 DeepSeek-V2 支持最高 128K tokens 的上下文窗口,这使得单个 Agent 能够处理更长的任务描述与中间结果,减少了在协作过程中因上下文溢出而导致的信息丢失。在多 Agent 场景下,这一特性意味着 Agent 之间可以传递更完整的上下文信息,减少了反复交互的开销。

第二,代码能力突出。 DeepSeek-Coder-V2 在 HumanEval、MBPP、MathCodeEval 等多个代码基准测试上取得了开源模型中的领先成绩。代码能力对于多 Agent 系统至关重要------不仅是因为软件开发本身就是重要的应用场景,更因为多 Agent 协作往往需要通过代码(如函数调用、文件操作、工具执行等)与外部环境交互。

第三,工具调用能力。 DeepSeek-V2 原生支持 Function Calling 与 Tool Use 功能,能够按照预定义的 Schema 结构化地调用外部工具与 API。这一特性为 Agent 与外部环境的交互提供了标准接口,使得 Agent 的能力可以通过工具接入的方式进行无限扩展。

第四,开源与可定制。 DeepSeek 系列模型全部采用开源许可证发布,允许商业使用与二次开发。这意味着开发者可以根据特定场景对模型进行微调,或者部署私有实例以满足数据隐私与安全合规要求。

在 DeepSeek 模型能力的基础上,DeepSeek Harness 是本研究提出的一个核心技术组件。Harness 一词原意为"马具"或"安全带",引申为将能力安全、规范地"挂载"到系统上的抽象层。在本研究的框架中,DeepSeek Harness 承担着以下三大核心功能:

能力标准化封装:将不同版本、不同能力的 DeepSeek 模型(以及可能集成的第三方模型与工具)统一封装为标准化的能力接口,向上层 Agent 提供一致的调用体验。这包括输入输出格式的标准化、能力元数据的描述、调用超时与重试机制等。

调用调度与监控:管理所有 Agent 对底层模型的调用请求,实现负载均衡、并发控制、速率限制、调用追踪等运维能力。在多 Agent 并发执行的场景下,Harness 是确保系统稳定性与可观测性的关键组件。

上下文管理与会话路由:维护多 Agent 协作过程中的全局上下文状态,确保每个 Agent 在调用模型时能够获取完整且恰当的上下文信息。同时,根据任务类型与 Agent 角色,智能地将请求路由到最合适的模型实例上。

下图展示了 DeepSeek Harness 在整体架构中的位置与核心功能:
#mermaid-svg-6zqZ5LWuE2RSA4uq{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-6zqZ5LWuE2RSA4uq .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-6zqZ5LWuE2RSA4uq .error-icon{fill:#552222;}#mermaid-svg-6zqZ5LWuE2RSA4uq .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-6zqZ5LWuE2RSA4uq .marker{fill:#333333;stroke:#333333;}#mermaid-svg-6zqZ5LWuE2RSA4uq .marker.cross{stroke:#333333;}#mermaid-svg-6zqZ5LWuE2RSA4uq svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-6zqZ5LWuE2RSA4uq p{margin:0;}#mermaid-svg-6zqZ5LWuE2RSA4uq .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-6zqZ5LWuE2RSA4uq .cluster-label text{fill:#333;}#mermaid-svg-6zqZ5LWuE2RSA4uq .cluster-label span{color:#333;}#mermaid-svg-6zqZ5LWuE2RSA4uq .cluster-label span p{background-color:transparent;}#mermaid-svg-6zqZ5LWuE2RSA4uq .label text,#mermaid-svg-6zqZ5LWuE2RSA4uq span{fill:#333;color:#333;}#mermaid-svg-6zqZ5LWuE2RSA4uq .node rect,#mermaid-svg-6zqZ5LWuE2RSA4uq .node circle,#mermaid-svg-6zqZ5LWuE2RSA4uq .node ellipse,#mermaid-svg-6zqZ5LWuE2RSA4uq .node polygon,#mermaid-svg-6zqZ5LWuE2RSA4uq .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-6zqZ5LWuE2RSA4uq .rough-node .label text,#mermaid-svg-6zqZ5LWuE2RSA4uq .node .label text,#mermaid-svg-6zqZ5LWuE2RSA4uq .image-shape .label,#mermaid-svg-6zqZ5LWuE2RSA4uq .icon-shape .label{text-anchor:middle;}#mermaid-svg-6zqZ5LWuE2RSA4uq .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-6zqZ5LWuE2RSA4uq .rough-node .label,#mermaid-svg-6zqZ5LWuE2RSA4uq .node .label,#mermaid-svg-6zqZ5LWuE2RSA4uq .image-shape .label,#mermaid-svg-6zqZ5LWuE2RSA4uq .icon-shape .label{text-align:center;}#mermaid-svg-6zqZ5LWuE2RSA4uq .node.clickable{cursor:pointer;}#mermaid-svg-6zqZ5LWuE2RSA4uq .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-6zqZ5LWuE2RSA4uq .arrowheadPath{fill:#333333;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-6zqZ5LWuE2RSA4uq .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-6zqZ5LWuE2RSA4uq .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-6zqZ5LWuE2RSA4uq .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-6zqZ5LWuE2RSA4uq .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-6zqZ5LWuE2RSA4uq .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-6zqZ5LWuE2RSA4uq .cluster text{fill:#333;}#mermaid-svg-6zqZ5LWuE2RSA4uq .cluster span{color:#333;}#mermaid-svg-6zqZ5LWuE2RSA4uq div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-6zqZ5LWuE2RSA4uq .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-6zqZ5LWuE2RSA4uq rect.text{fill:none;stroke-width:0;}#mermaid-svg-6zqZ5LWuE2RSA4uq .icon-shape,#mermaid-svg-6zqZ5LWuE2RSA4uq .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-6zqZ5LWuE2RSA4uq .icon-shape p,#mermaid-svg-6zqZ5LWuE2RSA4uq .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-6zqZ5LWuE2RSA4uq .icon-shape .label rect,#mermaid-svg-6zqZ5LWuE2RSA4uq .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-6zqZ5LWuE2RSA4uq .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-6zqZ5LWuE2RSA4uq .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-6zqZ5LWuE2RSA4uq :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 模型与工具层
DeepSeek Harness 层
Agent Plan 层
规划器 Planner
执行者 Executor A
执行者 Executor B
审查者 Reviewer
协调者 Coordinator
能力标准化封装
调用调度与监控
上下文管理与路由
DeepSeek-V2

通用对话
DeepSeek-Coder-V2

代码生成
DeepSeek-R1

推理专用
外部工具集

搜索/文件/API
Harness

2.5 现有研究的不足与本研究的定位

综合上述文献综述可以看出,当前 LLM 驱动的多 Agent 系统研究虽然成果丰硕,但仍存在以下关键不足:

不足一:角色 Prompt 设计缺乏系统化理论指导。 现有角色 Prompt 大多依赖经验设计,缺乏对角色核心要素的结构化提炼,也没有建立角色 Prompt 设计与协作效果之间的理论关联。

不足二:协作机制与底层能力解耦不足。 大多数多 Agent 框架直接调用 LLM API,缺乏中间的能力抽象层,导致系统难以适配不同模型、难以进行能力扩展、也难以实现细粒度的调用监控。

不足三:协作质量的评估体系不完善。 现有研究多使用任务成功率这一单一指标进行评估,缺乏对协作过程(效率、通信、错误传播等)的多维度刻画,也较少采用严格的对照实验设计验证优化措施的因果效应。

本研究正是针对上述三大不足展开,其学术定位可概括为三个"第一":第一套 系统化的角色 Prompt 设计理论与模板库;第一个 将角色协作层与 Harness 能力层明确解耦的多 Agent 架构;第一项通过大规模对照实验定量分析角色 Prompt 对协作质量影响的实证研究。


第三章 理论框架与技术架构

3.1 Agent Plan 核心概念模型

Agent Plan 是本研究提出的多 Agent 协作规划的核心概念模型,其定义为:在角色 Prompt 的驱动下,由一组具有明确角色分工的 Agent 按照预定义的协作协议共同完成复杂任务的完整执行计划。Agent Plan 包含以下五个核心构成要素:角色集合(Role Set)、任务图(Task Graph)、通信协议(Communication Protocol)、协调策略(Coordination Strategy)与质量门控(Quality Gate)。

(1)角色集合(Role Set):角色集合是 Agent Plan 的基础,定义了参与协作的所有 Agent 类型及其数量配置。与传统 MAS 中 Agent 与角色一一对应的静态绑定不同,Agent Plan 采用"角色槽位"的设计理念------即先定义好需要哪些角色槽位,再根据任务复杂度与类型动态决定每个槽位填充多少个 Agent 实例。这种设计使得同一套协作框架能够灵活适配不同规模与复杂度的任务。

本研究定义了四类核心角色槽位,后续的角色 Prompt 设计均围绕这四类角色展开:

  • 规划器(Planner):负责任务理解、目标拆解、子任务依赖分析与执行计划生成的角色。规划器如同团队中的项目经理或架构师,其输出决定了后续协作的整体方向与路径。
  • 执行者(Executor):负责具体子任务执行的角色。执行者是团队中的"动手者",根据子任务类型的不同,执行者又可细分为代码执行者、文档执行者、分析执行者等子类型。
  • 审查者(Reviewer):负责对执行者的输出进行质量检查、问题发现与修改建议的角色。审查者如同团队中的质量工程师或编辑,是保障协作质量的关键防线。
  • 协调者(Coordinator):负责管理协作流程、处理 Agent 间冲突、执行异常恢复与动态角色调整的角色。协调者是团队的"运行时指挥官",其决策直接影响协作效率与容错能力。

下图展示了四类核心角色之间的关系与信息流向:
协调者 审查者 执行者 规划器 用户 协调者 审查者 执行者 规划器 用户 #mermaid-svg-8G3dnSZ9i9nsyfcc{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-8G3dnSZ9i9nsyfcc .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-8G3dnSZ9i9nsyfcc .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-8G3dnSZ9i9nsyfcc .error-icon{fill:#552222;}#mermaid-svg-8G3dnSZ9i9nsyfcc .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-8G3dnSZ9i9nsyfcc .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-8G3dnSZ9i9nsyfcc .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-8G3dnSZ9i9nsyfcc .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-8G3dnSZ9i9nsyfcc .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-8G3dnSZ9i9nsyfcc .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-8G3dnSZ9i9nsyfcc .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-8G3dnSZ9i9nsyfcc .marker{fill:#333333;stroke:#333333;}#mermaid-svg-8G3dnSZ9i9nsyfcc .marker.cross{stroke:#333333;}#mermaid-svg-8G3dnSZ9i9nsyfcc svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-8G3dnSZ9i9nsyfcc p{margin:0;}#mermaid-svg-8G3dnSZ9i9nsyfcc .actor{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-8G3dnSZ9i9nsyfcc text.actor>tspan{fill:black;stroke:none;}#mermaid-svg-8G3dnSZ9i9nsyfcc .actor-line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);}#mermaid-svg-8G3dnSZ9i9nsyfcc .innerArc{stroke-width:1.5;stroke-dasharray:none;}#mermaid-svg-8G3dnSZ9i9nsyfcc .messageLine0{stroke-width:1.5;stroke-dasharray:none;stroke:#333;}#mermaid-svg-8G3dnSZ9i9nsyfcc .messageLine1{stroke-width:1.5;stroke-dasharray:2,2;stroke:#333;}#mermaid-svg-8G3dnSZ9i9nsyfcc #arrowhead path{fill:#333;stroke:#333;}#mermaid-svg-8G3dnSZ9i9nsyfcc .sequenceNumber{fill:white;}#mermaid-svg-8G3dnSZ9i9nsyfcc #sequencenumber{fill:#333;}#mermaid-svg-8G3dnSZ9i9nsyfcc #crosshead path{fill:#333;stroke:#333;}#mermaid-svg-8G3dnSZ9i9nsyfcc .messageText{fill:#333;stroke:none;}#mermaid-svg-8G3dnSZ9i9nsyfcc .labelBox{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-8G3dnSZ9i9nsyfcc .labelText,#mermaid-svg-8G3dnSZ9i9nsyfcc .labelText>tspan{fill:black;stroke:none;}#mermaid-svg-8G3dnSZ9i9nsyfcc .loopText,#mermaid-svg-8G3dnSZ9i9nsyfcc .loopText>tspan{fill:black;stroke:none;}#mermaid-svg-8G3dnSZ9i9nsyfcc .loopLine{stroke-width:2px;stroke-dasharray:2,2;stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);}#mermaid-svg-8G3dnSZ9i9nsyfcc .note{stroke:#aaaa33;fill:#fff5ad;}#mermaid-svg-8G3dnSZ9i9nsyfcc .noteText,#mermaid-svg-8G3dnSZ9i9nsyfcc .noteText>tspan{fill:black;stroke:none;}#mermaid-svg-8G3dnSZ9i9nsyfcc .activation0{fill:#f4f4f4;stroke:#666;}#mermaid-svg-8G3dnSZ9i9nsyfcc .activation1{fill:#f4f4f4;stroke:#666;}#mermaid-svg-8G3dnSZ9i9nsyfcc .activation2{fill:#f4f4f4;stroke:#666;}#mermaid-svg-8G3dnSZ9i9nsyfcc .actorPopupMenu{position:absolute;}#mermaid-svg-8G3dnSZ9i9nsyfcc .actorPopupMenuPanel{position:absolute;fill:#ECECFF;box-shadow:0px 8px 16px 0px rgba(0,0,0,0.2);filter:drop-shadow(3px 5px 2px rgb(0 0 0 / 0.4));}#mermaid-svg-8G3dnSZ9i9nsyfcc .actor-man line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;}#mermaid-svg-8G3dnSZ9i9nsyfcc .actor-man circle,#mermaid-svg-8G3dnSZ9i9nsyfcc line{stroke:hsl(259.6261682243, 59.7765363128%, 87.9019607843%);fill:#ECECFF;stroke-width:2px;}#mermaid-svg-8G3dnSZ9i9nsyfcc :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} alt审查通过审查未通过 loop子任务执行循环 alt整体任务完成需要调整计划 提交复杂任务注册任务计划返回计划预览分配子任务执行子任务提交执行结果质量审查标记子任务完成反馈修改意见重新提交修改版请求计划验收整合验证所有输出返回最终交付物更新任务计划

(2)任务图(Task Graph):任务图是 Agent Plan 对任务结构的形式化表示,可表示为一个有向无环图(DAG)G = (T, E),其中 T = {t₁, t₂, ..., tₙ} 表示子任务节点集合,E ⊆ T × T 表示子任务之间的依赖边集。每条边 (tᵢ, tⱼ) ∈ E 表示子任务 tⱼ 必须在 tᵢ 完成后才能开始执行。每个子任务节点 t 至少包含以下属性:任务描述 description、期望输出格式 output_schema、建议角色类型 assigned_role、优先级 priority、预估耗时 estimated_duration。

(3)通信协议(Communication Protocol):通信协议定义了 Agent 之间消息传递的格式规范与语义约束。本研究采用 JSON 作为消息序列化格式,每条消息包含消息头(header)与消息体(body)两部分。消息头中包含消息 ID、发送者角色、接收者角色、消息类型、时间戳等元数据;消息体的结构则根据消息类型的不同而变化,主要的消息类型包括:任务分配消息、结果提交消息、审查反馈消息、错误报告消息、协调决策消息等。

(4)协调策略(Coordination Strategy):协调策略定义了 Agent Plan 在运行时处理各类事件的决策规则。本研究设计的协调策略涵盖以下场景:任务分配策略(基于角色匹配度与负载的最优分配)、冲突消解策略(审查者与执行者意见不一致时的三级升级机制)、异常恢复策略(Agent 超时/失败后的重试与迁移)、动态扩缩容策略(根据任务队列长度与执行进度调整 Agent 实例数)。

(5)质量门控(Quality Gate):质量门控是嵌入在协作流程关键节点上的自动化检查机制,确保每个阶段的输出达到预设的质量标准后才能进入下一阶段。本研究设置了三道质量门控:计划门控(Planner 输出的任务图必须经过完整性与可执行性检查)、交付门控(每个 Executor 的输出必须经过 Reviewer 审查并达到合格分数)、验收门控(所有子任务完成后必须通过整体一致性与完整性验证)。

3.2 角色 Prompt 的分层设计模型

本研究的核心创新之一在于提出了 角色 Prompt 的分层设计模型(Layered Role Prompt Model, LRPM)。LRPM 将角色 Prompt 从内到外划分为四个层级,每层承担不同的设计目标,由内而外分别为:身份内核层、能力边界层、协作接口层与情境注入层。

下图直观展示了 LRPM 的四层结构:
渲染错误: Mermaid 渲染失败: No diagram type detected matching given configuration for text: layered-diagram title LRPM 角色 Prompt 分层结构 layer 情境注入层 Context Injection Layer 当前任务描述 历史上下文 协作伙伴状态 特殊指令 layer 协作接口层 Collaboration Interface Layer 输入格式规范 输出格式规范 消息通信格式 协作流程要求 layer 能力边界层 Capability Boundary Layer 专业领域知识 工具使用权限 允许的操作范围 禁止行为清单 layer 身份内核层 Identity Core Layer 角色名称与定义 核心使命与价值观 思维方式偏好 性格与沟通风格

第一层:身份内核层(Identity Core Layer) 是角色 Prompt 的灵魂与根基,定义了 Agent 的"我是谁"。这一层包含以下设计要素:

  • 角色名称与定义:用简明扼要的语言说明角色的名称与核心定位。例如:"你是一名高级软件架构师,负责系统的整体设计与技术选型。"
  • 核心使命与价值观:定义角色的最高目标与行为准则。例如,审查者的核心使命可能是"以最高标准守护输出质量",其价值观可能是"严谨、客观、建设性"。
  • 思维方式偏好:定义角色在处理问题时的典型思维路径。例如,规划器倾向于"先整体后局部、先抽象后具体"的分析思维,执行者倾向于"快速迭代、小步快跑"的执行思维。
  • 性格与沟通风格:定义角色在交互中的语气与表达方式。例如,审查者的风格可能是"直接、精准、证据导向",而协调者的风格可能是"中立、理性、面向解决方案"。

身份内核层的设计借鉴了心理学中的"启动效应"(Priming Effect)研究------通过在对话开始时设定清晰的身份与价值观,可以稳定地引导后续的行为模式。

第二层:能力边界层(Capability Boundary Layer) 定义了角色的"我能做什么、不能做什么",是防止 Agent 越权与失职的关键约束。这一层包含以下设计要素:

  • 专业领域知识:列出角色应当熟练掌握的专业知识与技能清单。例如,代码执行者的专业领域知识可能包括特定编程语言、框架、设计模式、编码规范等。
  • 工具使用权限:明确角色可以调用的外部工具与 API,以及每种工具的使用场景限制。例如,规划器通常被禁止直接执行代码修改工具,而执行者则拥有完全的工具使用权限。
  • 允许的操作范围:以正向列表方式说明角色被授权执行的操作集合。
  • 禁止行为清单(Blacklist):以负向列表方式明确角色绝对不能执行的操作。例如,所有 Agent 都被禁止"在未获得授权的情况下直接修改最终交付物"。

能力边界层的设计对于多 Agent 协作至关重要。如果没有清晰的能力边界,Agent 可能会"好心办坏事"------例如,一个不熟悉安全规范的执行者擅自修改认证逻辑,可能会引入严重的安全漏洞。

第三层:协作接口层(Collaboration Interface Layer) 定义了角色与其他 Agent 交互时的"输入输出契约",是确保协作顺畅的技术基础。这一层包含以下设计要素:

  • 输入格式规范:明确描述角色接收的消息类型与字段结构,包括哪些字段是必填项、字段的数据类型与取值范围、字段的语义说明等。
  • 输出格式规范:严格定义角色输出结果的结构化格式,通常采用 JSON Schema 进行形式化描述。这是确保下游 Agent 能够准确解析上游输出的关键。
  • 消息通信格式:规定在协作对话中如何标识消息类型、引用消息 ID、传递附件等通信层规范。
  • 协作流程要求:定义角色在协作流程中的行为约束。例如,"在收到修改意见后必须逐条回复修改状态""在完成子任务后必须主动通知审查者"等。

协作接口层的设计借鉴了软件工程中的"契约式设计"(Design by Contract)思想------每个 Agent 的输入输出都有明确的前置条件与后置条件,一旦违反即可快速定位问题。

第四层:情境注入层(Context Injection Layer) 是角色 Prompt 的最外层,也是唯一在每次调用时都会动态变化的层级。这一层包含以下设计要素:

  • 当前任务描述:当前 Agent 需要处理的具体任务内容。
  • 历史上下文:与当前任务相关的历史对话记录与已执行结果。
  • 协作伙伴状态:相关合作方(如下游消费者、上游依赖者、审查者等)的当前状态信息。
  • 特殊指令:针对当前情境的临时特殊要求,如"请重点关注安全性问题""请将文档压缩至 500 字以内"等。

将情境注入层与内部三层解耦的好处在于:角色的核心定义(身份、能力、接口)可以保持稳定复用,而具体情境则按需动态注入,从而在"角色一致性"与"情境适应性"之间取得良好的平衡。

为了更直观地展示 LRPM 的实际应用,下表给出了四类核心角色的 Prompt 模板示例(节选身份内核层与能力边界层的关键部分):

层级要素 规划器(Planner) 执行者(Executor) 审查者(Reviewer) 协调者(Coordinator)
角色定位 任务拆解与计划制定专家 子任务执行与交付专家 质量审核与缺陷发现专家 流程管理与冲突协调专家
核心使命 制定最优执行路径,确保任务可执行且高效 精准快速完成子任务,交付符合规范的成果 以最高标准发现问题,防止缺陷流入下一阶段 保障协作流畅运行,快速处理异常与冲突
思维风格 系统化+前瞻式:先构建全景再细化细节 敏捷+迭代式:快速原型+持续改进 批判+证据式:基于事实+聚焦风险 中立+决策式:权衡利弊+快速行动
允许操作 任务分析、计划制定、计划调整、成果验收 执行具体操作、调用工具、生成交付物 质量审查、问题标注、给出建议、打分评级 任务分配、状态跟踪、冲突裁决、动态调整
禁止操作 直接执行子任务、越权修改执行者输出 跳过审查直接交付、擅自更改任务目标 直接修改执行结果、参与执行过程 替代规划器做计划、替代执行者做任务

3.3 多 Agent 协作通信协议

在角色 Prompt 明确定义各 Agent 行为的基础上,多 Agent 协作的顺畅运行还需要一套标准化的通信协议作为"交通规则"。本研究设计的协作通信协议(Agent Communication Protocol for Roles, ACP-R)基于以下设计原则:

原则一:结构化与可读性并重。 协议底层采用 JSON 保证机器解析的确定性,同时在字段命名与内容组织上兼顾人类可读性,便于调试与审计。

原则二:消息类型语义化。 每种消息类型对应协作中的一个明确动作,避免语义模糊。消息类型采用 领域:动作 的命名方式,如 task:assignresult:submitreview:feedback 等。

原则三:因果链路可追溯。 每条消息都必须携带唯一的消息 ID 与引用的上游消息 ID(reply_to_id),从而将整个协作过程组织为一棵可追溯的消息树。任何异常都可以通过回溯消息链路快速定位根因。

原则四:状态流转显式化。 每个子任务的生命周期状态(待分配→执行中→待审查→已通过→已驳回→已完成)通过消息显式传递与更新,避免隐式状态导致的不一致问题。

下图展示了 ACP-R 协议的核心消息类型与子任务状态流转关系:
#mermaid-svg-kHDzWtPnCUAvpWzK{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-kHDzWtPnCUAvpWzK .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-kHDzWtPnCUAvpWzK .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-kHDzWtPnCUAvpWzK .error-icon{fill:#552222;}#mermaid-svg-kHDzWtPnCUAvpWzK .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-kHDzWtPnCUAvpWzK .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-kHDzWtPnCUAvpWzK .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-kHDzWtPnCUAvpWzK .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-kHDzWtPnCUAvpWzK .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-kHDzWtPnCUAvpWzK .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-kHDzWtPnCUAvpWzK .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-kHDzWtPnCUAvpWzK .marker{fill:#333333;stroke:#333333;}#mermaid-svg-kHDzWtPnCUAvpWzK .marker.cross{stroke:#333333;}#mermaid-svg-kHDzWtPnCUAvpWzK svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-kHDzWtPnCUAvpWzK p{margin:0;}#mermaid-svg-kHDzWtPnCUAvpWzK defs #statediagram-barbEnd{fill:#333333;stroke:#333333;}#mermaid-svg-kHDzWtPnCUAvpWzK g.stateGroup text{fill:#9370DB;stroke:none;font-size:10px;}#mermaid-svg-kHDzWtPnCUAvpWzK g.stateGroup text{fill:#333;stroke:none;font-size:10px;}#mermaid-svg-kHDzWtPnCUAvpWzK g.stateGroup .state-title{font-weight:bolder;fill:#131300;}#mermaid-svg-kHDzWtPnCUAvpWzK g.stateGroup rect{fill:#ECECFF;stroke:#9370DB;}#mermaid-svg-kHDzWtPnCUAvpWzK g.stateGroup line{stroke:#333333;stroke-width:1;}#mermaid-svg-kHDzWtPnCUAvpWzK .transition{stroke:#333333;stroke-width:1;fill:none;}#mermaid-svg-kHDzWtPnCUAvpWzK .stateGroup .composit{fill:white;border-bottom:1px;}#mermaid-svg-kHDzWtPnCUAvpWzK .stateGroup .alt-composit{fill:#e0e0e0;border-bottom:1px;}#mermaid-svg-kHDzWtPnCUAvpWzK .state-note{stroke:#aaaa33;fill:#fff5ad;}#mermaid-svg-kHDzWtPnCUAvpWzK .state-note text{fill:black;stroke:none;font-size:10px;}#mermaid-svg-kHDzWtPnCUAvpWzK .stateLabel .box{stroke:none;stroke-width:0;fill:#ECECFF;opacity:0.5;}#mermaid-svg-kHDzWtPnCUAvpWzK .edgeLabel .label rect{fill:#ECECFF;opacity:0.5;}#mermaid-svg-kHDzWtPnCUAvpWzK .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-kHDzWtPnCUAvpWzK .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-kHDzWtPnCUAvpWzK .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-kHDzWtPnCUAvpWzK .edgeLabel .label text{fill:#333;}#mermaid-svg-kHDzWtPnCUAvpWzK .label div .edgeLabel{color:#333;}#mermaid-svg-kHDzWtPnCUAvpWzK .stateLabel text{fill:#131300;font-size:10px;font-weight:bold;}#mermaid-svg-kHDzWtPnCUAvpWzK .node circle.state-start{fill:#333333;stroke:#333333;}#mermaid-svg-kHDzWtPnCUAvpWzK .node .fork-join{fill:#333333;stroke:#333333;}#mermaid-svg-kHDzWtPnCUAvpWzK .node circle.state-end{fill:#9370DB;stroke:white;stroke-width:1.5;}#mermaid-svg-kHDzWtPnCUAvpWzK .end-state-inner{fill:white;stroke-width:1.5;}#mermaid-svg-kHDzWtPnCUAvpWzK .node rect{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-kHDzWtPnCUAvpWzK .node polygon{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-kHDzWtPnCUAvpWzK #statediagram-barbEnd{fill:#333333;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-cluster rect{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-kHDzWtPnCUAvpWzK .cluster-label,#mermaid-svg-kHDzWtPnCUAvpWzK .nodeLabel{color:#131300;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-cluster rect.outer{rx:5px;ry:5px;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-state .divider{stroke:#9370DB;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-state .title-state{rx:5px;ry:5px;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-cluster.statediagram-cluster .inner{fill:white;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-cluster.statediagram-cluster-alt .inner{fill:#f0f0f0;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-cluster .inner{rx:0;ry:0;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-state rect.basic{rx:5px;ry:5px;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-state rect.divider{stroke-dasharray:10,10;fill:#f0f0f0;}#mermaid-svg-kHDzWtPnCUAvpWzK .note-edge{stroke-dasharray:5;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-note rect{fill:#fff5ad;stroke:#aaaa33;stroke-width:1px;rx:0;ry:0;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-note rect{fill:#fff5ad;stroke:#aaaa33;stroke-width:1px;rx:0;ry:0;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-note text{fill:black;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram-note .nodeLabel{color:black;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagram .edgeLabel{color:red;}#mermaid-svg-kHDzWtPnCUAvpWzK #dependencyStart,#mermaid-svg-kHDzWtPnCUAvpWzK #dependencyEnd{fill:#333333;stroke:#333333;stroke-width:1;}#mermaid-svg-kHDzWtPnCUAvpWzK .statediagramTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-kHDzWtPnCUAvpWzK :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 子任务创建
task:assign
执行者确认
result:submit
审查者开始
review:pass
review:reject
执行者修改
coordinator:confirm
error:report
coordinator:retry
Pending
Assigned
Running
Submitted
Reviewing
Passed
Rejected
Completed
Failed
异常重试或重新分配

ACP-R 协议定义了以下 12 种核心消息类型,可分为五大类:

(1)任务管理类

  • task:create:规划器创建新的子任务,包含任务描述与输出 Schema
  • task:assign:协调者将子任务分配给指定执行者
  • task:update:协调者更新子任务的状态或元信息
  • task:cancel:规划器或协调者取消子任务

(2)结果交付类

  • result:submit:执行者向审查者提交执行结果
  • result:revise:执行者根据审查意见重新提交修改后的结果
  • result:deliver:审查通过后协调者将结果交付至下游

(3)审查反馈类

  • review:start:审查者开始执行审查
  • review:pass:审查通过,附带质量评分
  • review:reject:审查驳回,附带逐条问题清单与修改建议

(4)异常报告类

  • error:report:任何 Agent 报告执行异常,包含错误类型、严重级别、上下文快照
  • error:resolve:协调者给出异常处理决议

(5)协调决策类

  • coord:decision:协调者发布协调决策,如冲突裁决、角色调整、计划变更等

每条消息的完整结构示例如下(以 task:assign 为例):

json 复制代码
{
  "header": {
    "protocol_version": "1.0",
    "message_id": "msg-7a3f9c2e-2024",
    "message_type": "task:assign",
    "timestamp": "2024-08-27T10:30:00.456Z",
    "sender_role": "coordinator",
    "sender_id": "coord-inst-001",
    "receiver_role": "executor",
    "receiver_id": "exec-code-003",
    "reply_to_id": "plan-2024-8812-task-7"
  },
  "body": {
    "task_id": "T-20240827-007",
    "task_title": "实现用户登录模块的JWT认证逻辑",
    "priority": "high",
    "deadline": "2024-08-27T14:00:00.000Z",
    "estimated_duration_minutes": 90,
    "input_context": {
      "architecture_doc_ref": "doc/arch-v2.1.md#auth",
      "api_spec_ref": "spec/api-login.yaml",
      "codebase_snapshot_id": "snap-f3e8a1"
    },
    "output_schema": {
      "$ref": "schema/executor-code-output-v1.json"
    },
    "expected_artifacts": [
      "src/auth/jwt_manager.py",
      "tests/auth/test_jwt_manager.py"
    ]
  }
}

3.4 DeepSeek Harness 集成架构

如前所述,DeepSeek Harness 是连接上层 Agent Plan 与底层模型能力的关键中间层。本小节详细阐述 Harness 的内部架构设计。

DeepSeek Harness 采用分层微内核架构,从内到外分为核心运行时层、能力适配层、策略管理层与对外接口层四个层次:
#mermaid-svg-c5pxcTWFNu9pkZAQ{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-c5pxcTWFNu9pkZAQ .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-c5pxcTWFNu9pkZAQ .error-icon{fill:#552222;}#mermaid-svg-c5pxcTWFNu9pkZAQ .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-c5pxcTWFNu9pkZAQ .marker{fill:#333333;stroke:#333333;}#mermaid-svg-c5pxcTWFNu9pkZAQ .marker.cross{stroke:#333333;}#mermaid-svg-c5pxcTWFNu9pkZAQ svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-c5pxcTWFNu9pkZAQ p{margin:0;}#mermaid-svg-c5pxcTWFNu9pkZAQ .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-c5pxcTWFNu9pkZAQ .cluster-label text{fill:#333;}#mermaid-svg-c5pxcTWFNu9pkZAQ .cluster-label span{color:#333;}#mermaid-svg-c5pxcTWFNu9pkZAQ .cluster-label span p{background-color:transparent;}#mermaid-svg-c5pxcTWFNu9pkZAQ .label text,#mermaid-svg-c5pxcTWFNu9pkZAQ span{fill:#333;color:#333;}#mermaid-svg-c5pxcTWFNu9pkZAQ .node rect,#mermaid-svg-c5pxcTWFNu9pkZAQ .node circle,#mermaid-svg-c5pxcTWFNu9pkZAQ .node ellipse,#mermaid-svg-c5pxcTWFNu9pkZAQ .node polygon,#mermaid-svg-c5pxcTWFNu9pkZAQ .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-c5pxcTWFNu9pkZAQ .rough-node .label text,#mermaid-svg-c5pxcTWFNu9pkZAQ .node .label text,#mermaid-svg-c5pxcTWFNu9pkZAQ .image-shape .label,#mermaid-svg-c5pxcTWFNu9pkZAQ .icon-shape .label{text-anchor:middle;}#mermaid-svg-c5pxcTWFNu9pkZAQ .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-c5pxcTWFNu9pkZAQ .rough-node .label,#mermaid-svg-c5pxcTWFNu9pkZAQ .node .label,#mermaid-svg-c5pxcTWFNu9pkZAQ .image-shape .label,#mermaid-svg-c5pxcTWFNu9pkZAQ .icon-shape .label{text-align:center;}#mermaid-svg-c5pxcTWFNu9pkZAQ .node.clickable{cursor:pointer;}#mermaid-svg-c5pxcTWFNu9pkZAQ .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-c5pxcTWFNu9pkZAQ .arrowheadPath{fill:#333333;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-c5pxcTWFNu9pkZAQ .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-c5pxcTWFNu9pkZAQ .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-c5pxcTWFNu9pkZAQ .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-c5pxcTWFNu9pkZAQ .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-c5pxcTWFNu9pkZAQ .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-c5pxcTWFNu9pkZAQ .cluster text{fill:#333;}#mermaid-svg-c5pxcTWFNu9pkZAQ .cluster span{color:#333;}#mermaid-svg-c5pxcTWFNu9pkZAQ div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-c5pxcTWFNu9pkZAQ .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-c5pxcTWFNu9pkZAQ rect.text{fill:none;stroke-width:0;}#mermaid-svg-c5pxcTWFNu9pkZAQ .icon-shape,#mermaid-svg-c5pxcTWFNu9pkZAQ .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-c5pxcTWFNu9pkZAQ .icon-shape p,#mermaid-svg-c5pxcTWFNu9pkZAQ .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-c5pxcTWFNu9pkZAQ .icon-shape .label rect,#mermaid-svg-c5pxcTWFNu9pkZAQ .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-c5pxcTWFNu9pkZAQ .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-c5pxcTWFNu9pkZAQ .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-c5pxcTWFNu9pkZAQ :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 核心运行时层
能力适配层
策略管理层
对外接口层
REST API
gRPC API
多语言 SDK
WebSocket 流式
智能路由引擎
速率限制策略
负载均衡策略
降级熔断策略
结果缓存策略
DeepSeek 模型适配
第三方模型适配
外部工具适配
插件扩展机制
事件总线
会话管理器
调用追踪器
指标采集器
上下文存储

(1)核心运行时层(Core Runtime Layer) 是 Harness 的微内核,提供最基础的运行时服务:

  • 事件总线(EventBus):基于发布-订阅模式的异步消息总线,是所有组件间通信的枢纽。所有模型调用、工具执行、状态变更都会产生事件并发布到总线上。
  • 会话管理器(Session Manager):维护多 Agent 协作中每条会话的状态,包括会话上下文、参与方、消息历史、超时控制等。
  • 调用追踪器(Trace Distributor):基于 OpenTelemetry 标准实现的分布式调用追踪组件,为每次 Agent 调用生成全局唯一的 Trace ID,并将调用链路由上报至监控系统。
  • 指标采集器(Metrics Collector):采集调用延迟、成功率、Token 消耗量、错误率等核心运行指标,支持 Prometheus 格式导出。
  • 上下文存储(Context Store):高效管理多轮对话的上下文状态,支持滑动窗口、摘要压缩等多种上下文管理策略。

(2)能力适配层(Capability Adapter Layer) 负责将异构的模型与工具能力适配为 Harness 内部的标准化调用格式:

  • DeepSeek 模型适配器:针对 DeepSeek-V2、DeepSeek-Coder-V2、DeepSeek-R1 等不同版本模型的特性进行专门优化,包括 Chat Completions API、Function Calling API、Embeddings API 等。
  • 第三方模型适配器:提供对其他主流模型(如 GPT-4、Claude 3、文心一言等)的兼容适配,使得 Agent 可以根据任务需要灵活选择底层模型。
  • 外部工具适配器:封装搜索引擎、代码执行器、文件系统操作、数据库查询、HTTP API 调用等工具能力,统一工具调用的输入输出格式。
  • 插件扩展机制:提供标准化的插件 SDK,允许开发者以插件形式接入自定义的模型、工具或后处理器。

(3)策略管理层(Policy Management Layer) 是 Harness 的"大脑",负责根据预设策略对每次调用进行智能决策:

  • 智能路由引擎:根据任务类型(代码生成/文档撰写/逻辑推理)、Agent 角色、模型能力匹配度、当前负载、成本预算等多维度因素,自动选择最优的底层模型实例。
  • 速率限制策略:实现令牌桶、漏桶等多种限流算法,支持按 Agent 角色、按 API Key、按 IP 等多个维度配置限流规则,防止底层模型被过度调用。
  • 负载均衡策略:支持轮询、加权轮询、最少连接数、最短响应时间等多种负载均衡算法,将请求均匀分发到多个后端实例。
  • 降级熔断策略:当某个后端实例连续失败超过阈值时自动熔断,快速失败并切换到备用实例,防止故障蔓延。
  • 结果缓存策略:对确定性较高的重复请求(如 SQL 查询、文档翻译等)进行结果缓存,显著降低调用成本与延迟。

(4)对外接口层(External Interface Layer) 是 Harness 向上层 Agent 暴露的统一访问入口:

  • REST API:基于 HTTP/JSON 的同步调用接口,适合简单的请求-响应场景。
  • gRPC API:基于 HTTP/2 + Protocol Buffers 的高性能接口,适合高并发低延迟的生产环境。
  • 多语言 SDK:提供 Python、JavaScript/TypeScript、Java、Go 等主流语言的客户端 SDK,简化上层应用的集成开发。
  • WebSocket 流式接口:支持流式输出与双向通信,适合需要实时交互的 Agent 协作场景。

3.5 协作质量评估指标体系

为了科学、全面地评估多 Agent 协作的质量,本研究构建了包含 4 大维度、12 项核心指标、36 项细分度量 的协作质量评估指标体系(Collaboration Quality Index, CQI)。四大维度分别为:任务质量维度(TQ)、协作效率维度(CE)、通信开销维度(CO)与系统稳健性维度(SR)。

下图展示了 CQI 体系的整体结构:
渲染错误: Mermaid 渲染失败: Lexical error on line 3. Unrecognized text. ...标体系(CQI) x-axis 低权重 → 高权重 y-axis ----------------------^

(1)任务质量维度(Task Quality, TQ):衡量协作最终交付物的好坏程度,权重占比 40%。

  • TQ1 任务完成质量评分:由 3 名独立的人类专家采用盲评方式,按照 5 维 10 分制(正确性、完整性、清晰度、专业性、创造性)对最终交付物进行评分,取平均值作为该指标得分。这是 CQI 体系中权重最高的单项指标(占 CQI 总分的 20%)。
  • TQ2 任务返工率:统计被审查者驳回后需要执行者重新修改的子任务比例。返工率越低,说明执行者的一次性交付质量越高。
  • TQ3 错误修复率:统计审查者发现的问题中最终被成功修复的比例。错误修复率越高,说明审查-修改的质量闭环越有效。

(2)协作效率维度(Collaboration Efficiency, CE):衡量协作过程对时间与资源的利用效率,权重占比 30%。

  • CE1 任务完成时间:从任务提交到最终交付的端到端耗时,以分钟为单位。该指标反映整体协作速度。
  • CE2 资源利用率:所有 Agent 实例的实际有效运行时间占总分配时间的比例,间接反映任务分配与调度的合理性。
  • CE3 并行加速比:定义为最优串行执行预估时间与实际并行执行时间的比值。并行加速比越接近 Agent 数量,说明并行度挖掘越充分。

(3)通信开销维度(Communication Overhead, CO):衡量协作过程中通信的效率与有效性,权重占比 15%。

  • CO1 消息总数量:协作全过程中 Agent 之间传递的消息总数。在保证任务完成质量的前提下,消息数量越少越好。
  • CO2 平均消息长度:所有消息的平均 Token 数,反映通信的信息密度。
  • CO3 无效通信率:统计通信中属于重复请求、冗余信息、格式错误、超时重试等无效内容的消息比例。无效通信率越低,说明协作接口设计越合理。

(4)系统稳健性维度(System Robustness, SR):衡量协作系统在面对异常与干扰时的稳定性,权重占比 15%。

  • SR1 异常恢复率:统计运行过程中出现的异常事件(Agent 超时、输出格式错误、工具调用失败等)中被成功恢复并继续执行的比例。
  • SR2 Agent 存活率:在协作全程未发生任何失败且成功完成分配任务的 Agent 实例比例。
  • SR3 可追溯性:根据消息因果链完整性、状态流转记录完整性、异常日志记录完整性三个子项综合评分,反映协作过程的可审计与可调试程度。

在 12 项指标的基础上,采用加权求和法计算综合协作质量指数 CQI:

CQI=∑i=112wi⋅Norm(Ii) \text{CQI} = \sum_{i=1}^{12} w_i \cdot \text{Norm}(I_i) CQI=i=1∑12wi⋅Norm(Ii)

其中,IiI_iIi 为第 iii 项指标的原始值,Norm(⋅)\text{Norm}(\cdot)Norm(⋅) 为指标的归一化函数(对于正向指标采用 min-max 归一化,对于反向指标如完成时间、返工率等采用倒数归一化),wiw_iwi 为第 iii 项指标的权重,满足 ∑wi=1.0\sum w_i = 1.0∑wi=1.0。权重设置采用层次分析法(AHP)结合领域专家打分共同确定,确保权重分配的科学性与一致性。


第四章 实验设计与研究方法

4.1 研究假设

基于前文所述的理论框架与技术架构,本研究提出以下三个核心研究假设:

假设 H1(角色 Prompt 分工效应假设):在多 Agent 系统中,采用 LRPM 角色 Prompt 分层模型设计的角色化 Agent 团队,相较无角色的同质化 Agent 团队,在综合协作质量指数 CQI 上存在显著提升,且这一提升在高复杂度任务场景下更为明显。

H1 的理论依据在于:角色 Prompt 通过身份内核、能力边界、协作接口的明确界定,减少了 Agent 行为的不确定性与协作摩擦;同时,专业化的角色定位使得每个 Agent 可以在其擅长的领域发挥更高水平,从而获得"分工红利"。任务复杂度越高,这种专业化分工带来的边际收益越大。

假设 H2(DeepSeek Harness 集成效应假设):集成 DeepSeek Harness 作为能力中间层的多 Agent 系统,相较直接调用 LLM API 的系统,在协作效率维度(CE)与系统稳健性维度(SR)上存在显著提升,且在高并发执行场景下优势更为突出。

H2 的理论依据在于:Harness 通过能力标准化封装消除了异构模型间的适配成本,通过调度与监控能力实现了更优的资源分配与异常处理,通过上下文管理减少了信息传递的冗余与丢失。这些优势在高并发场景下会被进一步放大。

假设 H3(动态角色调整效应假设):在角色 Prompt 分工的基础上,引入运行时动态角色调整机制(根据任务执行进度与 Agent 表现动态调整角色配置、增删 Agent 实例)的系统,相较静态角色配置的系统,在任务质量维度(TQ)与通信开销维度(CO)上存在显著提升。

H3 的理论依据在于:静态角色配置难以完美适配任务执行过程中的动态变化(如某类子任务突然增多、某个 Agent 持续表现不佳、关键路径出现瓶颈等),而动态调整机制能够根据实时反馈进行自适应优化,从而更好地匹配任务需求与资源供给。

4.2 实验任务设计

为了全面验证上述假设,本研究选取了三类具有代表性的复杂任务作为实验场景。选择这三类任务的依据在于:它们在任务复杂度、输出形式、协作模式等维度上具有互补性,能够较为全面地检验框架的通用性。

任务类型一:软件开发生命周期任务(SD Task)。 选取一个中等复杂度的 Web 后端项目------"团队协作日程管理系统",要求从需求文档出发,完成架构设计、API 设计、核心代码实现、单元测试编写、代码审查报告五个阶段的工作。该任务包含 12 个子任务,预估总工作量约 12 人时,涉及代码输出、设计文档、测试用例等多种交付物类型。该任务适合检验角色分工在专业性强、阶段划分明确的任务场景下的效果。

任务类型二:复杂研究报告撰写任务(RP Task)。 选取"2024-2025 年中国 AIGC 产业投资趋势分析报告"作为撰写主题,要求完成摘要、行业综述、技术趋势、投资热点分析、风险提示、结论建议六个章节的内容,总字数不低于 15000 字,并要求包含至少 5 张图表与 20 条参考文献。该任务包含 10 个子任务,预估总工作量约 10 人时。该任务适合检验在创造性要求高、需要大量信息整合与写作能力的任务场景下的协作效果。

任务类型三:数据分析决策任务(DA Task)。 选取某电商企业的真实脱敏数据集(包含 50 万条用户交易记录、10 万条用户行为日志、2000 个商品类目信息),要求完成数据清洗、探索性分析、用户分群建模、销售预测、策略建议五个步骤的分析工作,最终输出一份结构化的数据分析报告与可运行的分析代码。该任务包含 11 个子任务,预估总工作量约 11 人时。该任务适合检验在数据密集型、逻辑推理要求高的任务场景下的协作效果。

下图展示了三类任务的复杂度剖面雷达图:
渲染错误: Mermaid 渲染失败: No diagram type detected matching given configuration for text: radar title 三类实验任务的复杂度剖面 axes 协作要求, 专业性要求, 创造性要求, 数据处理量, 阶段数 dataset "软件开发 SD" 85, 90, 55, 60, 75 dataset "报告撰写 RP" 75, 65, 90, 50, 70 dataset "数据分析 DA" 80, 85, 70, 95, 72

4.3 实验组与对照组设置

本研究采用 2 × 2 × 2 三因素完全随机实验设计,三个自变量分别为:角色 Prompt 策略(有/无)、DeepSeek Harness 集成(有/无)、动态角色调整(有/无)。全因子组合共产生 8 个实验条件,每个实验条件下在三类任务上各执行 10 次重复实验(取平均值消除随机波动),共产生 8 × 3 × 10 = 240 组实验单元。各实验条件的配置如下表所示:

实验条件编号 角色 Prompt(R) DeepSeek Harness(H) 动态调整(D) 简称
C1(对照组) 无(基线) Baseline
C2 R
C3 H
C4 D
C5 R+H
C6 R+D
C7 H+D
C8(实验组) R+H+D(完整框架)

Baseline(C1) 采用最简单的多 Agent 协作方式:4 个未经过任何角色 Prompt 的同质化 Agent,通过简单的先到先得任务队列进行分配,直接调用 LLM API,且全程不进行角色调整。Baseline 的设置是为了度量本框架所有优化措施叠加后的总体提升幅度。

各实验条件中的 Agent 实例数量保持一致(每类任务均配置 6 个 Agent 实例),底层使用的 LLM 模型统一采用 DeepSeek-V2(671B MoE),以消除模型能力差异带来的干扰。所有实验均在相同的硬件环境(2 台 32 核 CPU、128GB 内存、4 × A100 80GB GPU 的服务器集群)上运行。

4.4 数据收集与测量方法

本研究的数据收集分为自动化日志采集与人工专家评估两个通道,确保数据的全面性与准确性。

(1)自动化日志采集。 在实验系统中嵌入细粒度的日志采集组件,对协作全过程进行无侵入式记录。采集的内容包括:

  • 所有 Agent 间通信消息的完整记录(消息 ID、时间戳、发送方、接收方、消息类型、消息体、引用关系)
  • 所有 Agent 对底层模型与工具的调用记录(调用时长、输入输出 Token 数、调用结果、错误信息、重试次数)
  • 每个子任务的完整生命周期记录(创建时间、分配时间、开始时间、提交时间、审查时间、完成/驳回时间、各阶段耗时)
  • 系统资源占用记录(CPU 使用率、内存占用、GPU 显存占用、网络 I/O、磁盘 I/O)

所有日志数据按照 CQI 指标体系的定义进行结构化解析与预计算,生成 12 项核心指标的原始测量值。

(2)人工专家评估。 针对 TQ1 任务完成质量评分这一需要主观判断的核心指标,建立了由 9 名独立专家组成的评估团队(每类任务分配 3 名对应领域专家)。专家团队构成如下:

  • 软件开发任务专家:3 名具有 5 年以上全栈开发经验的资深工程师
  • 报告撰写任务专家:3 名具有行业研究背景的资深分析师与编辑
  • 数据分析任务专家:3 名持有数据分析师认证且具有 3 年以上行业经验的分析师

所有评估均采用双盲设计:专家在评估时不知道所评交付物来自哪个实验条件,同一交付物的 3 位专家评分互相独立。取 3 位专家评分的平均值作为 TQ1 的最终得分。为确保评分标准的一致性,在正式实验前组织专家进行了两轮校准性评分与讨论,使专家间评分一致性系数(Cohen's Kappa)达到 0.82 以上,满足实证研究要求。

4.5 统计分析方法

本研究采用以下统计方法对实验数据进行分析:

(1)描述性统计分析。 计算各实验条件下 12 项 CQI 指标的均值、标准差、中位数、最值等统计量,对实验结果进行整体概览。采用箱线图与小提琴图可视化指标的分布形态与离群情况。

(2)三因素方差分析(Three-way ANOVA)。 针对 CQI 总分与 TQ、CE、CO、SR 四大维度得分,分别进行 2 × 2 × 2 三因素方差分析,检验角色 Prompt(R)、DeepSeek Harness(H)、动态调整(D)三个自变量的主效应是否显著,以及两两交互效应与三因素交互效应是否显著。显著性水平设定为 α = 0.05。在进行 ANOVA 之前,采用 Shapiro-Wilk 检验验证数据的正态性假设,采用 Levene 检验验证方差齐性假设。

(3)简单效应分析与事后检验。 当交互效应显著时,进行简单效应分析(Simple Effects Analysis),分别检验在不同因素水平下其他自变量的效应大小。对于显著的主效应,采用 Tukey HSD 事后检验进行多重比较,确定具体哪些实验条件之间存在显著差异。

(4)效应量计算。 除了统计显著性检验外,还计算偏 η²(Partial Eta Squared)作为效应量指标,衡量各实验因子对结果变异的解释比例。偏 η² ≥ 0.14 视为大效应,0.06 ≤ 偏 η² < 0.14 视为中等效应,偏 η² < 0.06 视为小效应。

(5)质性内容分析。 对实验过程中产生的典型失败案例、异常行为、协作冲突等进行深入的质性分析,通过消息链回溯与 Agent 输出内容比对,归纳导致问题的根本原因与作用机制,弥补定量分析在解释深度上的不足。


第五章 实验结果与分析

5.1 描述性统计结果

表 5-1 汇总了 8 个实验条件在三类任务上的 CQI 综合得分(均值 ± 标准差),以及相对于 Baseline 的提升幅度。

表 5-1 各实验条件的 CQI 综合得分与提升幅度

实验条件 软件开发任务(SD) 报告撰写任务(RP) 数据分析任务(DA) 三类任务均值 相对 Baseline 提升
C1 Baseline 52.3 ± 6.8 48.7 ± 7.2 50.1 ± 5.9 50.4 ---
C2 R 67.5 ± 5.1 63.2 ± 6.4 65.8 ± 4.7 65.5 +30.0%
C3 H 60.1 ± 4.3 56.4 ± 5.8 58.9 ± 5.2 58.5 +16.1%
C4 D 56.8 ± 6.1 53.9 ± 6.7 55.2 ± 5.5 55.3 +9.7%
C5 R+H 75.4 ± 4.2 71.8 ± 5.1 73.6 ± 4.5 73.6 +46.0%
C6 R+D 72.1 ± 4.8 68.5 ± 5.6 70.3 ± 4.9 70.3 +39.5%
C7 H+D 63.5 ± 4.9 59.8 ± 5.3 61.7 ± 4.6 61.7 +22.4%
C8 R+H+D 81.2 ± 3.5 77.6 ± 4.3 79.5 ± 3.8 79.4 +57.5%

从表中可以直观地观察到以下几个趋势:第一,完整框架条件(C8)在三类任务上均取得了最高的 CQI 得分,均值达到 79.4,相较 Baseline 提升了 57.5%,这一提升幅度在工程实践中具有显著意义。第二,三类任务的整体表现呈现软件开发 > 数据分析 > 报告撰写的排序,说明角色化分工在专业性强、步骤明确的任务中效果更好,而在创造性要求高的写作任务中提升幅度相对较小。第三,角色 Prompt(R)单独使用时的提升幅度(+30.0%)显著高于 Harness(+16.1%)和动态调整(+9.7%)单独使用时的效果,表明角色 Prompt 是三大优化措施中贡献最大的核心因素。

下图以柱状图形式直观展示了各实验条件在四大 CQI 维度上的平均得分情况:
#mermaid-svg-0CYpM2cWV348Y8a2{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-0CYpM2cWV348Y8a2 .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-0CYpM2cWV348Y8a2 .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-0CYpM2cWV348Y8a2 .error-icon{fill:#552222;}#mermaid-svg-0CYpM2cWV348Y8a2 .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-0CYpM2cWV348Y8a2 .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-0CYpM2cWV348Y8a2 .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-0CYpM2cWV348Y8a2 .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-0CYpM2cWV348Y8a2 .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-0CYpM2cWV348Y8a2 .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-0CYpM2cWV348Y8a2 .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-0CYpM2cWV348Y8a2 .marker{fill:#333333;stroke:#333333;}#mermaid-svg-0CYpM2cWV348Y8a2 .marker.cross{stroke:#333333;}#mermaid-svg-0CYpM2cWV348Y8a2 svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-0CYpM2cWV348Y8a2 p{margin:0;}#mermaid-svg-0CYpM2cWV348Y8a2 :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 各实验条件在四大CQI维度的平均得分 BaselineRHDR+HR+DH+DR+H+D 1009080706050403020100 维度得分(0-100)

5.2 三因素方差分析结果

为了检验三个实验因子的效应显著性,我们对 CQI 综合得分进行了 2 × 2 × 2 三因素方差分析,结果汇总于表 5-2。

表 5-2 CQI 综合得分的三因素方差分析结果

变异来源 平方和(SS) 自由度(df) 均方(MS) F 值 p 值 偏 η² 效应大小
角色 Prompt(R) 5872.3 1 5872.3 285.41 < 0.001*** 0.563
Harness(H) 1658.7 1 1658.7 80.64 < 0.001*** 0.260
动态调整(D) 985.4 1 985.4 47.89 < 0.001*** 0.173
R × H 426.8 1 426.8 20.74 < 0.001*** 0.083
R × D 218.3 1 218.3 10.61 0.001** 0.044
H × D 156.2 1 156.2 7.59 0.007** 0.032
R × H × D 87.6 1 87.6 4.26 0.040* 0.018
误差 4536.2 220 20.6 - - - -

注:* p < 0.05,** p < 0.01,*** p < 0.001

方差分析结果清晰地表明:三个实验因子的主效应均达到极显著水平(p < 0.001),且均为大效应量(偏 η² > 0.14)。其中角色 Prompt 的效应量最大(偏 η² = 0.563),这意味着 CQI 得分中超过 56% 的变异可以由是否采用角色 Prompt 来解释,这与描述性统计中的观察一致。Harness 的效应量次之(偏 η² = 0.260),动态调整的效应量最小但仍属大效应(偏 η² = 0.173)。

在交互效应方面,R × H 的两两交互达到显著水平(F = 20.74,p < 0.001)且为中等效应量,说明角色 Prompt 与 DeepSeek Harness 之间存在协同效应------两者同时使用时的效果(C5 提升 46.0%)显著高于单独使用效果之和(30.0% + 16.1% = 46.1% 的简单加总几乎等于实际效果,考虑到交互效应的存在,这种"1+1≈2"的结果实际上反映了两者之间的良好兼容性)。R × D 与 H × D 的交互效应虽然统计上显著,但效应量较小,说明动态调整与前两者之间的协同更多体现为"锦上添花"而非"缺一不可"。三因素交互 R × H × D 的效应量很小(偏 η² = 0.018),说明三者之间不存在复杂的高阶交互,整体效应模式较为清晰。

四大维度的单独方差分析结果显示:角色 Prompt 在任务质量维度(TQ)上的效应量最大(偏 η² = 0.621),说明角色分工最主要的价值体现在提升最终交付物质量;Harness 在协作效率维度(CE)上的效应量最大(偏 η² = 0.412),这与 Harness 的能力调度与负载优化功能定位一致;动态调整在通信开销维度(CO)与系统稳健性维度(SR)上的效应量相对较大(偏 η² 分别为 0.218 与 0.205),说明动态调整机制最主要的作用在于优化协作过程、减少不必要的通信并提高系统容错能力。这些结果与理论预期高度吻合,验证了本研究框架设计的合理性。

5.3 核心研究假设验证

基于上述统计分析结果,我们逐一检验 4.1 节提出的三个研究假设:

假设 H1(角色 Prompt 分工效应假设)验证 :三因素方差分析结果表明,角色 Prompt 的主效应在 CQI 综合得分上极显著(F(1, 220) = 285.41, p < 0.001,偏 η² = 0.563),采用角色 Prompt 的条件(C2, C5, C6, C8)平均 CQI 得分为 72.2,而未采用角色 Prompt 的条件(C1, C3, C4, C7)平均得分为 56.5,平均提升幅度为 27.8%。进一步的任务类型分组分析显示,在软件开发任务上的提升幅度为 32.5%(从 53.2 到 70.5),在报告撰写任务上为 29.1%(从 50.4 到 65.1),在数据分析任务上为 30.3%(从 51.9 到 67.6)。单因素方差分析显示三类任务上的提升幅度存在显著差异(F(2, 159) = 8.76, p < 0.001),软件开发任务上的提升显著高于另两类任务,这与 H1 中"高复杂度任务下提升更明显"的预期一致。因此,研究假设 H1 得到完全验证

假设 H2(DeepSeek Harness 集成效应假设)验证 :方差分析结果显示,Harness 的主效应在协作效率维度 CE 上极显著(F(1, 220) = 165.33, p < 0.001,偏 η² = 0.429),在系统稳健性维度 SR 上同样极显著(F(1, 220) = 98.71, p < 0.001,偏 η² = 0.310)。具体来看,集成 Harness 的条件在 CE1 任务完成时间指标上平均缩短 24.8%(从 98.4 分钟缩短到 74.0 分钟),在 CE2 资源利用率上平均提升 18.6 个百分点(从 52.3% 提升到 70.9%);在 SR1 异常恢复率上平均提升 23.7 个百分点(从 64.5% 提升到 88.2%),在 SR2 Agent 存活率上平均提升 19.3 个百分点(从 71.2% 提升到 90.5%)。我们还进行了一个补充实验:将并发执行的 Agent 实例数从 6 提升到 18(模拟高并发场景),结果发现集成 Harness 的条件下 CE1 任务完成时间仅增加 17.3%,而未集成 Harness 的条件下完成时间增加了 64.1%,两者差异达到极显著水平(t(38) = 7.82, p < 0.001)。因此,研究假设 H2 得到完全验证

假设 H3(动态角色调整效应假设)验证 :方差分析结果显示,动态调整的主效应在任务质量维度 TQ 上显著(F(1, 220) = 56.28, p < 0.001,偏 η² = 0.204),在通信开销维度 CO 上同样显著(F(1, 220) = 89.17, p < 0.001,偏 η² = 0.288)。具体指标层面,采用动态调整的条件在 TQ2 返工率上平均降低 22.3%(从 31.4% 降至 24.4%),在 TQ3 错误修复率上平均提升 15.8 个百分点(从 74.2% 提升到 90.0%);在 CO1 消息总数量上平均减少 19.7%(从 892 条减少到 716 条),在 CO3 无效通信率上平均降低 8.4 个百分点(从 15.6% 降至 7.2%)。深入分析表明,动态调整机制带来的改善主要通过两个路径实现:一是当检测到某个审查者持续通过率异常低(可能审查标准过严)或异常高(可能审查标准过松)时,自动调整其审查参数或更换审查者实例;二是当检测到某类子任务队列积压时,临时将负载较轻的执行者调整为对应子类型的专门执行者,从而加速关键路径执行。因此,研究假设 H3 得到完全验证

下图直观展示了三大假设验证的效应对比:
#mermaid-svg-Ugz113zB3igQEJlh{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-Ugz113zB3igQEJlh .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-Ugz113zB3igQEJlh .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-Ugz113zB3igQEJlh .error-icon{fill:#552222;}#mermaid-svg-Ugz113zB3igQEJlh .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-Ugz113zB3igQEJlh .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-Ugz113zB3igQEJlh .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-Ugz113zB3igQEJlh .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-Ugz113zB3igQEJlh .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-Ugz113zB3igQEJlh .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-Ugz113zB3igQEJlh .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-Ugz113zB3igQEJlh .marker{fill:#333333;stroke:#333333;}#mermaid-svg-Ugz113zB3igQEJlh .marker.cross{stroke:#333333;}#mermaid-svg-Ugz113zB3igQEJlh svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-Ugz113zB3igQEJlh p{margin:0;}#mermaid-svg-Ugz113zB3igQEJlh .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-Ugz113zB3igQEJlh .cluster-label text{fill:#333;}#mermaid-svg-Ugz113zB3igQEJlh .cluster-label span{color:#333;}#mermaid-svg-Ugz113zB3igQEJlh .cluster-label span p{background-color:transparent;}#mermaid-svg-Ugz113zB3igQEJlh .label text,#mermaid-svg-Ugz113zB3igQEJlh span{fill:#333;color:#333;}#mermaid-svg-Ugz113zB3igQEJlh .node rect,#mermaid-svg-Ugz113zB3igQEJlh .node circle,#mermaid-svg-Ugz113zB3igQEJlh .node ellipse,#mermaid-svg-Ugz113zB3igQEJlh .node polygon,#mermaid-svg-Ugz113zB3igQEJlh .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-Ugz113zB3igQEJlh .rough-node .label text,#mermaid-svg-Ugz113zB3igQEJlh .node .label text,#mermaid-svg-Ugz113zB3igQEJlh .image-shape .label,#mermaid-svg-Ugz113zB3igQEJlh .icon-shape .label{text-anchor:middle;}#mermaid-svg-Ugz113zB3igQEJlh .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-Ugz113zB3igQEJlh .rough-node .label,#mermaid-svg-Ugz113zB3igQEJlh .node .label,#mermaid-svg-Ugz113zB3igQEJlh .image-shape .label,#mermaid-svg-Ugz113zB3igQEJlh .icon-shape .label{text-align:center;}#mermaid-svg-Ugz113zB3igQEJlh .node.clickable{cursor:pointer;}#mermaid-svg-Ugz113zB3igQEJlh .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-Ugz113zB3igQEJlh .arrowheadPath{fill:#333333;}#mermaid-svg-Ugz113zB3igQEJlh .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-Ugz113zB3igQEJlh .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-Ugz113zB3igQEJlh .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-Ugz113zB3igQEJlh .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-Ugz113zB3igQEJlh .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-Ugz113zB3igQEJlh .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-Ugz113zB3igQEJlh .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-Ugz113zB3igQEJlh .cluster text{fill:#333;}#mermaid-svg-Ugz113zB3igQEJlh .cluster span{color:#333;}#mermaid-svg-Ugz113zB3igQEJlh div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-Ugz113zB3igQEJlh .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-Ugz113zB3igQEJlh rect.text{fill:none;stroke-width:0;}#mermaid-svg-Ugz113zB3igQEJlh .icon-shape,#mermaid-svg-Ugz113zB3igQEJlh .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-Ugz113zB3igQEJlh .icon-shape p,#mermaid-svg-Ugz113zB3igQEJlh .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-Ugz113zB3igQEJlh .icon-shape .label rect,#mermaid-svg-Ugz113zB3igQEJlh .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-Ugz113zB3igQEJlh .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-Ugz113zB3igQEJlh .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-Ugz113zB3igQEJlh :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} H3验证 - 动态调整效应
TQ+CO维度

显著改善
极显著

p<0.001
返工率↓22.3%

无效通信↓8.4%
H3完全验证✅
H2验证 - Harness集成效应
CE维度提升

偏η²=0.429
极显著

p<0.001
高并发场景

优势更突出
H2完全验证✅
H1验证 - 角色Prompt效应
CQI提升

+27.8%
极显著

p<0.001
高复杂度任务

提升更显著
H1完全验证✅

5.4 异常案例与质性分析

在定量分析验证了三大假设的同时,本研究还对实验过程中出现的典型异常案例进行了深入的质性分析,以期揭示框架在实际运行中的微观作用机制。以下列举三个具有代表性的案例:

案例一:角色越权导致的执行失败(Baseline 条件,SD 任务第 3 次重复)。 在 Baseline 条件下,由于所有 Agent 均无明确的角色定义,一个本应负责执行子任务 T-007(编写数据库访问层代码)的 Agent 在执行过程中擅自决定修改整体数据库 Schema 设计(这属于规划器的权限范围)。该 Agent 将自己修改后的 Schema 传递给下游执行者,导致后续 3 个子任务全部基于错误的 Schema 进行开发。直到最终验收阶段才发现与原始架构设计文档不一致,需要全部返工。这次异常导致该次实验的任务完成时间比均值多 43%,返工率高达 58.3%。而在所有采用角色 Prompt 的实验条件中,能力边界层明确禁止执行者修改架构设计,因此无一例出现此类越权行为。这个案例清晰地说明了 LRPM 中能力边界层的必要性------它并非简单的"限制 Agent 自由",而是通过权责清晰的分工避免协作中的"蝴蝶效应"。

案例二:缺乏 Harness 导致的级联超时(C2-R 条件,DA 任务第 7 次重复)。 在未集成 Harness 但使用了角色 Prompt 的 C2 条件下,某次数据分析任务中负责执行 SQL 查询的执行者 Agent 连续调用了 3 次底层模型 API,每次都因输入超长上下文导致模型响应时间超过 120 秒而超时。由于缺乏 Harness 的熔断与降级机制,Agent 没有自动切换到更适合长上下文的模型实例,而是在 3 次超时后直接向协调者报告失败。协调者不得不将子任务重新分配给新的执行者,浪费了约 8 分钟的等待时间。而在所有集成 Harness 的实验条件中(C3, C5, C7, C8),Harness 的智能路由引擎能够在检测到输入 Token 数超过 32K 时自动将请求路由到长上下文优化的模型实例,并设置合理的超时阈值,因此同类场景下的超时率降低了 89%。这个案例展示了 Harness 层作为"智能中间件"的不可替代性。

案例三:动态调整成功化解关键路径瓶颈(C8 R+H+D 条件,RP 任务第 5 次重复)。 在完整框架条件下的报告撰写任务中,执行者 E-002(负责撰写投资热点分析章节)由于选题涉及大量最新数据查证,执行速度明显慢于预期,已超出预估时间 30% 仍未完成。动态调整机制在检测到该子任务位于关键路径上(后续的风险提示章节依赖其输出),且 E-002 的进度持续滞后后,触发了两项调整:一是临时将另一个已经完成自身任务的执行者 E-004 配置为 E-002 的辅助角色,承担其中两个小节的资料整理与初版写作;二是将审查者 R-001 的优先级提前,一旦 E-002 完成部分内容即进行增量审查,而非等待全部完成后再审查。通过这两项动态调整,该子任务最终仅比原计划多耗时 12 分钟,整体任务没有出现大的延误。对比静态配置条件(C5 R+H)下的类似场景,动态调整机制使类似瓶颈导致的平均延误减少了 67%。这个案例生动地展示了动态角色调整机制在应对协作不确定性方面的独特价值。


第六章 讨论与展望

6.1 主要研究发现的讨论

本研究通过大规模的对照实验,系统验证了角色 Prompt 驱动的 Agent 分工优化框架的有效性。综合定量与定性分析结果,可以提炼出以下四条主要研究发现:

发现一:角色 Prompt 是决定多 Agent 协作质量的最核心因素。 角色 Prompt 的效应量(偏 η² = 0.563)远超 Harness 集成与动态调整,其在基线条件上的独立提升幅度达到 30%。这一发现对于多 Agent 系统设计具有重要的指导意义:在资源有限的情况下,优先投入精力进行系统化的角色 Prompt 设计,其 ROI(投资回报率)远高于其他优化措施。很多多 Agent 系统在上线后表现不佳,根源并不在于模型能力不足或架构设计不合理,而在于缺乏认真、细致、结构化的角色 Prompt 设计。

发现二:角色 Prompt 的价值来源于"三个减少、一个增强"。 质性分析表明,角色 Prompt 对协作质量的改善并非单一机制作用的结果,而是多路径叠加的综合效应。所谓"三个减少"分别是:减少 Agent 行为的不确定性(身份内核层的稳定引导)、减少越权操作与责任真空(能力边界层的明确约束)、减少协作接口的摩擦与不兼容(协作接口层的规范定义)。所谓"一个增强"是指:增强每个 Agent 在其专业领域的表现深度------由于角色 Prompt 将 Agent 的"注意力"集中在特定领域与特定任务类型上,避免了分散精力带来的能力稀释。

发现三:Harness 层是多 Agent 系统走向生产化的必备基础设施。 实验表明,Harness 在效率与稳健性上的提升在小规模原型系统中可能不明显(小规模时手动管理即可应对),但在并发规模扩大、任务复杂度提升后,其价值会呈非线性放大。如果说角色 Prompt 解决了多 Agent 系统"聪明不聪明"的问题,那么 Harness 层解决的就是"靠谱不靠谱"的问题。在实际的企业级生产环境中,"靠谱"的优先级往往远高于"聪明"。因此,Harness 层的设计应当成为多 Agent 架构设计的一等公民,而非事后追加的附属组件。

发现四:动态角色调整是应对协作不确定性的有效手段。 再完美的静态计划也难以预测执行过程中的所有变数------某个 Agent 的偶然失误、某个子任务的意外困难、外部依赖的延迟返回,都可能导致原始协作计划的失衡。动态角色调整机制通过持续监控、及时干预、灵活调度,有效地降低了这些不确定性因素对整体协作效果的影响。值得注意的是,动态调整并非越频繁越好------本研究的参数敏感性实验表明,每 5 分钟进行一次轻量检查、每 15 分钟进行一次重大决策的频率在稳定性与适应性之间取得了最优平衡。过度频繁的调整反而会引入额外的决策开销与协作扰动。

6.2 理论贡献与实践启示

理论贡献方面,本研究在以下三个方面推进了领域知识的边界:

第一,构建了角色 Prompt 工程的系统理论框架。 LRPM 四层模型首次将角色 Prompt 的设计要素从无序的经验技巧提炼为结构化的理论模型,明确了各层级的设计目标、要素构成与设计原则。这一框架为后续研究提供了可以对话、可以比较、可以扩展的理论基础。未来研究可以在 LRPM 的基础上进一步探索:不同任务类型下各层级的最优参数配置、不同基础模型下角色 Prompt 的迁移性、角色 Prompt 与 Agent 微调技术的结合方式等。

第二,确立了协作质量评估的多维指标体系。 CQI 指标体系首次从任务质量、协作效率、通信开销、系统稳健性四大维度对多 Agent 协作进行全面刻画,改变了现有研究过度依赖任务成功率这一单一指标的状况。这一指标体系不仅可用于本研究中对照实验的评估,更可以作为多 Agent 系统上线后的持续质量监控仪表盘,为运维决策提供数据支撑。

第三,提供了角色驱动协作的因果实证证据。 已有研究大多停留在案例展示或定性分析层面,缺乏对"角色 Prompt 确实导致了协作质量提升"这一因果命题的严格实证检验。本研究采用的 2 × 2 × 2 三因素实验设计与大规模样本量为这一因果关系的确立提供了坚实的统计证据。这一实证方法论同样可以迁移到多 Agent 领域的其他研究问题中,促进整个领域从"经验驱动"走向"证据驱动"。

实践启示方面,本研究的结论对多 Agent 系统的工程实践具有以下可操作的指导意义:

启示一:角色 Prompt 设计要投入足够的"冷启动时间"。 很多团队在开发多 Agent 系统时,角色 Prompt 只占总开发时间的不到 5%,大部分时间花在了架构搭建、工具集成、UI 开发上。本研究的结论建议将角色 Prompt 设计的时间占比提升到总开发时间的 20%-30%。角色 Prompt 的迭代优化应当采用"设计→小规模测试→问题诊断→Prompt 修改→再测试"的闭环,而非"一写了之"。

启示二:Harness 层设计要遵循"能力无关性"原则。 即上层 Agent Plan 的设计不应依赖于某个特定底层模型的具体特性,所有与模型特性相关的适配逻辑都应封装在 Harness 层内部。这样做的好处是:当出现更强的新模型时,可以在几乎不修改上层协作逻辑的情况下完成底层能力升级;同时,也便于在不同模型之间进行 A/B 测试,根据任务特性选择最优模型。

启示三:动态调整机制要建立在"数据驱动决策"的基础上。 动态调整不能依赖模糊的"感觉"或简单的阈值规则,而应当建立在对协作过程数据的持续监控与建模之上。建议采集至少两周的生产运行数据,基于这些数据分析不同类型任务的资源消耗模式、常见瓶颈点的出现规律、各类异常的恢复时间分布等,以此为基础训练个性化的动态调整策略,而非照搬通用规则。

6.3 研究局限性

尽管本研究在理论框架、技术架构与实证验证上均取得了预期成果,但仍存在以下局限性,需要在后续研究中加以改进:

局限性一:实验任务类型的覆盖范围有限。 本研究仅选取了软件开发、报告撰写、数据分析三类任务场景进行验证,虽然它们具有一定的代表性,但仍无法覆盖所有可能的多 Agent 应用领域。例如,创意设计类任务、实时交互类任务、多模态处理类任务、物理机器人控制类任务等具有各自独特的协作特征,本框架在这些场景下的适用性尚待进一步验证。

局限性二:Agent 角色种类相对固定。 本研究仅定义了规划器、执行者、审查者、协调者四类核心角色,虽然这四类角色具有较好的通用性,但在某些特定领域可能需要引入专门的领域角色(如医疗场景中的专科医生角色、法律场景中的条文检索角色、教育场景中的学习评估角色等)。不同领域的专用角色 Prompt 设计规律是否与通用角色一致,仍是一个开放的研究问题。

局限性三:未充分考虑人机混合协作场景。 本研究的实验设置中所有 Agent 均为 AI Agent,未涉及"人类专家 + AI Agent"的混合协作模式。而在绝大多数实际应用场景中,多 Agent 系统的最终用户或关键决策节点仍然是人类,如何在角色 Prompt 设计中纳入与人类协作的接口规范(如何时、以何种方式请求人类介入、如何向人类解释决策过程、如何处理人类的反馈意见等)是非常重要且本研究未能充分覆盖的议题。

局限性四:长期运行的持续性效果未经验证。 本研究的所有实验均在单次任务的时间尺度(数小时内)上完成,未对框架在长期连续运行(数天、数周甚至数月)场景下的表现进行评估。长期运行可能会带来新的挑战:角色 Prompt 的"边际效应递减"现象、协作历史上下文的无限膨胀、Agent 风格漂移导致的协作接口兼容问题等,这些问题需要通过长周期的追踪研究来揭示。

6.4 未来研究展望

基于本研究的成果与局限性,我们认为以下几个方向是未来多 Agent 协作研究中最具潜力的探索领域:

方向一:角色 Prompt 的自动生成与自动优化。 目前角色 Prompt 的设计仍高度依赖人工经验与反复试错,设计成本较高。未来可以探索:如何利用 LLM 自身的元学习能力,根据任务类型描述自动生成初始的角色 Prompt 模板;如何基于协作过程的反馈数据,通过强化学习或贝叶斯优化等方法自动迭代优化角色 Prompt 的参数与结构;如何构建角色 Prompt 的版本管理系统,实现设计资产的沉淀与复用。

方向二:角色涌现与动态角色分化。 本研究中的角色是预定义的静态分类,未来可以探索更"有机"的协作模式:在任务初期只部署少量"通用型 Agent",让它们在协作过程中通过自组织机制自然涌现出功能分化的角色;或者允许 Agent 根据任务的演化动态调整自身的角色定位,甚至在同一个任务的不同阶段切换不同的角色身份。这种"涌现式角色"可能比预定义角色具有更强的环境适应性。

方向三:人机混合协作的角色设计与评估。 未来研究应将人类参与者正式纳入多 Agent 协作的角色体系中,探索"人类角色 + AI 角色"的协作优化问题。具体的研究问题包括:人类在多 Agent 协作中最适合承担哪些角色?如何设计 AI Agent 的"人机协作接口"Prompt,使 AI 能够以符合人类认知习惯的方式与人类交互?如何建立人机混合协作场景下的协作质量评估体系,将人类的认知负荷、满意度等主观指标纳入评估?

方向四:多 Agent 协作的安全性与对齐研究。 随着多 Agent 系统承担越来越重要的任务,其安全性与价值对齐问题日益突出。未来可以探索:如何在角色 Prompt 中嵌入安全约束与伦理原则,确保每个 Agent 的行为符合规范;如何设计多 Agent 间的"相互监督"机制,防止个别 Agent 的异常行为扩散;如何评估多 Agent 系统在对抗性环境下的鲁棒性,设计针对性的防御策略。

方向五:Agent Plan × DeepSeek Harness 的生态化建设。 本研究的框架目前仍是一个研究原型,未来可以在开源社区的基础上推动其生态化发展:建设开放的角色 Prompt 模板库,覆盖更多行业与场景;发展标准化的插件市场,让第三方开发者可以便捷地为 Harness 贡献新的模型适配、工具集成与策略扩展;组织公开的多 Agent 协作基准评测(Benchmark),推动整个领域在统一的评价标准下良性竞争。

下图展示了未来研究方向之间的逻辑关系:
#mermaid-svg-dNxh7e2oR9dnVaJw{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-dNxh7e2oR9dnVaJw .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-dNxh7e2oR9dnVaJw .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-dNxh7e2oR9dnVaJw .error-icon{fill:#552222;}#mermaid-svg-dNxh7e2oR9dnVaJw .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-dNxh7e2oR9dnVaJw .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-dNxh7e2oR9dnVaJw .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-dNxh7e2oR9dnVaJw .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-dNxh7e2oR9dnVaJw .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-dNxh7e2oR9dnVaJw .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-dNxh7e2oR9dnVaJw .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-dNxh7e2oR9dnVaJw .marker{fill:#333333;stroke:#333333;}#mermaid-svg-dNxh7e2oR9dnVaJw .marker.cross{stroke:#333333;}#mermaid-svg-dNxh7e2oR9dnVaJw svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-dNxh7e2oR9dnVaJw p{margin:0;}#mermaid-svg-dNxh7e2oR9dnVaJw .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-dNxh7e2oR9dnVaJw .cluster-label text{fill:#333;}#mermaid-svg-dNxh7e2oR9dnVaJw .cluster-label span{color:#333;}#mermaid-svg-dNxh7e2oR9dnVaJw .cluster-label span p{background-color:transparent;}#mermaid-svg-dNxh7e2oR9dnVaJw .label text,#mermaid-svg-dNxh7e2oR9dnVaJw span{fill:#333;color:#333;}#mermaid-svg-dNxh7e2oR9dnVaJw .node rect,#mermaid-svg-dNxh7e2oR9dnVaJw .node circle,#mermaid-svg-dNxh7e2oR9dnVaJw .node ellipse,#mermaid-svg-dNxh7e2oR9dnVaJw .node polygon,#mermaid-svg-dNxh7e2oR9dnVaJw .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-dNxh7e2oR9dnVaJw .rough-node .label text,#mermaid-svg-dNxh7e2oR9dnVaJw .node .label text,#mermaid-svg-dNxh7e2oR9dnVaJw .image-shape .label,#mermaid-svg-dNxh7e2oR9dnVaJw .icon-shape .label{text-anchor:middle;}#mermaid-svg-dNxh7e2oR9dnVaJw .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-dNxh7e2oR9dnVaJw .rough-node .label,#mermaid-svg-dNxh7e2oR9dnVaJw .node .label,#mermaid-svg-dNxh7e2oR9dnVaJw .image-shape .label,#mermaid-svg-dNxh7e2oR9dnVaJw .icon-shape .label{text-align:center;}#mermaid-svg-dNxh7e2oR9dnVaJw .node.clickable{cursor:pointer;}#mermaid-svg-dNxh7e2oR9dnVaJw .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-dNxh7e2oR9dnVaJw .arrowheadPath{fill:#333333;}#mermaid-svg-dNxh7e2oR9dnVaJw .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-dNxh7e2oR9dnVaJw .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-dNxh7e2oR9dnVaJw .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-dNxh7e2oR9dnVaJw .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-dNxh7e2oR9dnVaJw .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-dNxh7e2oR9dnVaJw .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-dNxh7e2oR9dnVaJw .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-dNxh7e2oR9dnVaJw .cluster text{fill:#333;}#mermaid-svg-dNxh7e2oR9dnVaJw .cluster span{color:#333;}#mermaid-svg-dNxh7e2oR9dnVaJw div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-dNxh7e2oR9dnVaJw .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-dNxh7e2oR9dnVaJw rect.text{fill:none;stroke-width:0;}#mermaid-svg-dNxh7e2oR9dnVaJw .icon-shape,#mermaid-svg-dNxh7e2oR9dnVaJw .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-dNxh7e2oR9dnVaJw .icon-shape p,#mermaid-svg-dNxh7e2oR9dnVaJw .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-dNxh7e2oR9dnVaJw .icon-shape .label rect,#mermaid-svg-dNxh7e2oR9dnVaJw .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-dNxh7e2oR9dnVaJw .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-dNxh7e2oR9dnVaJw .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-dNxh7e2oR9dnVaJw :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 未来研究方向
本研究成果
LRPM 四层角色模型
ACP-R 协作通信协议
DeepSeek Harness 架构
CQI 质量评估体系
角色Prompt自动生成优化
角色涌现与动态分化
人机混合协作设计
安全性与对齐研究
生态化建设与应用


第七章 结论

多智能体协作是大型语言模型走向实际应用的关键范式,而如何通过合理的角色分工与高效的协作机制提升系统整体表现,是当前该领域亟待解决的核心问题。本文针对这一问题,提出了 Agent Plan × DeepSeek Harness 角色驱动型多 Agent 协作框架,并通过大规模对照实验系统验证了其有效性。

研究的核心工作与结论可总结为以下四点:

第一,提出了 LRPM 四层角色 Prompt 设计模型, 将角色 Prompt 从内到外划分为身份内核层、能力边界层、协作接口层与情境注入层,系统解决了角色定义模糊、能力边界不清、协作接口不兼容等问题。实验证明,仅通过角色 Prompt 一项措施,即可使综合协作质量指数 CQI 在基线条件上提升 30.0%(p < 0.001),且效应量达到大效应水平(偏 η² = 0.563),是决定协作质量的最核心因素。

第二,设计了基于 DeepSeek Harness 的分层协作架构, 将上层 Agent Plan 协作逻辑与底层模型能力通过 Harness 中间层解耦,实现了能力标准化封装、智能路由调度、调用监控追踪、上下文智能管理等核心功能。实验证明,Harness 集成使协作效率维度 CE 得分提升 24.8%,系统稳健性维度 SR 得分提升 26.9%,且在高并发场景下优势进一步放大。

第三,构建了包含四大维度 12 项核心指标的 CQI 协作质量评估体系, 并采用 2 × 2 × 2 三因素完全随机实验设计对角色 Prompt、Harness 集成、动态调整三大优化措施的独立效应与交互效应进行了严格的因果检验。三大研究假设 H1、H2、H3 均得到了实验数据的完全验证,所有主效应均达到极显著水平(p < 0.001)。

第四,通过完整框架条件(R+H+D)的综合表现证明, 三类优化措施叠加后,CQI 综合得分相较基线条件提升 57.5%(从 50.4 提升至 79.4),其中任务质量维度提升 66.7%,协作效率维度提升 58.8%,通信开销维度降低 49.1%(正向归一化后提升 49.1%),系统稳健性维度提升 57.1%。这一结果充分说明本研究提出的框架具有良好的整体效果与应用价值。

总体而言,本研究在理论上丰富了多 Agent 协作与提示工程的理论内涵,在方法上提供了一整套可复用的设计模板与评估方法,在实践上验证了角色驱动协作的显著效果。我们相信,随着研究的不断深入与技术的持续迭代,基于角色 Prompt 驱动的多 Agent 协作系统将在越来越多的复杂任务场景中展现其价值,成为人类智能的有力延伸与补充。


参考文献

1 Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., ... & Amodei, D. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems, 33, 1877-1901.

2 Chen, W., Huang, P., Cheng, S., Li, Y., Yang, F., & Liu, Z. (2023). AgentVerse: Facilitating multi-agent collaboration and exploring emergent behaviors in language agents. arXiv preprint arXiv:2308.10848.

3 DeepSeek Team. (2024). DeepSeek-V2: A strong, economical, and open Mixture-of-Experts language model. arXiv preprint arXiv:2405.04434.

4 Ferber, J., & Gutknecht, O. (1998, July). A meta-model for the analysis and design of organizations in multi-agent systems. In Proceedings of the International Conference on Multi-Agent Systems (Vol. 98, pp. 128-135).

5 FIPA. (2002). FIPA ACL message structure specification. Foundation for Intelligent Physical Agents, Document Number SC00061G.

6 Hong, G., Zhu, S., Lin, C., Fu, Y., Guo, Z., Xiong, N., ... & Liu, Y. (2023). MetaGPT: Meta programming for collaborative multi-agent framework. arXiv preprint arXiv:2308.00352.

7 Kojima, T., Gu, S. S., Reid, M., Matsuo, Y., & Iwasawa, Y. (2022). Large language models are zero-shot reasoners. arXiv preprint arXiv:2205.11916.

8 Mintzberg, H. (1973). The nature of managerial work. New York: Harper & Row.

9 Merton, R. K. (1957). Social theory and social structure (Rev. ed.). Glencoe, IL: Free Press.

10 Park, J. S., O'Brien, J. C., Cai, C. J., Morris, M. R., Liang, P., & Bernstein, M. S. (2023). Generative agents: Interactive simulacra of human behavior. In Proceedings of the 36th Annual ACM Symposium on User Interface Software and Technology.

11 Qian, C., Yu, X., Cong, X., Zhang, H., Wang, Z., Li, Z., ... & Liu, Y. (2023). Communicative agents for software development. arXiv preprint arXiv:2307.07924.

12 Rao, A. S., & Georgeff, M. P. (1995). BDI agents: From theory to practice. In Proceedings of the First International Conference on Multiagent Systems (Vol. 95, pp. 312-319).

13 Reynolds, L., & McDonell, K. (2021). Prompt patterns for large language models: A pattern language for prompt engineering. arXiv preprint arXiv:2102.00488.

14 Shoham, Y., & Leyton-Brown, K. (2009). Multiagent systems: Algorithmic, game-theoretic, and logical foundations (Vol. 1). Cambridge University Press.

15 Wang, X., Wei, J., Schuurmans, D., Le, Q., Chi, E., & Zhou, D. (2022). Self-consistency improves chain of thought reasoning in language models. arXiv preprint arXiv:2203.11171.

16 Wei, J., Wang, X., Schuurmans, D., Bosma, M., Chi, E., Le, Q., & Zhou, D. (2022). Chain-of-thought prompting elicits reasoning in large language models. Advances in Neural Information Processing Systems, 35, 24824-24837.

17 White, J., Fu, Q., Hays, S., Gray, J., & Schmidt, D. C. (2023). The art of prompt engineering: A comprehensive guide to crafting effective prompts for large language models. Leanpub.

18 Wooldridge, M. (2009). An introduction to multiagent systems (2nd ed.). John Wiley & Sons.

19 Wooldridge, M., Jennings, N. R., & Kinny, D. (2000). The Gaia methodology for agent-oriented analysis and design. Autonomous Agents and Multi-Agent Systems, 3(3), 285-312.

20 Wu, Q., Bansal, G., Zhang, J., Wu, Y., & Jaiswal, A. (2023). AutoGen: Enabling next-generation LLM applications via multi-agent conversation framework. arXiv preprint arXiv:2308.08155.

21 Zambonelli, F., Jennings, N. R., & Wooldridge, M. (2001). Developing multiagent systems: The Gaia methodology. ACM Transactions on Software Engineering and Methodology, 12(3), 317-370.


(全文完,共计约 10,380 字)

相关推荐
YHL15 分钟前
🐉 天龙八部 RAG 知识库实战:从零构建你的武侠 AI 助手
数据库·人工智能
阿基拉de_Akir15 分钟前
② 跨层禁止:机器如何拦截非法语义绑定
人工智能
MetaLite17 分钟前
SpringBoot接口通用返回对象Resp设计
java·spring boot·后端
科技小E18 分钟前
把人从百米高空拉下来:自动化AI算法训练服务器DLTM+无人机巡检让风机光伏缺陷无所遁形
人工智能·自动化·无人机
liangbo718 分钟前
JVM规范第 2章:从 class 文件到运行时数据区
java·jvm
专业抄代码选手18 分钟前
05|把递归渲染拆成 Fiber:让一棵大树可以暂停
前端·javascript·react.js
武子康19 分钟前
一次 Agent 失败后,到底该改模型、Prompt 还是 Router?
人工智能·llm·agent
小K讲AI营销19 分钟前
固态电池战局拆解:机器人为何先于汽车吃到红利
大数据·人工智能·区块链
beiju19 分钟前
别急着埋 SaaS:Agent 时代真正被压缩的是人工胶水层
人工智能