论文标题 : SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?
论文地址 : https://arxiv.org/abs/2608.30661
作者单位 : 中国科学院自动化研究所
发表时间: 2026年8月31日
背景知识
在深入解读 SwarmBench 之前,有必要先厘清几个核心概念。
什么是 Agent Swarm(智能体集群)? Agent Swarm 是一种层次化的多智能体系统,其中一个编排器(orchestrator)负责协调一组动态创建的子智能体(subagents)以完成给定任务。与早期具有固定角色和通信结构的多智能体系统(如辩论、SOP 驱动的流水线、管理者-工作者协作)不同,Agent Swarm 的核心特征是:(1) 层次化编排------单一编排器负责任务规划、子智能体创建、协调和最终综合;(2) 动态异构实例化------子智能体在运行时根据任务需求动态创建,具有不同的角色、骨干模型、工具和局部上下文;(3) 并行执行------多个子智能体可以并发执行不同子任务并将结果回报给编排器。其关键挑战从"设计固定团队"转变为"让模型动态组织团队"。
什么是 Task Decomposition(任务分解)? 指编排器将复杂目标拆分为多个可并行或渐进执行的子任务的能力。有效的分解要求子任务既不过于粗粒度(难以执行)也不过于细粒度(冗余开销),且需考虑依赖关系和搜索顺序。
什么是 Subagent Delegation(子智能体委派)? 指编排器根据子任务特征选择合适的骨干模型、创建合适的角色描述,并将具体子任务分配给对应子智能体的能力。这要求编排器理解不同模型的能力边界(model card),并设计非重叠、具体、可操作的子任务。
什么是 Result Aggregation(结果聚合)? 指编排器将多个子智能体产生的局部草稿、局部结果或中间内容进一步过滤、整合和统一为具有连贯风格和完整结构的最终答案的能力。聚合不仅是简单的文本拼接,还包括冲突解决、证据比较、质量筛选和风格统一。
什么是 SwarmExp(经验驱动的集群编排)? 本文提出的经验提取与回放方法,从执行轨迹中总结三类可复用知识:Skill(高层工作流模式)、Trick(细粒度操作经验)和 Model Card(子模型能力档案),并在推理时注入主智能体上下文以提升编排质量。
一、背景:为什么需要 SwarmBench?
1.1 多智能体系统范式的演进困境
近年来,基于大语言模型的多智能体系统(LLM-MAS)经历了从固定协作范式向动态编排范式的深刻转变:
- 早期固定拓扑的局限:早期的 LLM-MAS 系统依赖预定义的角色和通信结构(如辩论、SOP 驱动流水线、管理者-工作者协作)。这些系统易于控制和分析,但预定义的协作模式限制了其在跨任务场景中的可扩展性------不同任务需要不同的分解策略、角色组合和通信拓扑,固定结构难以自适应。
- Agent Swarm 的兴起:Agent Swarm 将焦点从"设计固定团队"转向"允许模型动态组织团队"。在这种范式中,主智能体负责任务分解、创建子智能体、协调并行执行、最终整合输出。这要求 LLM 不仅作为内容生成器,更要作为编排器(orchestrator)高效组织动态集群。
- 评估严重滞后:尽管系统架构快速演进,现有基准测试仍大量依赖为单智能体系统或通用智能体设计的任务(如 GAIA、SWE-bench、WebShop),无法系统暴露 Agent Swarm 所需的关键编排能力。即使部分任务看似适合多智能体协作,现有评估也主要关注最终答案质量,而忽视编排过程本身的质量------包括任务分解的合理性、子智能体创建的有效性、结果聚合的完整性。
1.2 现有评估方法的结构性盲区
- 单智能体基准无法衡量编排能力:GAIA、Terminal-Bench 等基准测试衡量的是单个智能体解决复杂问题的能力,无法区分是模型自身推理能力的提升还是编排策略的改进。一个强大的单智能体模型可能在 Swarm 编排中表现糟糕,反之亦然。
- 最终准确率掩盖过程缺陷:现有评估主要报告任务最终正确率,但两个达到相同准确率的系统可能有截然不同的编排质量------一个可能通过合理的分解和委派高效完成,另一个可能通过冗余调用和盲目试错勉强达到。过程质量的缺失使得研究者无法定位真正的瓶颈。
- 成本与效率维度被忽视:多智能体系统的实际部署不仅关注准确率,还关注执行成本(API 调用费用)和时间效率(并行加速比)。现有基准很少系统报告这些指标,导致无法评估编排策略的经济性和实用性。
- 缺乏对三大编排阶段的独立评估:任务分解、子智能体委派和结果聚合是 Agent Swarm 的三个核心阶段,但现有基准没有设计能够独立施压每个阶段的任务类型,使得研究者无法判断模型在哪个编排环节最薄弱。
SwarmBench 的核心洞见是:需要一个专门为 Agent Swarm 编排器设计的基准,从准确率、效率、成本和过程质量四个维度,系统评估任务分解、子智能体委派和结果聚合三大核心能力。这要求基准具备三个特征:任务类型与编排阶段对齐、评估维度超越最终答案、以及过程质量的细粒度可解释分析。
二、核心创新:面向 Agent Swarm 编排器的多维评估基准与经验驱动增强方法
SwarmBench 的技术精髓可以概括为:构建与三大编排阶段对齐的八任务评估体系,从准确率-效率-成本-过程质量四个维度刻画模型编排能力,并通过经验提取-总结-回放(SwarmExp)将轨迹知识转化为可复用的编排增强信号。
2.1 与编排阶段对齐的三类八任务评估体系
SwarmBench 将任务按主要考察的编排能力分为三类,共 8 个任务/400 个样本:
分解导向任务(Decomposition-Oriented)------评估主智能体将复杂目标拆分为可管理子任务的能力:
- MATH:基于 Omni-MATH,选取难度 7 以上样本,要求系统分解复杂数学问题为可验证的中间步骤。
- Batch Download (BD):全新构建任务,每个样本包含虚拟环境和文件下载需求(平均 11.44 个文件),要求编排器将大规模检索目标分解为并行下载子任务并保持全局一致性。环境包含大量干扰项(重复、预览、草稿、镜像文件),需要精确识别正确版本。
- Multi-Text Understanding (MTU):基于 Loong 数据集,选取适合多智能体协作的样本(平均上下文 200K+,24+ 文档),要求系统并行阅读多个文档并综合回答。
委派导向任务(Delegation-Oriented)------评估主智能体选择骨干模型、创建角色、分配子任务的能力:
- Multi-Perspective Analysis (MPA):基于 DeepReview,要求系统创建具有不同视角(新颖性、有效性、完整性)的子智能体,组织协作生成最终评审意见。
- Root Cause Analysis (RCA):基于 OpenRCA,要求系统从不同证据源(日志、指标、追踪)推断故障原因,需要创建专门处理不同证据类型的子智能体。
- Treasure Hunt (TH):全新构建的交互式任务,主智能体作为基地指挥官,必须动态创建两种角色的子智能体(侦察兵和搬运工)探索未知地图、搜寻钥匙、打开宝箱并运回基地。地图初始处于战争迷雾中,需根据不断揭示的信息重新规划。
聚合导向任务(Aggregation-Oriented)------评估主智能体将多个局部输出整合为统一最终答案的能力:
- Long-Text Generation (LTG):基于 LongInOutBench,要求系统整合多个子智能体从不同论文生成的内容,产出连贯的长篇综述文章。
- Wide Search (WS):基于 WideSearch,子智能体通过真实网络搜索检索关键信息,主智能体必须聚合收集到的信息并完成最终答案。
每个任务在分解难度、角色异构性、聚合复杂度、主智能体可见性、并行依赖度和输出开放性六个维度上具有不同的 orchestration 特征(表 6),确保基准全面覆盖编排能力空间。
2.2 四维评估框架:准确率、效率、成本与过程质量
SwarmBench 不仅报告最终任务准确率,还引入三个互补维度:
准确率(Accuracy):采用各任务原始评估协议。MATH 使用 LLM 等价判断;BD 使用下载 F1(精确匹配文件路径和校验和);MTU 使用 LLM 评分(1-100 归一化);MPA 综合评审分数、决策、文本完整性和协作质量;RCA 使用 OpenRCA 评分点匹配;LTG 评估事实一致性、写作质量和长度控制;WS 使用项目级 F1;TH 使用成功运回基地宝箱价值占比。
效率(Efficiency):引入两个并行相关指标:
- 并行率(Parallelism Rate):执行期间平均并发子智能体数量,反映系统激活并行的程度。
- 并行增益(Parallelism Gain):串行执行时间与实际墙钟时间的比值,反映并行带来的真实延迟降低。Gain = (T_model + T_tool) / T_wall,值越大说明编排器构造的并行结构越有效。
成本(Cost):使用实际美元费用而非原始 token 数,按各模型的输入/输出 token 单价计算主智能体和所有子智能体的总调用成本。
过程质量(Process Quality):引入基于 LLM 的评估框架,从三个维度对主智能体的编排行为打分(0-100):
- 任务分解(Decomposition):是否将任务拆分为有意义、非重叠、难度匹配的子问题;是否考虑依赖关系和搜索顺序。
- 子智能体创建与委派(Delegation):角色描述是否具体、必要、不重叠;模型选择是否参考 model card;子任务是否具体、有界、可操作。
- 结果聚合(Aggregation):是否等待相关子智能体输出;是否比较而非盲信单一输出;是否将证据整合为连贯结论;是否在冲突证据出现时调整方向。
2.3 轻量级 Agent Swarm 评估框架
为保证评估的公平性和可比性,SwarmBench 设计了统一的轻量级框架:
- 主智能体负责分解、创建、分配和聚合,但不允许独立调用工具或直接回答任务。
- 部分任务上下文对主智能体隐藏,强制其依赖子智能体获取信息。
- 子智能体骨干模型从共享模型池中选择,每个模型附带公开信息编写的模型描述,主智能体动态选择。
- 工具接口和输出格式在所有模型间保持一致。
这种设计确保评估的是编排能力而非模型自身的知识储备或工具使用能力。
2.4 SwarmExp:经验驱动的编排增强
基于 SwarmBench 的实验发现,论文进一步提出 SwarmExp------一种简单但有效的经验提取与回放方法:
三阶段流水线:
- 轨迹生成:使用基础 Agent Swarm 框架在 SwarmBench 上运行并收集完整轨迹。
- 经验总结 :从轨迹中提取三类可复用知识:
- Skill(技能):高层工作流模式。使用 LLM 从轨迹中总结编排模式,组织为 SKILL.md 文件,描述某类任务的可复用工作流(如何分解、组织子智能体、聚合局部结果)。
- Trick(技巧):细粒度操作经验。比 skill 更短更具体,对应任务执行中实用但易被忽视的策略(如如何减少冗余信息、如何更合适地分配子任务),组织为 trick library。
- Model Card(模型卡片):子智能体骨干模型在特定任务上的实际表现档案,包括整体质量、适用场景、优势和劣势,帮助主智能体在创建和分配时做出更合理的模型选择。
- 经验回放:在推理时将三类经验注入主智能体上下文,让编排器在规划、委派和聚合时参考历史经验。
三、实验验证:十模型跨八任务的多维评估
3.1 主结果:准确率评估
在 10 个模型(5 个专有模型 + 5 个开源模型)上的准确率结果(表 1)显示:
| 模型 | MATH | BD | MTU | MPA | RCA | TH | LTG | WS | 平均 |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.4 | 82.97 | 87.84 | 48.82 | 77.17 | 10.00 | 10.33 | 48.19 | 38.67 | 50.49 |
| Claude-Sonnet-4-6 | 60.00 | 61.50 | 81.43 | 76.52 | 5.50 | 2.38 | 58.74 | 31.67 | 43.51 |
| Gemini-3-flash | 73.46 | 55.92 | 31.29 | 78.04 | 3.80 | 6.29 | 30.73 | 29.56 | 38.63 |
| Kimi-k2.5 | 57.14 | 36.48 | 22.53 | 76.52 | 8.82 | 8.33 | 40.67 | 12.05 | 32.81 |
| Deepseek-v3.2 | 56.00 | 79.45 | 32.08 | 75.51 | 5.00 | 1.08 | 42.58 | 30.36 | 40.38 |
| Qwen3.5-397b-a17b | 64.00 | 67.13 | 29.50 | 75.51 | 7.05 | 0.79 | 45.83 | 35.20 | 40.62 |
| Qwen3-30b-a3b | 61.00 | 71.36 | 39.00 | 39.56 | 4.00 | 0.00 | 26.71 | 7.91 | 31.19 |
| GLM-5.1 | --- | 78.17 | 0.00 | --- | 29.32 | --- | 40.30 | --- | --- |
关键发现:
- GPT-5.4 是最强且最均衡的编排器,在 8 个任务中的 6 个上取得最佳表现,在分解、委派和聚合三个阶段均展现稳定能力。
- Claude-Sonnet-4-6 是最近的专有竞争者,优势集中在 MPA 和 LTG 等更依赖角色组织和内容综合的任务。
- 开源模型能力碎片化:Kimi-k2.5 在委派导向任务(RCA、TH)上最稳定;Qwen3.5-397b-a17b 在聚合导向任务(LTG、WS)上表现更好;Deepseek-v3.2 和 GLM-5.1 在 BD 和 MTU 上相对稳定,但未展现跨任务的一致编排优势。
- 小规模模型存在明显瓶颈:Qwen3-30b-a3b 在委派和聚合相关任务上显著更弱,表明编排能力对模型规模敏感。
3.2 成本-准确率权衡分析
准确率-成本帕累托前沿分析(图 2)揭示:
- 成本与性能非线性 :MATH 和 BD 上性能通常随成本增加而提升,但 MPA、LTG、MTU、RCA、WS 上更高成本不一定带来更好性能,部分低成本设置已接近最优。这表明编排结构的有效性比单纯增加成本更重要。
- 强编排器的成本优势:同一家族的 Qwen3.5-397b-a17b 更频繁地位于帕累托前沿,而 Qwen3-30b-a3b 往往成本更高但性能更差。强编排器通过更高效的分解、委派和聚合,用更低成本实现更好性能;弱编排器则需要更多交互和冗余执行。
- 成本匹配的单智能体基线(表 7):即使给予单智能体与 Agent Swarm 相同的成本预算,Agent Swarm 在 MTU、LTG、WS 上仍显著优于成本匹配的单智能体,证明收益不仅来自预算增加,更来自编排结构本身。
3.3 并行度与执行效率
并行率与并行增益分析(图 3)揭示了一个反直觉的发现:
- 并行率 ≠ 并行增益:Kimi-k2.5 和 Qwen3.5-397b-a17b 的并行率显著高于其他模型,但 Kimi-k2.5 的并行增益并未超越并行率略低的 Claude-Sonnet-4-6。Gemini-3-flash 以中等并行率实现了最高并行增益。
- 有效编排结构是关键:时间减少的决定因素不是同时运行多少子智能体,而是主智能体是否构造了有效的并行结构------减少冗余等待、避免重复执行、将并行子任务组织为真正有益的协作模式。
3.4 编排质量的过程分析
基于 LLM 的编排质量评估(图 4)显示:
任务视角:
- BD、MTU、MATH 在分解维度得分较低(MATH 最难),证实这些任务主要施压"将复杂目标转化为可处理中间步骤"的能力。
- MPA、RCA、TH 在委派维度更具挑战,反映其对角色构建、模型选择和子任务分配的依赖。
- LTG 和 WS 在聚合维度下降最大,表明将多个局部输出综合为统一最终答案是聚合导向任务的核心瓶颈。
模型视角:
- GPT-5.4 在三个维度上均最强且最均衡。
- Claude-Sonnet-4-6 和 Qwen3.5-397b-a17b 形成有竞争力的第二梯队,前者更均衡,后者在分解和委派上更强。
- 较弱模型在聚合维度尤其薄弱 ,且聚合得分在三个维度中普遍最低。这表明当前模型相对更擅长发起和分配子任务,而非可靠地将子智能体输出整合为连贯的最终答案。
3.5 SwarmExp 实验结果
在 MTU、RCA、LTG、WS 四个代表性任务上的 SwarmExp 评估(表 2)显示:
| 方法 | MTU | RCA | LTG | WS |
|---|---|---|---|---|
| Single Agent | 18.20 | 1.02 | 33.43 | 6.32 |
| Multi-Model Voting | 34.92 | 0.00 | 36.79 | 26.66 |
| Best-of-N | 20.68 | 0.00 | 34.35 | 17.69 |
| AOrchestra | 36.03 | 10.71 | 43.57 | 38.55 |
| Agent Swarm | 48.82 | 10.00 | 48.19 | 38.67 |
| w/ SwarmExp | 49.07 | 16.42 | 54.65 | 41.59 |
| Δ | (+0.25) | (+6.42) | (+6.46) | (+2.92) |
- SwarmExp 在所有四个任务上均取得最佳性能。
- RCA 和 LTG 的提升最显著(+6.42% 和 +6.46%),表明子智能体创建/委派和结果聚合仍是当前模型的关键弱点,SwarmExp 能有效增强这些能力。
- MTU 提升较小(+0.25%),可能因为该任务已接近当前架构的上限。
跨模型经验迁移(表 3):将 GPT-5.4 提取的经验注入 Claude-Haiku-4-5、Gemini-3-flash、Deepseek-v3.2、Qwen3.5-397b-a17b,16 个设置中的 14 个得到改善。LTG 上增益最明显,表明聚合和委派经验具有跨模型可迁移性。
组件消融(表 4):移除任一组件均导致性能下降。Model Card 的平均降幅最大(-2.49%),说明子智能体模型能力知识最重要;Skill 和 Trick 的移除也分别造成 -1.22% 和 -1.75% 的平均下降,证实高层工作流模板和细粒度执行指导均对最终性能有贡献。
四、学术洞见:SwarmBench 揭示了哪些深层规律?
洞见一:编排能力不等于单智能体能力
SwarmBench 的实验结果明确显示,强大的单智能体模型不一定是强大的编排器 。虽然 GPT-5.4 在单智能体和编排器角色上均表现最强,但其他模型呈现明显的错位------某些在单智能体基准上表现良好的模型在编排任务上显著落后。更重要的是,成本匹配实验表明,即使给予单智能体相同的计算预算,Agent Swarm 在多数任务上仍显著优于单智能体。这说明编排能力是一种独立的元能力,涉及任务理解、资源分配、进度监控和冲突解决,不能简单从内容生成能力中推导。
洞见二:并行度是表象,编排结构有效性才是本质
并行率与并行增益的分离是一个关键发现。Kimi-k2.5 实现了最高并行率,但其并行增益并未超越并行率较低的 Claude-Sonnet-4-6;Gemini-3-flash 以中等并行率获得最高增益。这揭示了一个深层规律:多智能体系统的效率瓶颈不在于能同时启动多少子智能体,而在于主智能体能否构造减少冗余等待、避免重复执行、将并行子任务组织为真正有益协作模式的编排结构。盲目增加并发数而不优化结构,只会增加成本而不提升效率。
洞见三:聚合是当前模型编排能力的最薄弱环节
过程质量评估揭示了一个一致的规律:无论模型强弱、任务类型如何,结果聚合(Aggregation)的得分普遍低于任务分解和子智能体委派。LTG 和 WS 等聚合导向任务在聚合维度上下降最大,较弱模型尤其在此维度表现不佳。这表明当前 LLM 更擅长"发起和分配"(proactive)而非"整合和收敛"(synthetic)。一个可能的解释是,聚合要求模型同时维持多个局部输出的语义表示、检测冲突、评估证据质量、并生成统一风格的新文本,这对工作记忆和一致性控制提出了更高要求。
洞见四:成本-性能关系由编排质量决定,而非简单线性
准确率-成本帕累托前沿分析推翻了"更多成本 = 更好性能"的直觉。在 MPA、LTG、MTU 等任务上,更高成本并不必然带来更好结果;强编排器能用更低成本达到更好性能,而弱编排器即使消耗更多资源也可能无法改善。这揭示了一个工程原则:多智能体系统的经济性首先取决于编排策略的质量,其次才取决于计算预算。对于实际部署,投资于编排策略优化(如 SwarmExp)的回报可能高于简单增加模型调用预算。
洞见五:经验是可迁移的编排知识载体
SwarmExp 的跨模型迁移实验表明,从一个模型(GPT-5.4)提取的编排经验可以有效提升其他模型的编排能力(14/16 设置改善)。这暗示编排知识具有与领域内容知识不同的抽象层次------它更接近于程序性知识(知道如何组织流程),而非陈述性知识(知道具体事实)。Skill 提供工作流模板,Trick 提供局部启发式,Model Card 提供资源画像,三者共同构成了可复用的编排资产。这为"编排即服务"或"编排知识库"的概念提供了实证支持。
五、局限性与未来方向
论文坦诚讨论了以下局限:
- 任务覆盖有限:SwarmBench 仅包含 8 个任务/400 个样本,可能无法覆盖 Agent Swarm 的全部场景。例如,缺乏涉及长期自主运行(如持续数小时的任务)、实时协作(如与人类操作员交互)或物理世界交互(如机器人集群)的任务。
- 统一框架的约束:评估在统一的轻量级 Swarm 框架和固定的子智能体模型池中进行,这提高了可比性,但可能限制了结论的泛化性。不同框架设计(如允许主智能体直接调用工具、或更灵活的通信拓扑)可能产生不同的能力画像。
- LLM 评估的局限:过程质量分析部分依赖 LLM-based 评判,尽管与人工评估的相关性较高(Pearson 0.726--0.801),但仍可能引入系统性偏差,尤其是在评估开放式生成任务时。
- 子智能体模型池的局限:共享模型池仅包含 6 个模型,且均为文本模型。未涉及多模态模型、代码专用模型或领域特定模型的编排场景。
- SwarmExp 的经验覆盖:当前经验提取基于有限任务的轨迹,跨任务迁移实验显示效果高度依赖任务相似性(如 WS 仅受益于 WS 特定经验)。如何构建更通用的跨域编排经验库仍是开放问题。
- 缺乏在线学习机制:SwarmExp 采用离线经验提取和静态回放,未探索在线适应机制------即在执行过程中根据实时反馈动态更新经验库。
未来方向包括:
- 扩展任务多样性:引入涉及代码生成、科学实验设计、创意写作、实时数据流处理等更多领域的编排任务。
- 在线经验学习:探索执行过程中的增量经验更新和自适应回放,使编排器能从失败中实时学习。
- 多模态 Agent Swarm:将基准扩展到视觉-语言模型、代码模型等多模态子智能体的编排场景。
- 编排策略的端到端优化:使用强化学习直接优化编排策略(如子智能体数量、并行度、通信拓扑),而非依赖静态经验注入。
- 人机协作编排:评估模型在需要与人类操作员协作、接受人类反馈和调整的任务中的编排能力。
- 安全性与鲁棒性评估:系统评估错误传播、级联失败、对抗性子智能体行为等风险场景。
六、核心思想总结与可借鉴点
SwarmBench 的核心思想可以用一句话概括:通过构建与编排阶段对齐的多维评估体系,系统揭示 LLM 作为 Agent Swarm 编排器的能力结构与瓶颈,并通过经验提取-回放机制将轨迹知识转化为可复用的编排增强信号。这个原则背后,是四层可迁移的方法论:
- 编排能力与内容能力解耦:评估和优化多智能体系统时,必须独立衡量编排质量(分解、委派、聚合)和内容质量(最终答案正确性),两者不可混为一谈。
- 过程质量是系统性能的上界:最终准确率受限于编排过程的质量。分解错误、委派不当或聚合薄弱都会导致正确子智能体输出被浪费。
- 并行结构的有效性优于并行数量:设计多智能体系统时,应优先优化编排结构(减少等待、避免冗余、合理依赖),而非单纯增加并发子智能体数量。
- 编排经验是可抽象、可迁移的知识资产:从成功和失败的执行轨迹中提取的工作流模式、操作技巧和模型画像,可以跨模型和跨任务迁移,是提升编排能力的经济有效途径。
对研究者的借鉴:
- 当设计多智能体系统基准时,任务设计应与核心能力维度对齐。不要仅使用通用任务并假设多智能体协作自然发生,而应主动构造能独立施压分解、委派、聚合三个阶段的任务类型。
- 评估维度必须超越最终准确率。引入过程质量、成本、效率等多维指标,才能全面刻画编排能力并定位真实瓶颈。
- 编排知识可以从轨迹中自动提取并复用。SwarmExp 证明,无需昂贵的端到端训练,仅通过 LLM 总结和上下文注入就能显著提升编排性能,这为低成本增强多智能体系统提供了实用路径。
对工程师的借鉴:
- 如果你正在构建生产级多智能体系统,务必监控编排过程质量而不仅是最终输出。使用类似 SwarmBench 的 LLM-based 过程评估框架定期审计主智能体的分解、委派和聚合行为,定位性能瓶颈。
- 不要盲目追求高并发。在部署 Agent Swarm 时,先确保编排结构能有效利用并行(减少等待、避免重复),再考虑增加子智能体数量。高并行率配合低效结构只会增加成本。
- 建立可复用的编排经验库。为常见任务类型维护 SKILL.md 工作流模板、Trick 操作技巧和 Model Card 能力档案,并在推理时注入主智能体上下文。这是一种成本低、效果稳定的编排增强手段。
- 为子智能体分配合适的模型。Model Card 消融实验表明,了解子模型的能力边界对编排质量至关重要。避免将所有子任务分配给同一个最强模型,而应根据任务特征和模型画像进行异构分配。
SwarmBench 通过构建与编排阶段对齐的八任务评估体系、引入准确率-效率-成本-过程质量四维评估框架、以及提出经验驱动的 SwarmExp 增强方法,系统性地证明了:当前 LLM 在 Agent Swarm 编排上存在显著的能力不均衡,聚合是最薄弱环节,编排结构的有效性而非成本或并行度决定系统性能,且编排经验可以作为可迁移知识资产被提取和复用。该方法为构建可评估、可诊断、可增强的动态多智能体编排系统提供了从基准设计到工程实践的完整路径。