论文阅读:Mixture-of-Agents Enhances Large Language Model Capabilities

一、简介

旨在利用多个 LLM 的专业知识增强自然语言理解和生成任务的能力。

提出了一种新方法,通过代理混合 (MoA) 方法利用多个 LLM 在不同专业方面的优势。即一个分层的 MoA 架构,其中每一层都包含多个 LLM 代理。每个代理都将上一层代理的所有输出作为生成其响应的辅助信息。MoAmodels 在 AlpacaEval 2.0、MT-Bench 和 FLASK 上实现了最先进的性能,超过了 GPT-4 Omni。

创新点

(1) 提出了一个 Mixture-of-Agents 框架,旨在利用多个 LLM 的优势,从而提高它们的推理和语言生成能力。

(2) 语言模型协作性的发现:即 LLM 之间的遗传协作性,其中模型在可以访问其他模型的输出时往往会产生更高质量的响应,即使这些输出的质量较低。

二、模型

为了从多个LLM中获得最佳结果,需要准确描述不同的模型在写作过程中的优点。可以将模型分为两个不同的角色

Proposer:生成有用的响应以供其他模型参考使用。作为proposer角色的模型不一定产生高分回答,但是必要条件是提供更多的上下文和观点,最终在被聚合器使用时有助于更好的最终回答。

Aggregator:将其他模型的响应合成到单一、高质量输出的模型。

聚合器获得的模型输出和prompt

三、实验

**benchmark:**主要评估 AlpacaEval 2.0上的模型,此外,还在 MT-Bench 上进行了评估

**model:**Qwen1.5-110B-Chat、Qwen1.572B-Chat、WizardLM-8x22B、LLaMA-3-70B-Instruct、Mixtral-8x22B-v0.1、dbrx-instruct。构建了 3 个 MoA 层,并在每个 MoA 层中使用相同的模型集。使用 Qwen1.5-110BChat 作为最后一层的聚合器。

另外开发了一个名为 MoA w/ GPT-4o 的变体,它通过使用 GPT-4o 作为最终 MoA 层中的聚合器,以优先考虑高质量输出。

另一个变体 MoA-Lite 强调成本效益。它使用与 proposer 相同的模型集,但仅包含 2 个 MoA 层,使用 Qwen1.5-72B-Chat 作为聚合器。

所有推理都通过 Together Inference Endpoint 运行。

相关推荐
阿里云大数据AI技术1 分钟前
Hologres 长记忆服务 LoCoMo 评测登顶世界第一,刷新多项 SOTA
人工智能
achong5 分钟前
PenguinHarness实测:LlamaFactory作者新作,0.2元造自进化Agent
人工智能·深度学习
AlloyTeamZy7 分钟前
我发现,一个人做小游戏最难的,根本不是写代码
前端·人工智能·程序员
Hotchip_MEMS10 分钟前
当雾化器遇上MEMS:一场从交互到制造的全链路效率提升
人工智能·笔记·物联网·电脑·制造
水如烟43 分钟前
孤能子视角:LLM是续指代投器——从“续指论”与“代投机制”看大语言模型的本质定位
人工智能
BerryS3N1 小时前
2026年AI前沿技术全景深度解析:大模型推理范式变革、Agentic AI工程架构与底层基础设施演进
人工智能·架构
天天爱吃肉82181 小时前
【重磅发布:拿下新超仁达代理权 】
大数据·人工智能·python·功能测试·汽车
HIT_Weston1 小时前
167、【Agent】【OpenCode】TuiThreadCmd(EvenSource)
人工智能·agent·opencode
TunerT_TQ1 小时前
Valhalla 静态工程审阅 #022|百度PaddlePaddle 源码证据驱动评测【大厂开源基础设施特辑】
人工智能·百度·开源·paddlepaddle·#深度学习·#飞桨
spter。1 小时前
AI 面试相同请求为什么会重复调用,如何解决
人工智能·面试·职场和发展