MOE(Mixture of Experts,混合专家) 和 MOA(Mixture of Agents,混合智能体) 是当前AI架构演进的两个核心方向,一个解决**"模型内部怎么算",一个解决"模型外部怎么协作"**。
一、MOE:模型内部的"分而治之"
核心原理
把一个大模型拆成多个专家子网络(Experts),每次推理只激活其中一小部分,其余"休眠"。
输入 → Router(路由层)→ 选出Top-K个专家 → 各专家并行计算 → 加权聚合 → 输出
关键技术参数
| 维度 | 说明 | 典型值 |
|---|---|---|
| 总参数 | 所有专家参数之和 | 1T~3T(DeepSeek-V4 1.6T,Kimi-K3 2.88T) |
| 激活参数 | 每次推理实际参与计算的参数 | 10B100B(约为总参数的1%5%) |
| 专家数 | 每层专家总数 | 8~2048个 |
| Top-K | 每次激活的专家数量 | 1~16个 |
| 路由策略 | 如何决定激活哪些专家 | 可学习门控(Gating)、Top-K选择、Soft MoE |
独创性演进(按厂商)
| 厂商 | MOE创新点 | 核心贡献 |
|---|---|---|
| DeepSeek | 细粒度专家分割 + 共享专家隔离 + 无辅助损失负载均衡 | 首次证明MoE可以在无性能损失的情况下去除辅助损失,训练成本降至550万美元 |
| Kimi | Stable LatentMoE + 双层稀疏(专家级+神经元级A8稀疏) | 2.88T总参数仅激活1040亿,稀疏度极致 |
| MiniMax | Lightning Attention + MoE融合,百万token长文本 | 线性注意力与MoE结合,长文本成本降至1/20 |
| Meta(Llama 4) | 交替密集层+MoE层,iRoPE架构 | 400B总参数/17B激活,单机8卡H100可运行 |
| Mistral | 开源MoE先驱(Mixtral 8x7B) | 打破"MoE是闭源大厂专利"的认知 |
MOE的优缺点
| 优势 | 劣势 |
|---|---|
| 推理成本低:仅激活少量参数,吞吐量高 | 通信开销大:专家分布在不同GPU,All-to-All通信成为瓶颈 |
| 容量大:总参数量可达万亿级,知识容量远超Dense模型 | 负载均衡难:容易出现"专家坍塌"(少数专家被过度使用) |
| 专业化:不同专家可习得不同领域知识 | 内存碎片化:需要同时加载所有专家到显存,峰值显存占用高 |
| 可扩展性好:增加专家数即可扩容,无需重训整个模型 | 调试困难:路由决策黑箱化,难以解释"为什么选这个专家" |
二、MOA:模型外部的"群策群力"
核心原理
不改造单个模型内部结构,而是将多个独立Agent(每个Agent可基于不同模型/不同配置)组成协作网络,通过层间聚合 或迭代优化提升输出质量。
输入 → Agent 1(生成初稿)→ Agent 2(批判修正)→ Agent 3(润色)→ ... → 聚合器 → 最终输出
两种典型架构
1. 层叠式MOA(Cascading MOA)
多个Agent像流水线一样串联,后一Agent基于前一Agent的输出做改进。
代表实现:Together AI提出的开源MOA框架(2024年)
- 第一层:多个"提议Agent"(Proposer)并行生成候选答案
- 第二层:"聚合Agent"(Aggregator)综合所有候选,选出最佳或融合
- 效果:在GPQA数据集上,MOA(GPT-3.5×4层)超越GPT-4o
2. 路由式MOA(Routed MOA)
中央Router根据任务类型,将请求分发给最擅长的专业Agent。
代表实现:智谱GLM-5的Agent Swarm、MiniMax的Multi-Agent系统
- 代码任务 → 代码Agent
- 数学任务 → 推理Agent
- 搜索任务 → 联网Agent
- 各Agent可并行执行,结果由主控Agent整合
MOA与MOE的关键区别
| 维度 | MOE | MOA |
|---|---|---|
| 层级 | 模型内部架构 | 模型外部系统架构 |
| 单元 | 专家子网络(无自主意识) | 独立Agent(可调用工具、联网、执行代码) |
| 通信 | GPU间的All-to-All张量通信 | Agent间的消息传递(文本/结构化数据) |
| 决策 | 可学习门控(自动) | 中央Router或协商机制(可自动也可人工编排) |
| 容错 | 低:一个专家故障影响模型输出 | 高:单个Agent故障可被其他Agent补偿 |
| 可解释性 | 差:路由黑箱 | 较好:每个Agent的输入输出可追溯 |
| 延迟 | 低(单次前向传播) | 高(多轮Agent交互) |
| 成本结构 | 训练成本高,推理成本低 | 训练成本低(复用现有模型),推理成本高(多模型调用) |
三、两者的关系:互补而非替代
┌─────────────────────────────────────────┐
│ 用户请求(Query) │
└─────────────────┬───────────────────────┘
▼
┌─────────────────────────────────────────┐
│ MOA层:任务分解 + Agent路由 │
│ "这个问题需要代码+搜索+推理三个Agent协作" │
└─────────────────┬───────────────────────┘
▼
┌─────────┴─────────┐
▼ ▼
┌─────────┐ ┌─────────┐
│ Agent 1 │ │ Agent 2 │
│(代码专家)│ │(搜索专家)│
└────┬────┘ └────┬────┘
│ │
▼ ▼
┌─────────────────────────────┐
│ 每个Agent内部可能使用MOE模型 │
│ DeepSeek-V4 / Kimi-K3 等 │
│ 万亿参数,仅激活百亿级计算 │
└─────────────────────────────┘
│ │
└────────┬─────────┘
▼
┌─────────────┐
│ 聚合Agent │
│ 整合各结果 │
└─────────────┘
总结:
- MOE 解决的是 "一个模型怎么在有限算力下拥有更多知识"
- MOA 解决的是 "多个模型怎么协作完成复杂任务"
四、行业趋势:两者正在融合
| 趋势 | 说明 |
|---|---|
| MOE模型作为MOA的Agent底座 | 每个Agent内部跑一个MOE模型(如DeepSeek-V4),Agent间通过MOA协议协作。MiniMax、智谱、阶跃星辰都在走这条路 |
| Agent级别的"专家路由" | 未来可能出现"Meta-MoE"------不仅模型内部有专家路由,系统层面也有Agent路由,形成双层稀疏 |
| MOA标准化 | Anthropic的MCP协议正在成为Agent间通信的标准,使不同厂商的Agent可以互操作 |
| 端侧MOE + 云端MOA | 端侧运行轻量MOE模型处理简单任务,复杂任务通过MOA调度到云端多Agent集群 |
五、启示
| 场景 | 建议架构 |
|---|---|
| 端侧推理 | 采用MOE(如DeepSeek-V4-Flash、阶跃星辰Step-3.5 Flash),利用稀疏激活降低单token推理成本 |
| 复杂任务编排(如自动焊接、多传感器融合) | 采用MOA,将感知Agent、规划Agent、执行Agent分层协作 |
| 端云协同 | 端侧MOE处理实时感知,云端MOA处理长程规划,通过MCP协议通信 |
核心判断:MOE和MOA不是二选一,而是**"内稀疏+外协作"**的必然组合。未来AI系统的竞争力,取决于你能在多大程度上同时驾驭这两层稀疏性。