论文笔记:Autonomy-of-Experts Model

202501 arxiv

1 intro

  • MoE中常被忽视的一个关键问题是路由器的决策过程与专家执行之间的分离
    • 路由器无法直接评估专家的能力,因此它对专家的选择基本上是没有标签的预测
    • 如果路由器做出了错误的预测,选择的专家可能会试图处理这些令牌,但未能有效地处理,导致训练损失增加
      • 为减少损失,专家可能需要调整其参数以处理这些令牌,可能与原本的专业能力产生冲突
      • 另一种可能性是路由器必须通过试错来学会做出更好的决策,因为它没有意识到哪些专家更适合特定任务,这样会浪费大量的训练步骤。
  • ------>论文提出了一种新的MoE范式------专家自治(AoE)
    • 这一设计基于专家能够意识到其处理输入的能力,并且这种意识反映在其内部激活的规模上
    • AoE允许专家决定是否自主处理输入
  • 通过专家的自治,路由器的决策过程得以消除,从而降低了训练损失。
    • 预训练了拥有最多4百亿参数的AoE语言模型,并且在下游任务中优于传统的MoE模型,表现出更高的计算效率

2 方法

3 实验

3.1 一般设置

  • 训练了由12层组成的小型语言模型,每层包含12个注意力头。
  • 每层包含8个专家,选取Top-K = 2个专家
  • 为MOE设置dmodel=768,dffn=3072
  • AOE的dlow和dwide值是可变的
    • 为了确保AoE模型的总参数量与MoE模型相当,当调整dlow时

3.2 AOE下游表现 VS MOE下游表现

  • AoE配置在平均准确率方面超越了最佳表现的MoE配置
    • AoE在没有任何辅助损失的情况下,超越了传统的MoE模型
  • 调整dlow之后,性能变化不大
  • 性能的提升是否源自Wg矩阵的分解?
    • 通过比较配置3和配置2,检查了专家权重矩阵分解对性能的影响
    • ------>分解对性能的影响并不显著,这与LLM权重本身就是低秩的发现一致

3.3 不同专家选择策略的影响

3.4 负载均衡

AoE在负载平衡方面优于传统的MoE模型,无论是否使用负载均衡loss

相关推荐
m4Rk_3 小时前
【论文阅读】Agent 记忆机制(75):TiMem——用时间记忆树实现长期记忆的层级巩固
论文阅读·人工智能·学习·开源·github
m4Rk_1 天前
【论文阅读】Agent 记忆机制(74):CompassMem——从相似度检索走向事件图上的记忆导航
论文阅读·人工智能·学习·开源·github
Rocky Ding*1 天前
【三年面试五年模拟】阿里巴巴-千问技术部算法一面全解析
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
Rocky Ding*1 天前
【三年面试五年模拟】2026-09-10 百度多模态大模型一面:9道技术问答与2道手撕题详解
论文阅读·人工智能·深度学习·机器学习·百度·aigc·ai-native
m4Rk_2 天前
【论文阅读】Agent 记忆机制(73):MemGAS——让长期对话记忆按问题选择粒度并关联证据
论文阅读·人工智能·学习·开源·github
Rocky Ding*2 天前
【三年面试五年模拟】2026-09-16 字节跳动 Agent 秋招一面全解析:从 Harness、记忆与并发到算法题的系统化解析
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
西柚小萌新3 天前
【论文阅读】--Trust Before Fusion:QIMG‑7 与面向污染多模态 RAG 的源感知信任
论文阅读·人工智能
m4Rk_3 天前
【论文阅读】Agent 记忆机制(72):EMA——在写入前决定什么值得记住
论文阅读·人工智能·学习·开源·github
Rocky Ding*4 天前
一文读懂Hallo数字人核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·数字人·ai-native
m4Rk_4 天前
【论文阅读】Agent 记忆机制(67):MemPO——用记忆级信用分配训练 Agent 主动管理长程上下文
论文阅读·人工智能·学习·开源·github