MoE的痛点:离散路由

MoE 模型的核心痛点,硬 Top-K 选择操作不可微分,无法反向传播梯度

路由层计算每个专家的原始得分 h(x)=W_r ✖️ x,再选出得分最高的 K 个专家,但存在三大缺陷:

  • 被选中的专家仅能通过门控权重(选中专家内做 softmax)接收梯度
  • "选哪 K 个专家" 这个离散决策本身梯度为 0
  • 训练死锁风险:某个专家长期没被选中 → 永远接收不到梯度更新 → 永远不会被选中(专家坍缩)

    W_r 专家的打分权重

第一句 - 已被选择专家通过 gate weight(门控权重) (softmax 作用在已选择上面)更新梯度

梯度链式拆解,损失 L 对 W_r 的梯度链式法则(分两部分看,一部分是选中专家h1和h2,另一部分是未选中专家h3和h4):

第二句 - 选择决策本身(选哪k个专家)梯度恒为0

第三句 - 专家恶性循环

相关推荐
艾莉丝努力练剑16 分钟前
【AI大模型接入SDK】ChatSDK 集成测试概述
jvm·c++·人工智能·学习·面试·集成测试·sdk
艾莉丝努力练剑22 分钟前
【AI大模型接入SDK】ChatSDK:CMake构建静态库完整实现
java·开发语言·网络·c++·人工智能·学习·sdk
Joe_Wang525 分钟前
【从0到1学习JVM · 14】堆内存各区域分工与Xms和Xmx设为一样的真相
java·jvm·学习·垃圾回收
東隅已逝,桑榆非晚31 分钟前
stack和queue(类函数学习和模拟实现)
c++·笔记·学习
Vcaker41 分钟前
Linux学习37-rook-ceph部署
linux·运维·学习
阳光九叶草LXGZXJ1 小时前
Linux-学习-12-JDK安装
java·linux·运维·学习
tiankongdeyige9 小时前
游戏战斗系统学习第2篇:有限状态机 (FSM)
学习·游戏·typescript
an123212112 小时前
ARM嵌入式学习笔记:SPI通信协议详解
arm开发·笔记·学习
by2099912 小时前
从结构体到对象:正式学习C++类的骨架、封装与this指针
c++·经验分享·学习
乌暮13 小时前
深入理解 Java 泛型:把「万能盒子」用对、用稳
java·开发语言·后端·学习