MoE的痛点:离散路由

MoE 模型的核心痛点,硬 Top-K 选择操作不可微分,无法反向传播梯度

路由层计算每个专家的原始得分 h(x)=W_r ✖️ x,再选出得分最高的 K 个专家,但存在三大缺陷:

  • 被选中的专家仅能通过门控权重(选中专家内做 softmax)接收梯度
  • "选哪 K 个专家" 这个离散决策本身梯度为 0
  • 训练死锁风险:某个专家长期没被选中 → 永远接收不到梯度更新 → 永远不会被选中(专家坍缩)

    W_r 专家的打分权重

第一句 - 已被选择专家通过 gate weight(门控权重) (softmax 作用在已选择上面)更新梯度

梯度链式拆解,损失 L 对 W_r 的梯度链式法则(分两部分看,一部分是选中专家h1和h2,另一部分是未选中专家h3和h4):

第二句 - 选择决策本身(选哪k个专家)梯度恒为0

第三句 - 专家恶性循环

相关推荐
dadaobusi3 小时前
学习:RV lkvm SBI
java·学习·spring
传奇开心果编程4 小时前
【Xilem 0.4 基础语法学与练】第一课:从零到计数器
学习·rust·前端框架
David猪大卫5 小时前
【C++修炼】智能指针使用及原理
开发语言·c++·经验分享·笔记·学习·考研·面试
z23456d5 小时前
第四十一天学习心得
学习
sunflower#6 小时前
Go学习第五阶段:接口、泛型与包设计,实现可替换的通讯录存储层
学习·oracle·golang
dadaobusi6 小时前
RV设备透传:主线尚未支持
学习
xqqxqxxq7 小时前
AI Agent学习:主动工具发现(李博杰《深入理解 AI Agent》4.8观后总结)
人工智能·学习
爱吃苹果的日记本8 小时前
数据结构第一课
c语言·数据结构·数据库·学习·c#
孫治AllenSun8 小时前
【LangChain4J-09】开发学习知识点
spring boot·后端·学习
边境悍匪9 小时前
蜗牛学苑 Java 智能体学习 Day38|Spring AI Alibaba2 思维导图复盘
java·学习·spring