MoE的痛点:离散路由

MoE 模型的核心痛点,硬 Top-K 选择操作不可微分,无法反向传播梯度

路由层计算每个专家的原始得分 h(x)=W_r ✖️ x,再选出得分最高的 K 个专家,但存在三大缺陷:

  • 被选中的专家仅能通过门控权重(选中专家内做 softmax)接收梯度
  • "选哪 K 个专家" 这个离散决策本身梯度为 0
  • 训练死锁风险:某个专家长期没被选中 → 永远接收不到梯度更新 → 永远不会被选中(专家坍缩)

    W_r 专家的打分权重

第一句 - 已被选择专家通过 gate weight(门控权重) (softmax 作用在已选择上面)更新梯度

梯度链式拆解,损失 L 对 W_r 的梯度链式法则(分两部分看,一部分是选中专家h1和h2,另一部分是未选中专家h3和h4):

第二句 - 选择决策本身(选哪k个专家)梯度恒为0

第三句 - 专家恶性循环

相关推荐
0566461 小时前
Python康复训练——常用标准库
开发语言·python·学习
0566462 小时前
Python康复训练——控制流与函数
开发语言·python·学习
早睡早起身体好1234 小时前
为什么 Network 中会出现两个同名请求?——CORS 预检请求学习笔记
网络·笔记·学习·网络安全
菩提树下的打坐4 小时前
测试左移的更深一层:用 DDD 战术设计反推测试边界
学习
casual~5 小时前
模逆元计算方法详解:扩展欧几里得算法与费马小定理
学习·算法·逆元
@Mike@5 小时前
06-数据库学习笔记(存储模型与数据压缩)
数据库·笔记·学习
我的xiaodoujiao6 小时前
快速学习Python基础知识详细图文教程14--模块
开发语言·python·学习·测试工具
wdfk_prog6 小时前
嵌入式面试真题学习笔记系列
笔记·学习·面试
懿路向前6 小时前
【HarmonyOS学习笔记】2026-07-30 | 小艺开放平台智能体接入实战
笔记·学习·harmonyos
吃好睡好便好6 小时前
MATLAB中图像的线性变换
开发语言·图像处理·学习·计算机视觉·matlab