MoE的痛点:离散路由

MoE 模型的核心痛点,硬 Top-K 选择操作不可微分,无法反向传播梯度

路由层计算每个专家的原始得分 h(x)=W_r ✖️ x,再选出得分最高的 K 个专家,但存在三大缺陷:

  • 被选中的专家仅能通过门控权重(选中专家内做 softmax)接收梯度
  • "选哪 K 个专家" 这个离散决策本身梯度为 0
  • 训练死锁风险:某个专家长期没被选中 → 永远接收不到梯度更新 → 永远不会被选中(专家坍缩)

    W_r 专家的打分权重

第一句 - 已被选择专家通过 gate weight(门控权重) (softmax 作用在已选择上面)更新梯度

梯度链式拆解,损失 L 对 W_r 的梯度链式法则(分两部分看,一部分是选中专家h1和h2,另一部分是未选中专家h3和h4):

第二句 - 选择决策本身(选哪k个专家)梯度恒为0

第三句 - 专家恶性循环

相关推荐
MartinYeung59 小时前
[论文学习]δ-STEAL:基于本地差分隐私的大语言模型窃取攻击
网络·学习·语言模型
paopaokaka_luck9 小时前
基于springboot3+vue3的文山民族文化资源展示与推广平台(协同过滤算法、Echarts 图形化分析)
java·前端·spring boot·学习·echarts
wuhuhuan11 小时前
【JMeter 学习打卡 Day 4】多用户登录 + 动态 token 关联
学习·jmeter
Code额12 小时前
Python asyncio 异步编程全套学习文档(零基础完整版)
python·学习·oracle·async·异步·asyncio
在线考试系统推荐12 小时前
2026年7月最新实测:三大考试软件导入试题能力对比
人工智能·学习·系统架构
小弥儿12 小时前
GitHub今日热榜 | 2026-08-20:Agent 上下文数据库接棒
数据库·学习·开源·github
sunoo-22913 小时前
【C 语言标准 IO 入门】第二天学习笔记:文件操作核心函数 + 实战案例 + 踩坑合集
linux·笔记·vscode·学习
MartinYeung513 小时前
[论文学习]MPMA:针对模型上下文协议的偏好操纵攻击
人工智能·学习·安全
我爱cope14 小时前
【计算机网络 | 数据链路层8:CSMA/CD 与 CSMA/CA:有线以太网和 Wi-Fi 如何避免冲突?】
网络·学习·计算机网络
-To be number.wan14 小时前
我的创作纪念日
学习