大模型架构演进:从Transformer到MoE

大模型架构演进:从Transformer到MoE

一、 Transformer的辉煌与局限

二、 MoE:用"稀疏激活"撬动模型容量

三、 MoE为何成为大模型新范式?

四、 典型实践:从GLaM到Qwen-MoE

五、 挑战与未来方向

相关推荐
美狐美颜SDK开放平台9 小时前
视频美颜SDK是什么?直播APP开发中美颜功能实现方式介绍
深度学习·架构·实时互动·音视频·视频美颜sdk
柳絮飞祭奠11 小时前
Dify Windows Docker Desktop 部署文档
人工智能·深度学习·语言模型·数据分析·transformer·边缘计算·集成学习
咖啡星人k11 小时前
2026 AI Agent 长期记忆:为什么 AI 助手总“聊完就忘“?MonkeyCode 免费上手
人工智能·深度学习·机器学习·语言模型·自然语言处理
Rocky Ding*12 小时前
一文读懂Wan 3.0视频创作大模型核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·wan 3.0
richard_first12 小时前
Transformer 与大语言模型:第3章 输入是如何进入 Transformer 的
人工智能·深度学习·transformer
richard_first14 小时前
Transformer 与大语言模型:第6章 Self-Attention自注意
人工智能·深度学习·transformer
richard_first14 小时前
Transformer 与大语言模型:第2章 Transformer 总体架构
深度学习·架构·transformer
richard_first14 小时前
Transformer 与大语言模型:第10章 Residual (残差连接)
人工智能·深度学习·机器学习·transformer
十三画者15 小时前
【文献分享】abCRISPR:基于深度学习的脱碱基gRNA理性设计框架
人工智能·深度学习·数据挖掘·数据分析·数据可视化
大鹏的NLP博客15 小时前
WSL2 资源治理:从 ONNX Runtime CUDA 编译 OOM 到 `.wslconfig` 防御配置
c++·深度学习·onnx runtime