混合专家

thesky1234568 天前
大模型·负载均衡·moe·deepseek·混合专家·专家并行·稀疏激活
27届大模型面试准备(二十一):MoE 架构全攻略——稀疏激活、路由、负载均衡与专家并行上一篇《评测体系全攻略》收尾时说过,A 系列前二十篇走完了"架构—训练—对齐—推理—量化—评测"的完整链路,接下来转向更前沿的主题。这一篇是第二十一篇,讲混合专家(Mixture of Experts,MoE)。为什么先讲它?因为 2024 年之后所有你叫得出名字的开源旗舰模型——Mixtral、DeepSeek-V2/V3、Qwen2-MoE、Llama 4、Kimi K2——全部是 MoE 架构。面试里问"你了解 MoE 吗",大部分人能答出"稀疏激活、只激活部分专家",然后就没了。而真正的区分度在后
Phoenixtree_DongZhao1 年前
人工智能·强化学习·混合专家
《Nature》封面:DeepSeek-R1通过强化学习激发大语言模型的推理能力https://www.nature.com/articles/s41586-025-09422-z.pdf
kngines1 年前
人工智能·transformer·n-gram·提示工程·moe·大预言模型·混合专家
从零构建大语言模型全栈开发指南:第一部分:数学与理论基础-1.1.1语言模型演进:从N-gram到Transformer👉 点击关注不迷路 👉 点击关注不迷路 👉 点击关注不迷路语言模型(Language Model)作为自然语言处理(NLP)领域的核心基础,其发展历程深刻影响着人工智能技术的演进。本章将系统解析语言模型从统计学习到深度学习的关键跃迁,并聚焦GPT系列模型的技术突破。
我是有底线的