技术栈

专家并行

thesky123456
2 小时前
大模型·负载均衡·moe·deepseek·混合专家·专家并行·稀疏激活
27届大模型面试准备(二十一):MoE 架构全攻略——稀疏激活、路由、负载均衡与专家并行上一篇《评测体系全攻略》收尾时说过,A 系列前二十篇走完了"架构—训练—对齐—推理—量化—评测"的完整链路,接下来转向更前沿的主题。这一篇是第二十一篇,讲混合专家(Mixture of Experts,MoE)。为什么先讲它?因为 2024 年之后所有你叫得出名字的开源旗舰模型——Mixtral、DeepSeek-V2/V3、Qwen2-MoE、Llama 4、Kimi K2——全部是 MoE 架构。面试里问"你了解 MoE 吗",大部分人能答出"稀疏激活、只激活部分专家",然后就没了。而真正的区分度在后
三点水-here
6 个月前
分布式·rdma·nccl·moe·流水线并行·张量并行·专家并行
04 - 分布式大模型推理实战:TP/PP/EP并行策略深度解析本文是《大模型推理框架深度解析》系列的第四篇,详解张量并行、流水线并行与专家并行的原理与配置。当你的模型从7B扩展到70B、405B,单卡显存已经无法满足需求时,分布式推理成为必然选择。但面对TP、PP、EP等各种并行策略,很多开发者感到困惑:
我是有底线的