TensorRT-LLM中的MoE并行推理

2种并行方式:

moe_tp_size:按照维度切分,每个GPU拥有所有Expert的一部分权重。

moe_ep_size: 按照Expert切分,每个GPU有用一部分Expert的所有权重。

二者可以搭配一起使用。

限制:二者的乘积,必须等于模型并行(不是指moe_tp_size,而是整个模型的tp_size)的卡数。

相关推荐
Eloudy1 小时前
GXF 报告 - 构建依赖分析,NvSci 裁剪,公网裸机构建与测试
gpu
众人皆醒我独醉2 天前
InferenceGraph:把多个推理服务编排成 DAG
面试·kubernetes·gpu
众人皆醒我独醉2 天前
LLMService:KServe 面向 LLM 的下一步
面试·kubernetes·gpu
众人皆醒我独醉4 天前
模型加载:storage-initializer 与节点级缓存
面试·kubernetes·gpu
进哥AI研习社4 天前
WebGL 与视频背景——首屏视觉层的性能博弈
性能优化·webgl·gpu·canvas·shader·帧率·视频背景
众人皆醒我独醉5 天前
调和循环:kubectl apply 之后发生了什么
面试·llm·gpu
众人皆醒我独醉5 天前
从 Spec 到资源:Predictor/Transformer/Explainer 如何变成 Deployment
面试·llm·gpu
众人皆醒我独醉9 天前
源码导读:一张地图看懂 KServe 仓库
面试·云计算·gpu
众人皆醒我独醉10 天前
MLOps 流水线:从训练到推理的 CI/CD
面试·llm·gpu
Flynt11 天前
本地跑大模型到底选哪个?我用llmfit把32000星的项目实测了一遍
ai编程·gpu·ollama