TensorRT-LLM中的MoE并行推理

2种并行方式:

moe_tp_size:按照维度切分,每个GPU拥有所有Expert的一部分权重。

moe_ep_size: 按照Expert切分,每个GPU有用一部分Expert的所有权重。

二者可以搭配一起使用。

限制:二者的乘积,必须等于模型并行(不是指moe_tp_size,而是整个模型的tp_size)的卡数。

相关推荐
Eloudy7 小时前
基于 PTP 的 FPGA→RoCE→CPU 单向延迟测量实验方案
gpu·fpga
Eloudy12 小时前
gpunetio_verbs_write_lat 延迟测试使用了哪些 GPUNetIO 能力
gpu
Eloudy1 天前
全文 - DOCA GPUNetIO 闭源实现的 Doc
gpu
Eloudy1 天前
全文 - DOCA GPUNetIO Open Source 仓库 README
gpu
guwentian1 天前
WebGPU 和 WebTransport 2026 真的能上生产了吗?
web·gpu·transport
论文复现现场3 天前
课程作业要跑 PyTorch 训练,学校机房不够用去哪租?云 GPU 选型、环境迁移与防丢数据指南
人工智能·pytorch·深度学习·云计算·gpu·cuda
赋创小助手7 天前
多GPU服务器交付验收:GPU健康、P2P、NCCL与稳定性测试思路
运维·服务器·人工智能·ai·部署·gpu·p2p
Eloudy9 天前
全文 - 05 part - NVIDIA 集合通信库(NCCL)文档
gpu
探索云原生10 天前
Kueue + HAMi vGPU 实战:显存与算力配额管理
docker·ai·云原生·kubernetes·gpu
cubestudio10 天前
海光 DCU 怎么接入 Kubernetes 和 AI 平台?CubeStudio 海光 DCU 适配实操(整卡 / 共享 / 两种 vDCU 虚拟化 + DeepSeek 部署)
人工智能·机器学习·gpu