TensorRT-LLM中的MoE并行推理

2种并行方式:

moe_tp_size:按照维度切分,每个GPU拥有所有Expert的一部分权重。

moe_ep_size: 按照Expert切分,每个GPU有用一部分Expert的所有权重。

二者可以搭配一起使用。

限制:二者的乘积,必须等于模型并行(不是指moe_tp_size,而是整个模型的tp_size)的卡数。

相关推荐
Smoothcloud润云2 天前
GPU租赁数据安全怎么做?
人工智能·算法·ai·aigc·gpu算力·gpu
对象存储与RustFS2 天前
别再只怪 GPU 了:2026 年 AI 训练/推理的存储瓶颈,以及 7 个被忽视的真相
开源·ai编程·gpu
Eloudy4 天前
国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image
docker·gpu·rdma
这是谁的博客?8 天前
【中阶·融合】如何隔离多租户 AI 推理平台的 GPU 资源:从 Namespace 到 MIG/Kata 的五层纵深防御
人工智能·ai·云原生·kubernetes·gpu·多租户·ai安全
Eloudy8 天前
全文笔记 - GPU-Initiated Networking for NCCL
gpu·rdma
Eloudy9 天前
Holoscan Sensor Bridge 入门指南(Getting Started)
gpu·fpga·rdma
小孔龙9 天前
Android GPU 渲染管线:一帧画面如何走上屏幕
android·性能优化·gpu
吴佳浩12 天前
一文讲透AI算力单位:TFLOPS、PFLOPS、TOPS、稀疏算力,到底怎么算、怎么比?
人工智能·ai编程·gpu
VNDR12 天前
vLLM 在 RTX 4060 上的推理性能调优全记录
gpu