张量并行

Albart57514 天前
大模型·vllm·张量并行·分布式推理·多卡部署·显存oom
多卡张量并行显存分配不均终极解决:单卡跑满、其余显卡闲置彻底根治📌 置顶导语:做过大模型多卡分布式部署的开发者,几乎都遇到过张量并行(TP)负载倾斜问题:开启多卡TP推理/训练后,GPU0显存、算力直接拉满100%,其余显卡长期低负载闲置,多卡并行不仅无法提速,反而出现吞吐下降、延迟升高、随机OOM等问题。本文深度拆解TP显存分配不均的底层核心原理,梳理全套可直接复制落地的排查命令、主流框架优化方案、实战避坑指南,一站式根治多卡负载倾斜问题,完美适配vLLM、DeepSpeed、Transformers、Accelerate等主流大模型部署框架,可直接落地生产环境。
三点水-here7 个月前
分布式·rdma·nccl·moe·流水线并行·张量并行·专家并行
04 - 分布式大模型推理实战:TP/PP/EP并行策略深度解析本文是《大模型推理框架深度解析》系列的第四篇,详解张量并行、流水线并行与专家并行的原理与配置。当你的模型从7B扩展到70B、405B,单卡显存已经无法满足需求时,分布式推理成为必然选择。但面对TP、PP、EP等各种并行策略,很多开发者感到困惑:
Bestaier2 年前
大模型·训练·数据并行·模型并行·megatron-lm·流水线并行·张量并行
跟代码执行流程,读Megatron源码(四)megatron初始化脚本initialize.py之initialize_megatron()分布式环境初始化在前文中,我们讲述了pretrain函数的执行流程,其首要步骤是megatron分组的初始化与环境的配置。本文将深入initialize_megatron函数源码,剖析其初始化分布式训练环境的内部机制。
Bestaier2 年前
数据并行·模型并行·megatron-lm·流水线并行·张量并行
跟代码执行流程,读Megatron源码(二)训练入口pretrain_gpt.pyMegatron-LM默认支持GPT、T5、BERT等多个常见模型的预训练,当下大模型流行,故以pretrain_gpt.py为例做源码的走读。
我是有底线的