深度学习单机多卡/多机多卡训练

一、概念的区分

分布式:是指多台机器的多块GPU,也就是多机多卡。

并行:指的一台机器上的多个GPU。也就是单机多卡。

同步更新:是指所有的GPU都计算完梯度之后,累加到一起求均值进行参数更新,再进行下一轮。

rank表示全局进程序号,local_rank表示本机子的进程序号。world_size表示全局进程个数。

举个例子,三台机器,每台机器四张卡全部用上,那么有group=1,world size=12

机器一:node=0 rank=0,1,2,3 local_rank=0,1,2,3 这里的node=0,rank=0的就是master

机器二:node=1 rank=4,5,6,7 local_rank=0,1,2,3

机器三:node=2 rank=8,9,10,11 local_rank=0,1,2,3

二、DP和DDP(pytorch内的)

DP(DataParallel)模式主要支持单机多卡。其中有一个进程,多个线程(受全局解释器锁限制),local_rank0为master节点,相当于参数服务器,向其他GPU广播参数,在反向传播后,各卡将梯度集中到master节点,求平均更新参数,再将参数发送到其他卡上。训练时需要指定GPUS和master节点。

DDP(DistributedDataParallel)支持分布式多机多卡训练,也支持单机多卡训练。相对于DP其有多个进程进行并行训练,没有全局解释器锁的限制。同时模型广播只在初始化时广播一次,而不用像DP那样,每次前向传播前都要广播。因为DDP每个进程都有自己独立的优化器,执行自己的更新过程,而梯度通过通信传递到每个进程,所以执行的内容是相同的。

DDP与DP的另一个不同就是我们需要用DistributedSample来对我的dataset进行处理,这样每个进程都只会调用一部分的数据集。不同的进程间就不会发生数据的交互。不然如果使用默认的DP的数据分配方式,就会出现多机通信的一个问题,很耗时。DP是把batch_size个数据切分到不同的卡上。比如batch_size30,两个GPU,那么每个GPU实际的bs为15.而DDP的话,batch_size为30,表示的是每个卡都是30的batch_size.

三、SyncBN

标准的BN因为使用数据并行(DP),所以只对单卡上的样本进行归一化,这样batch_size就很小,影响模型收敛。而syncbn则是在前向传播时求全局数据的一个均值和方差(多机多卡,单机多卡),然后通过消息传给每个卡,进行归一化操作。这样就可以防止batch_size太小,导致BN失效的问题。这里提一嘴,一般GPU之间的通信,我们都默认采用的NCCL通信框架。

相关推荐
2301_7990730212 分钟前
基于 Next.js + 火山引擎 AI 的电商素材智能生成工具实战——字节跳动前端训练营成果
javascript·人工智能·火山引擎
xingyuzhisuan1 小时前
租用GPU服务器进行深度学习课程教学的实验环境搭建
运维·人工智能·深度学习·gpu算力
yu85939581 小时前
神经网络遗传算法函数极值寻优(非线性函数极值)
人工智能·深度学习·神经网络
乔江seven1 小时前
【李沐 | 动手学深度学习】12 使用块的网络VGG
人工智能·深度学习·卷积神经网络·vgg网络
haina20191 小时前
《品牌观察》专访海纳AI:引领AI面试测评新时代
人工智能·面试·职场和发展
云烟成雨TD2 小时前
Spring AI Alibaba 1.x 系列【22】Agent 并行工具执行与超时 / 协作式取消实战
java·人工智能·spring
阿里云大数据AI技术2 小时前
让 AI 帮你写大数据AI开发代码:MaxFrame Coding Skill 正式发布
人工智能·agent
麦哲思科技任甲林2 小时前
大懒人AI结对工作模式——驾驭AI编程的进阶指南
人工智能·ai编程·结对编程·工作模式·ai赋能
Raink老师2 小时前
【AI面试临阵磨枪】什么是 MCP(Model Control Protocol)、A2A(Agent-to-Agent)协议?
人工智能·面试·职场和发展·ai 面试