分布式训练DP与DDP

动画理解Pytorch 大模型分布式训练技术 DP,DDP,DeepSpeed ZeRO技术_哔哩哔哩_bilibili

单卡运行流程

DP(data parallel)

从硬盘读取数据,然后一个cpu进程将数据分成多份,给每个GPU训练,然后计算出梯度 进行网络更新(无效更新),然后再将各个GPU算出来的梯度,返回到gpu0进行梯度平均,再更新网络0,网络0再把更新后的网络参数广播到其他网络上。

DP存在的问题: 单进程,多线程,Python GIL只能利用一个CPU核。

GPU0负责手机梯度,更新参数,同步参数,通信,计算压力大。(即卡间负载极不平衡)

DDP: 让每个GPU都能进行接收处理以及通讯。

图中scatter的意思是,通过分发,让不同的节点有不同的值,reduce 的意思是 收集所有节点的值,并进行计算。

allgather 的意思是,把更新后的值,同步到 各个GPU,最后完成更新。充分利用各个GPU上下行的带宽。

计算参数梯度的个数满一个'桶'的时候,就开始流水并行化更新同步。

(他会预先分配好,哪些参数该谁更新,这样就避免了一个参数连圈转的发送和接收(相当于原来是A给B给C给D,现在是,A,B,C直接给D了)

相关推荐
土星云SaturnCloud几秒前
边缘计算赋能电子焊接工位双摄AI管控:土星云SE110S-WC8实现合规检测与质量追溯全闭环
服务器·人工智能·ai·边缘计算
月光船幽幽13 分钟前
分层阈值规避归藏协议过度重置
人工智能·python
世冠科技14 分钟前
世冠科技CEO张桥:从“一句话完成产品研发”到工程智能,AI 原生如何重构复杂装备研发(上篇)
人工智能·科技·重构
行业研究员16 分钟前
TDSQL-C:云原生架构与AI能力解析
人工智能·云原生·架构·云原生数据库·ai能力解析
Wang's Blog18 分钟前
AI Agent白手起家63: LangGraph 人机交互——让人类介入 AI 工作流
人工智能·算法·人机交互
_codemonster27 分钟前
Transformer的核心机制
人工智能·深度学习·transformer
Python私教32 分钟前
0、null、未采集:AI Agent 反馈系统最容易踩的语义坑
人工智能·python
xushichang123_33 分钟前
训练和微调生成式 AI 模型,应该选择哪些云上高性能存储服务?亚马逊云科技四类方案选型
人工智能
政安晨34 分钟前
政安晨【超级AI智能体~技术简报】- 向量退潮,图谱登场:Agent 基础设施的换代信号 [2026.8]
人工智能
乐观勇敢坚强的老彭42 分钟前
C++ STL 常用容器的速查表
java·c++·算法