Pytorch分布式train——pytorch.distributed.launch V.S. torchrun

1. 较早的pytorch.distributed.launch

python -m torch.distributed.launch --nproc_per_node=4 --nnodes=1 --node_rank=0 train.py --args XXX

参数解析:

nnodes:节点(主机)的数量,通常一个节点对应一个主机

node_rank:指的是当前启动的是第几台服务器,从 0 开始。

nproc_per_node:一个节点中显卡的数量

-master_addr:master节点的ip地址,也就是0号主机的IP地址,该参数是为了让 其他节点 知道0号节点的位,来将自己训练的参数传送过去处理

-master_port:master节点的port号,在不同的节点上master_addr和master_port的设置是一样的,用来进行通信

原文链接:http://t.csdnimg.cn/bDRj0

相关推荐
hixiong12343 分钟前
C# 编写一个XmlToDota的转换工具
开发语言·人工智能·yolo·c#
ManageEngineITSM1 小时前
云原生环境下的ITSM新趋势:从传统运维到智能化服务管理
大数据·运维·人工智能·云原生·itsm·工单系统
aneasystone本尊2 小时前
可视化探索 GraphRAG 的知识图谱
人工智能
嘀咕博客2 小时前
Krea Video:Krea AI推出的AI视频生成工具
人工智能·音视频·ai工具
As33100102 小时前
Manus AI 与多语言手写识别技术全解析
大数据·网络·人工智能
小璐乱撞2 小时前
超越传统 RAG:GraphRAG 全流程解析与实战指南
人工智能·后端
慧星云2 小时前
魔多 AI 上线提现功能 :将你的收益安稳入袋!
人工智能·云计算·aigc
gloomyfish2 小时前
【零代码】OpenCV C# 快速开发框架演示
人工智能·opencv·c#
视觉语言导航2 小时前
上科大解锁城市建模新视角!AerialGo:从航拍视角到地面漫步的3D城市重建
人工智能·3d·具身智能
DevUI团队2 小时前
MateChat V1.7.0版本发布,前端智能化项目贡献者已经达到90+,智能化卡片特性持续演进,快来体验吧~
前端·vue.js·人工智能