Python环境PyTorch分布式训练初始化失败_检查MASTER_ADDR与端口

PyTorch分布式训练常见错误包括端口被占、MASTER_ADDR配置错误、init_process_group超时及torchrun环境变量冲突;需检查端口占用、使用真实IP、确保WORLD_SIZE与RANK一致、避免手动设置torchrun管理的环境变量。PyTorch分布式训练报错 RuntimeError: Address already in use端口被占是初始化失败最常见原因,不是代码写错了,而是本地已有进程(比如上一次没杀干净的 python 或 torch.distributed 进程)绑定了 MASTER_PORT。实操建议:立即学习"Python免费学习笔记(深入)";先用 lsof -i :<code>MASTER_PORT(macOS/Linux)或 netstat -ano | findstr :<code>MASTER_PORT(Windows)查占用进程确认无用后直接 kill:kill -9 <code>PID(Linux/macOS)或 taskkill /F /PID <code>PID(Windows)更稳妥的做法:每次启动前换一个随机端口,比如用 export MASTER_PORT=((10000 + RANDOM % 1000))别用默认的 29500 ------ 它太常见,CI/本地多任务并行时极易冲突MASTER_ADDR 设成本机 localhost 却在多机训练中失败单机多卡能跑不代表多机通,localhost 在每台机器上都指向自己,跨机器根本连不上。实操建议:立即学习"Python免费学习笔记(深入)";必须设为可被所有节点访问的真实 IP,比如主节点网卡地址(非 127.0.0.1、非 localhost、非 Docker 内网 IP)运行前先手动 ping 测试:ping <code>MASTER_ADDR 从所有 worker 节点执行,不通就别往下试如果走 SSH 登录训练,注意云服务器安全组是否放行了 MASTER_PORT 端口(TCP)Docker 场景下,避免用 --network=host 外还设 localhost ------ 容器内 localhost 不等于宿主机网络命名空间init_process_group 调用超时卡死,日志停在 initializing process group这不是程序卡住,是等待其他 rank 连接超时。PyTorch 默认等 300 秒,期间只要有一个 rank 没 join,全部挂起。 稿定AI 拥有线稿上色优化、图片重绘、人物姿势检测、涂鸦完善等功能

相关推荐
聪明蛋子哟11 分钟前
Stagehand v3多语言SDK:Python/Go/Rust/Java下的浏览器自动化统一方案
python·golang·rust
今天AI了吗1 小时前
Python 基础语法(一):常量、变量、输入输出与运算符
开发语言·数据库·人工智能·python·sql·深度学习·机器学习
卷无止境1 小时前
Windows 上丝滑开发 Python,并稳定构建 Docker 镜像
后端·python·docker
TELL5211 小时前
selenium webdriver 第二次初始化的异常
开发语言·python
Csvn2 小时前
🐍 Day 4: Python 控制流 — 条件、循环与推导式的艺术
后端·python
lilian2332 小时前
Harmony os 技术实战|拼豆制图27:用单字符编码承载 50 张 70×70 图纸
前端·数据库·华为·harmonyos
皮卡丘不断更2 小时前
手机优先的 Personal Ledger:把账目、学习和复盘放到同一个入口
数据库·sqlite·fastapi·开源项目·个人效率
保卫大狮兄3 小时前
设备管理从台账到报废,完整生命周期一次讲清
数据库·设备管理·设备
数据安全技术观察4 小时前
数据动态脱敏:让脱敏策略跟着数据目录走
大数据·网络·数据库
大鹏说大话4 小时前
从爬虫到决策引擎:大数据下自媒体如何用Python挖掘用户痛点
开发语言·爬虫·python