Pytorch采坑记录:DDP 损失和精度比 DP 差,多卡GPU比单卡GPU效果差

结论:调大学习率或者调小多卡GPU的batch_size

转换DDP模型后模型的整体学习率和batch_size都要变。

当前配置::1GPU:学习率=0.1,batch_size=64

如果8GPU还按之前1GPU配置:8GPU:学习率=0.1,batch_size=64

那么此时对于8GPU而言,效果几乎等于::1GPU:学习率=0.1,batch_size=64 * 8=512

这种8GPU情况下,batch_size等效变大,效果就差了,参考Goyal et al

解决方法是调大学习率或者调小多卡GPU的batch_size

比如上面调大学习率改为 8GPU:学习率=0.1 * 8=0.8,batch_size=64学习率=0.1 * √8 =√8 ,batch_size=64

或者调小batch_size 8GPU:学习率=0.1,batch_size=8

参考:

  1. https://github.com/Lightning-AI/pytorch-lightning/discussions/3706
  2. https://arxiv.org/pdf/1706.02677.pdf
相关推荐
AI多Agent协作实战派1 分钟前
AI多Agent协作系统实战(三十九):AI修对了Bug,却越了权——自动化团队的第一条铁律
人工智能·自动化·bug
DS随心转小程序2 分钟前
AI 导出鸭重构转化链路,全面优化腾讯元宝输出 word 文档办公效率
人工智能·重构·aigc·word·豆包·deepseek·ai导出鸭
Oflycomm4 分钟前
IPC网络摄像机与安防监控:Wi-Fi 6模组、AOV低功耗与边缘AI的产业落地
网络·人工智能·安防监控·wifi6·ipc网络摄像机
小弥儿4 分钟前
GitHub今日热榜 | 2026-08-14:OSINT情报工具回流,本地AI赛道升温
人工智能·学习·开源·github
国雪5 分钟前
python-协程
python
朴实赋能6 分钟前
AI Agent + NFC + 同地标拼购:本地生活实体店的“数字获客“技术解法与MVP验证思路
人工智能·生活·ai agent·实体店获客·实体店数字化·ai 获客·nfc 获客
bullkingluo8 分钟前
我们给生产 RAG 补了 5 个 P0 安全洞,发现自进化闭环存在的漏洞
人工智能
高洁0112 分钟前
工信部教考中心证书
人工智能·深度学习·算法·机器学习·知识图谱
桃西西呀15 分钟前
Harbor 不是 RL 框架:评测 vs 训练,以及它能产出什么
人工智能
一木 之林15 分钟前
Python.六.(一)--1.标准库、常用工具与基础操作(进阶)
python·rpc·dubbo