技术栈
bug解决方案
向哆哆
3 天前
pytorch
·
深度学习
·
分布式训练
·
bug解决方案
【Bug已解决】DAPO loss is not normalized by gradient_accumulation_steps 解决方案
用 DAPO(Dynamic Sampling Policy Optimization)训练时,我们观察到:调大 gradient_accumulation_steps 后,训练行为明显变激进,loss 数值也跟着变大,但训练效果反而变差。具体日志:
我是有底线的