技术栈

bug解决方案

向哆哆
3 天前
pytorch·深度学习·分布式训练·bug解决方案
【Bug已解决】DAPO loss is not normalized by gradient_accumulation_steps 解决方案用 DAPO(Dynamic Sampling Policy Optimization)训练时,我们观察到:调大 gradient_accumulation_steps 后,训练行为明显变激进,loss 数值也跟着变大,但训练效果反而变差。具体日志:
我是有底线的