技术栈

bf16

thesky123456
3 小时前
大模型·nan·混合精度·训练稳定性·容错训练·loss spike·bf16
27届大模型面试准备(五十):大模型训练稳定性与容错工程——从 loss spike 到弹性训练前面几十篇把模型结构、后训练(A16)、分布式训练(A17)、量化(A19)、推理优化(A25/A30)讲透了。但有一个工程现实常被论文忽略:大模型训练动辄上千卡、跑几周,过程中一定会出事——loss 突然尖刺(loss spike)、数值溢出变 NaN、某个节点掉线、数据里混了脏样本。能不能把训练"稳稳跑完",是大规模预训练岗的底线能力,比"架构多新"更被雇主看重。
我是有底线的