技术栈
loss spike
thesky123456
3 小时前
大模型
·
nan
·
混合精度
·
训练稳定性
·
容错训练
·
loss spike
·
bf16
27届大模型面试准备(五十):大模型训练稳定性与容错工程——从 loss spike 到弹性训练
前面几十篇把模型结构、后训练(A16)、分布式训练(A17)、量化(A19)、推理优化(A25/A30)讲透了。但有一个工程现实常被论文忽略:大模型训练动辄上千卡、跑几周,过程中一定会出事——loss 突然尖刺(loss spike)、数值溢出变 NaN、某个节点掉线、数据里混了脏样本。能不能把训练"稳稳跑完",是大规模预训练岗的底线能力,比"架构多新"更被雇主看重。
我是有底线的