技术栈
bf16
thesky123456
16 天前
大模型
·
amp
·
混合精度
·
fp8
·
bf16
·
数值精度
·
梯度缩放
27届大模型面试准备(六十二):大模型数值精度与混合精度工程——BF16/FP8、AMP、Loss Scale 与精度对齐
接(五十)训练稳定性里提到的 BF16 与 loss spike、(十九)量化。本文把"精度"作为工程主线串起来:训练为什么用 BF16、推理为什么上 FP8、混合精度怎么写才不炸、精度对齐怎么验。这是多模态大模型训练 / 推理岗绕不开的基础题,也是面试官判断你"踩过坑"还是"只会调 API"的分水岭。
thesky123456
21 天前
大模型
·
nan
·
混合精度
·
训练稳定性
·
容错训练
·
loss spike
·
bf16
27届大模型面试准备(五十):大模型训练稳定性与容错工程——从 loss spike 到弹性训练
前面几十篇把模型结构、后训练(A16)、分布式训练(A17)、量化(A19)、推理优化(A25/A30)讲透了。但有一个工程现实常被论文忽略:大模型训练动辄上千卡、跑几周,过程中一定会出事——loss 突然尖刺(loss spike)、数值溢出变 NaN、某个节点掉线、数据里混了脏样本。能不能把训练"稳稳跑完",是大规模预训练岗的底线能力,比"架构多新"更被雇主看重。
我是有底线的