技术栈
训练稳定性
thesky123456
3 小时前
大模型
·
nan
·
混合精度
·
训练稳定性
·
容错训练
·
loss spike
·
bf16
27届大模型面试准备(五十):大模型训练稳定性与容错工程——从 loss spike 到弹性训练
前面几十篇把模型结构、后训练(A16)、分布式训练(A17)、量化(A19)、推理优化(A25/A30)讲透了。但有一个工程现实常被论文忽略:大模型训练动辄上千卡、跑几周,过程中一定会出事——loss 突然尖刺(loss spike)、数值溢出变 NaN、某个节点掉线、数据里混了脏样本。能不能把训练"稳稳跑完",是大规模预训练岗的底线能力,比"架构多新"更被雇主看重。
m0_65010824
9 个月前
论文阅读
·
人工智能
·
olmo 2
·
全开源多模态大模型
·
全链路开放
·
训练稳定性
OLMo 2:全开放语言模型的技术突破与实践
OLMo 2 作为 Allen Institute for AI 推出的新一代全开放语言模型家族,以 7B、13B、32B 三种参数规模覆盖主流应用场景,通过全链路开放(模型权重、训练数据、代码配方、训练日志等)打破了开放模型与闭源模型的性能鸿沟。
我是有底线的