技术栈
混合精度
thesky123456
4 天前
大模型
·
amp
·
混合精度
·
fp8
·
bf16
·
数值精度
·
梯度缩放
27届大模型面试准备(六十二):大模型数值精度与混合精度工程——BF16/FP8、AMP、Loss Scale 与精度对齐
接(五十)训练稳定性里提到的 BF16 与 loss spike、(十九)量化。本文把"精度"作为工程主线串起来:训练为什么用 BF16、推理为什么上 FP8、混合精度怎么写才不炸、精度对齐怎么验。这是多模态大模型训练 / 推理岗绕不开的基础题,也是面试官判断你"踩过坑"还是"只会调 API"的分水岭。
thesky123456
9 天前
大模型
·
nan
·
混合精度
·
训练稳定性
·
容错训练
·
loss spike
·
bf16
27届大模型面试准备(五十):大模型训练稳定性与容错工程——从 loss spike 到弹性训练
前面几十篇把模型结构、后训练(A16)、分布式训练(A17)、量化(A19)、推理优化(A25/A30)讲透了。但有一个工程现实常被论文忽略:大模型训练动辄上千卡、跑几周,过程中一定会出事——loss 突然尖刺(loss spike)、数值溢出变 NaN、某个节点掉线、数据里混了脏样本。能不能把训练"稳稳跑完",是大规模预训练岗的底线能力,比"架构多新"更被雇主看重。
阿钱真强道
2 个月前
余弦相似度
·
混合精度
·
长尾分布
·
检测头
·
int8量化
08 YOLOv8检测头对INT8敏感的深度拆解——从直觉到数学证明
一句话总结:检测头对INT8敏感的真实原因不是方差小,而是长尾分布(90%背景小值+10%目标大值)。σ=0.05的纯高斯分布下INT8也能保持0.9999的余弦相似度,但长尾分布下小值区域的相对误差高达4.1%(Backbone仅1.05%)。量化不怕整体缩小,怕的是有的地方缩得多、有的地方缩得少。
nju_spy
10 个月前
人工智能
·
lora
·
大模型
·
混合精度
·
混合专家模型 moe
·
densemlp
·
门控机制
南京大学LLM开发基础(四)MoE, LoRA, 数的精度 + MLP层实验
https://njudeepengine.github.io/llm-course-lecture/2025/lecture8.html#1
九章云极AladdinEdu
10 个月前
人工智能
·
tensor core
·
tpu
·
混合精度
·
矩阵计算单元
·
wmma编程
·
脉动阵列
AI芯片微架构对比:从NVIDIA Tensor Core到Google TPU的矩阵计算单元
人工智能计算的爆发式增长正在重塑现代计算架构的设计理念。在传统的CPU和GPU之外,专门为矩阵计算优化的AI加速器已成为推动深度学习发展的关键力量。在这场技术变革中,NVIDIA的Tensor Core和Google的TPU代表了两种截然不同但同样成功的设计哲学:前者追求在通用计算框架下的专用优化,后者则专注于数据中心推理和训练工作负载的极致效率。
九章云极AladdinEdu
10 个月前
人工智能
·
大模型训练
·
zero
·
显存优化
·
offload
·
激活重计算
·
混合精度
大模型训练显存优化全方案:ZeRO、Offload与重计算技术对比
当大语言模型的参数量从亿级迈向万亿级,我们面临的不再仅仅是算力瓶颈,更是显存墙的严峻挑战。训练一个1750亿参数的模型,仅存储FP32格式的参数、梯度和优化器状态就需要超过2TB的显存,这远远超过了当前最强单卡GPU的容量。如何在有限的硬件条件下突破显存限制,让普通研究机构和开发者也能参与大模型训练,成为了AI领域亟待解决的核心问题。
我是有底线的