技术栈
多卡分布式训练
薛定谔的猫1982
2 小时前
分布式
·
deepspeed
·
zero
·
多卡训练
·
多卡分布式训练
LLaMA-Factory +DeepSpeed 分布式多卡训练实战全解
随着大模型参数量从 7B、13B 攀升至几十 B、上百 B,传统 PyTorch DDP 数据并行存在致命缺陷:每张 GPU 都会完整复制一份模型、梯度、优化器参数,显存冗余极高,小显存显卡极易 OOM 显存溢出。微软开源的 DeepSpeed 凭借ZeRO 内存分片优化,将训练状态分散到多卡 GPU 甚至 CPU 内存,大幅降低单卡显存占用,让个人多卡服务器也能训练超大模型。
我是有底线的