技术栈

多卡训练

薛定谔的猫1982
20 天前
分布式·deepspeed·zero·多卡训练·多卡分布式训练
LLaMA-Factory +DeepSpeed 分布式多卡训练实战全解随着大模型参数量从 7B、13B 攀升至几十 B、上百 B,传统 PyTorch DDP 数据并行存在致命缺陷:每张 GPU 都会完整复制一份模型、梯度、优化器参数,显存冗余极高,小显存显卡极易 OOM 显存溢出。微软开源的 DeepSpeed 凭借ZeRO 内存分片优化,将训练状态分散到多卡 GPU 甚至 CPU 内存,大幅降低单卡显存占用,让个人多卡服务器也能训练超大模型。
yuanlulu
2 年前
lora·llm·transformer·分布式训练·大语言模型·huggingface·多卡训练
llamafactory使用8张昇腾910b算力卡lora微调训练qwen2-72b大模型我需要在昇腾服务器上对Qwen2-72B大模型进行lora微调,改变其自我认知。 我的环境下是8张910B1卡。显存约512GB。
我是有底线的