分布式训练

论文复现现场2 小时前
大数据·金融·大模型·分布式训练·模型微调·qlora·rtx4090
金融大模型微调需要几张 RTX 4090?QLoRA 配置、工期估算与断点续训金融领域微调 7B 大模型,可先用单卡 RTX 4090 验证 QLoRA,再根据吞吐和工期决定是否扩到四卡。训练多久取决于数据量、序列长度和优化步耗时,不能只凭卡数承诺“38 小时出结果”。
论文复现现场7 小时前
linux·服务器·php·分布式训练·rdma·nvlink·nccl
8卡 A100 服务器哪里租?NVLink、RDMA 与 NCCL 验收指南#租8卡 A100,应先确认8张完整 GPU 是否位于同一台服务器,再检查机内互联和实际通信性能。单机重点看 NVLink/NVSwitch;跨服务器训练再核对 RDMA 网络,不能用“8张卡”代替完整配置说明。
论文复现现场1 天前
人工智能·机器学习·ocr·分布式训练·qlora·rtx4090·qwen2.5-vl
Qwen-VL 票据 OCR 微调需要几张 4090?单卡 QLoRA、4 卡训练与 OOM 排查做 Qwen-VL 票据 OCR 微调,建议先用单张 4090 24GB 验证 7B 模型的 QLoRA 配置。4 卡主要用于提高吞吐,8 卡是否必要取决于模型规模和训练方式;普通 DDP 不会把多张卡的显存合成一块。
2601_962301011 个月前
深度学习·分布式训练·keras·tensorflow2.0·eagerexecution
深入探索 TensorFlow 2.0:Python 中的强大深度学习框架2.0是有着重大版本更新的, 其带来了诸多新功能以及改进, 这让深度学习模型的构建变得越发地易于达成且简易, 训练也就能够更加简便, 把部署的过程促使得会更加直观。 2.0中引入了Eager模式, 这是其中一项新特性, 还引入了Keras高级的API, 同时也存在即时执行, 它同样是新出的特性, 借助这些新特性, 大大提升了用户自身开展开发工作时的效率, 也让体验变得更好。本文会对其中2.0该库的主要具备的多方面功能, 展开详细的介绍, 并且会提供一些用来做示例的代码;如此这般借助这些代码, 就能帮辅助助
Aethir2 个月前
架构·分布式训练·infiniband·nccl·gpu集群·液冷散热
去中心化GPU云底层是怎么搭的——去中心化云算力全景·第二章:技术架构本文是《去中心化云算力全景》系列的第二章。系列共十章,每章独立成文。上一章(市场总览)覆盖了Neocloud的市场规模、定价结构和商业模式,本章深入技术底层,拆解GPU集群的三个核心技术层:互联网络、散热架构、GPU调度系统。
向哆哆3 个月前
pytorch·深度学习·分布式训练·bug解决方案
【Bug已解决】DAPO loss is not normalized by gradient_accumulation_steps 解决方案用 DAPO(Dynamic Sampling Policy Optimization)训练时,我们观察到:调大 gradient_accumulation_steps 后,训练行为明显变激进,loss 数值也跟着变大,但训练效果反而变差。具体日志:
AI模力圈4 个月前
分布式训练·源码解析·fsdp
FSDP 源码解析:初始化与显存分配作者:昇腾实战派 * silas作者:昇腾实战派 知识地图:https://blog.csdn.net/Lumos_Lovegood/article/details/161455142
这是谁的博客?4 个月前
分布式·ai·大模型·分布式训练·deepspeed·fsdp·zero
大模型分布式训练技术深度解析:从 ZeRO 到 3D 并行的全面指南本文深入剖析大模型分布式训练的核心技术体系,涵盖 ZeRO 内存优化三阶段原理、数据并行/张量并行/流水线并行的 3D 组合策略、DeepSpeed 与 FSDP 框架实现细节,以及 CPU/NVMe Offload 扩展技术。通过源码级分析揭示分布式训练的设计思想与通信优化机制,帮助开发者掌握训练百亿参数模型的关键技术。
这是谁的博客?4 个月前
人工智能·pytorch·深度学习·ai·分布式训练·autograd
PyTorch 深度学习框架核心机制解析:从动态图到编译优化的全面指南PyTorch 作为当今最流行的深度学习框架,其核心机制决定了 AI 开发的效率与性能。本文深入剖析 PyTorch 的关键技术:动态计算图与 Autograd 自动微分原理、torch.compile 编译优化架构、DDP/FSDP 分布式训练机制、CUDA 自定义算子开发。通过源码级分析与实践案例,帮助读者理解 PyTorch 内核运作方式,掌握高性能模型开发的核心技能。
?Anita Zhang6 个月前
机器学习·分布式训练·数据安全·联邦学习·隐私计算
联邦学习工程落地:从POC到生产的关键技术点联邦学习(Federated Learning)的理论已经相当成熟,但工程落地涉及大量实践细节。本文聚焦工程实现层面,梳理从POC到生产环境的关键技术点。
盼小辉丶8 个月前
pytorch·分布式·深度学习·分布式训练
PyTorch实战(26)——PyTorch分布式训练在将预训练的机器学习模型投入生产环境之前,模型训练是不可或缺的关键环节。随着深度学习的发展,大模型往往具有数百万乃至数十亿参数。使用反向传播来调整这些参数需要大量的内存和计算资源。即便如此,模型训练仍然可能需要数天甚至数月时间才能完成。 在本节中,我们将探讨如何通过跨机器和机器内多进程的分布式训练来加速模型训练过程。我们将系统学习 PyTorch 提供的三大分布式训练 API——torch.distributed、torch.multiprocessing 以及 torch.utils.data.dist
InfraTech9 个月前
分布式训练·gpu
NCCL通信C++示例(一): 基础用例解读与运行NCCL通信C++示例(一): 基础用例解读与运行NCCL(NVIDIA Collective Communication Library,pronounced “Nickel”)库主要用于GPU集群通信,写一点基础C++ API库调用相关内容供学习参考。NCCL doc文档的API介绍写得比较丰富,但介绍中逻辑穿插了各种操作的说明,对初学者来说有点绕,比如介绍communicator时会讲解comm的split操作。
InfraTech9 个月前
分布式训练·gpu
NCCL通信C++示例(二): 用socket建立多机连接NCCL通信C++示例(二): 用socket建立多机连接NCCL(NVIDIA Collective Communication Library)库主要用于GPU集群通信,写一点基础c++ API库调用相关内容供学习参考。本文主要介绍用socket TCP/IP建立多机初始化连接,其它内容参看:
IT老兵202510 个月前
人工智能·pytorch·python·分布式训练·ddp
PyTorch DDP多GPU训练实践问题总结PyTorch 是目前全球最受欢迎的开源深度学习框架之一,由 Meta(原 Facebook)的人工智能研究团队(FAIR)于 2016 年推出。PyTorch 最显著的特点是采用动态计算图(Dynamic Computation Graph),凭借灵活的设计和直观的 Python 风格语法,已经成为学术研究和工业界开发的主流选择,是 NeurIPS 等顶级会议论文复现的首选。
Yeliang Wu10 个月前
微调·分布式训练·量化·llamafactory
LLaMA-Factory 训练方法原理及实践(Ubuntu 22.04)作者:吴业亮 博客:wuyeliang.blog.csdn.netLLaMA-Factory 是一款轻量级、模块化的大语言模型(LLM)训练/微调框架,支持 LLaMA、Qwen、Baichuan 等主流模型,覆盖从预训练到对齐微调的全流程(Pre-training、SFT、RLHF、DPO、KTO 等)。本文将从原理和Ubuntu 22.04 实操两方面,系统讲解各训练阶段的核心逻辑与落地步骤。
Yeliang Wu10 个月前
大模型·微调·分布式训练·llamafactory·调优算法
LLaMA-Factory 分布式训练实践作者:吴业亮 博客:wuyeliang.blog.csdn.net无需额外配置文件,通过 torchrun 启动即可,LLaMA-Factory 会自动适配 DDP。
Yeliang Wu10 个月前
大模型·微调·分布式训练·llamafactory·调优算法
从原理到部署:LLaMA Factory 量化实战(Ubuntu 22.04)——PTQ/GPTQ/AWQ 等 9 种方法作者:吴业亮 博客:wuyeliang.blog.csdn.net本文系统讲解LLaMA Factory中主流量化方法的核心原理,并基于Ubuntu 22.04环境完成PTQ/GPTQ/AWQ等9种量化方案的实操落地,涵盖环境搭建、命令行实现、关键参数调优,适配LLaMA/LLaMA2/LLaMA3等主流模型。
Yeliang Wu10 个月前
微调·分布式训练·llamafactory·调优算法
LLaMA-Factory 加速技术全解析:FlashAttention/Unsloth/Liger Kernel 原理与 Ubuntu22.04 实践指南作者:吴业亮 博客:wuyeliang.blog.csdn.net传统Transformer注意力计算存在严重的内存访存瓶颈:需要显式存储注意力权重矩阵(O(n²)),且HBM(高带宽内存)读写速度远低于计算单元速度。 FlashAttention通过两大核心优化解决该问题:
Xxtaoaooo1 年前
人工智能·架构·分布式训练·多模态·模型优化
原生多模态AI架构:统一训练与跨模态推理的系统实现与性能优化人们眼中的天才之所以卓越非凡,并非天资超人一等而是付出了持续不断的努力。1万小时的锤炼是任何人从平凡变成超凡的必要条件。———— 马尔科姆·格拉德威尔
爱分享的飘哥1 年前
人工智能·pytorch·分布式训练·lightning·accelerate·训练框架·trainer
第七十章:告别“手写循环”噩梦!Trainer结构搭建:PyTorch Lightning让你“一键炼丹”!开场白:还在手写训练循环?拜托,都2025年了! 嘿,各位深度学习的“老铁”们!你是不是也经历过这样的“炼丹”苦日子: