PYTHON+AI LLM DAY ONE HUNDRED AND TWENTY-NINE

今天聊聊分布式训练Distributed Training:分布式训练(Distributed Training) 就是"人多力量大"在AI领域的体现。当模型太大、数据太多,单张显卡(GPU/TPU)算不过来或者算得太慢时,我们就把任务拆分给多台机器或多张卡,让它们协同工作,一起完成训练。为什么要用分布式训练?模型太大:像 Llama-3 这种千亿参数的模型,单卡显存根本装不下。数据太多:几TB的训练数据,单卡跑完一个Epoch可能要几个月。时间成本:大模型训练动辄几个月,用几百张卡并行,可以缩短到几周。核心策略:怎么"分"?分布式训练主要有三种切分方式,通常还会组合使用:数据并行 (Data Parallelism, DP/DDP)最常用,入门首选。原理:每张卡上都有一份完整的模型副本,但拿到的数据不同流程:各卡用自己的数据算梯度(Gradient)。所有卡把梯度汇总(All-Reduce),算出平均梯度。各卡用平均梯度更新自己的模型。优点:实现简单,通信量相对小。缺点:显存必须能装下整个模型。模型并行 (Model Parallelism)解决显存不够的问题。张量并行 (Tensor Parallelism, TP):把一层里的矩阵运算切开。比如一个 1000×10001000×1000 的矩阵乘法,4张卡各算 250×1000250×1000 特点:通信极其频繁,通常只在同一台机器内(NVLink互联)使用。流水线并行 (Pipeline Parallelism, PP):把不同的层分给不同的卡。比如 1-10层在卡A,11-20层在卡B。特点:像工厂流水线,但容易出现"气泡"(前面的卡算完了,后面的卡还在忙,导致闲)。专家并行 (Expert Parallelism, EP)MoE(混合专家)模型专用。原理:模型有很多"专家"子网络,每次只激活其中几个。把不同的专家放在不同的卡上,根据路由(Router)把数据发给对应的卡进阶:3D 并行.现在的超大模型训练,通常是 3D 并行:3D=数据并行 (DP)+张量并行 (TP)+流水线并行 (PP)3D=数据并行 (DP)+张量并行 (TP)+流水线并行 (PP).典型配置:机内:8张卡用 TP(因为NVLink带宽高,适合高频通信)。机间:用 PP(跨机通信慢,适合流水线这种通信相对少的)。全局:用 DP(把上述的"机内TP+机间PP"看作一个大模型,再在数据维度并行)。显存优化技术(省显存就是省钱).除了"切"模型,还有几个省显存的"魔法".ZeRO (Zero Redundancy Optimizer):DeepSpeed 的核心。把优化器状态、梯度、参数切碎,每张卡只存 1/N1/N 。ZeRO-1:切优化器状态。ZeRO-2:切优化器 + 梯度。ZeRO-3:切优化器 + 梯度 + 参数(显存省到极致,但通信变多)。Gradient Checkpointing (梯度检查点):前向传播时不存中间激活值,反向传播时重算一遍。代价:用计算时间换显存空间(约省 20% 显存,多 20% 时间).Mixed Precision (混合精度):用 FP16/BF16 计算,FP32 累加。显存减半,速度变快。

相关推荐
夏天测1 小时前
Python 网络编程从 TCP 三次握手到 Socket 搭建极简 AI 推理服务端(零基础可跑通完整代码)
python·socket·网络通信·tcp 网络编程·零基础网络编程
ESBK20251 小时前
学术邀约|CMICA 2026 第二届计算方法、智能控制与航空航天国际会议
大数据·人工智能·算法·飞行器·智能控制·航空航天·计算
9i编程1 小时前
手敲重构学透 Multi-Agent 代码(上):逐行拆解 AgentScope 1.0.8,从「跑通了但没懂」到真懂了
人工智能·openai·ai编程
能源科技集1 小时前
宜昌基地投产释放产业新动能,远景动力(AESC)790Ah超大电芯引领储能产业高质量发展
人工智能
武子康1 小时前
SWE-1.7 的提升究竟来自哪里?接受大量强化学习后训练的 Kimi K2.7 为起点,继续进行大规模 RL
人工智能·llm·agent
一根数据线1 小时前
不用无人机也不用软件,AI也能直接从地图生成3D模型?
人工智能·3d·3d建模·无人机·倾斜摄影·造形家·场地建模
Vec‑Jie1 小时前
MerchantOps-KBQA 实践(十四):本地运行、性能限制与可验证的交付边界
人工智能·后端·python·flask
苏醒的人生1 小时前
2026年支持最多全模态素材的AI视频生成工具推荐:即梦AI Seedance 2.5一次投喂50个素材,精准还原每一步
人工智能·音视频