分布式GPU智能算法深度研究2026年版(下)

第8章 案例研究:超大规模训练系统

理论算法的价值最终在生产系统上验证。本章选取六个代表性超大规模训练系统------PaLM、Llama 3.1 405B、DeepSeek-V3、xAI Colossus、BLOOM 与"万卡级"系统------剖析其算法-工程-数据的具体组合。

8.1 开源训练系统

8.1.1 Megatron-LM / Megatron-Core (NVIDIA)

Megatron-Core 是可组合训练库,支持 TP/PP/DP/CP/EP 五维并行 + MoE 专家并行,在 6144 H100 上实现超线性扩展,509B 模型达 47% MFU。v0.7 引入全并行异步检查点,Nemotron-4 340B 检查点开销降低 42× A

8.1.2 DeepSpeed (Microsoft)

ZeRO 三阶段:Pos 优化器状态分区(4× 内存减少)、+g 梯度分区(8×)、+p 参数分区(Nd 倍)。ZeRO-Infinity 支持 CPU/NVMe offload。用于训练 Turing-NLG 17B 和 MT-NLG 530B。在 1024 A100 上扩展至 2T 参数,157 TFLOPs/GPU A

8.1.3 PyTorch FSDP2 / TorchTitan / TorchTune

FSDP2 基于 DTensor 的逐参数分片,解决 FSDP1 flat-parameter 组合性问题(PyTorch 2.4 原型)。TorchTitan 支持 Llama 3.1 8B/70B/405B 预训练,含 FSDP2+TP+PP+CP+FP8。TorchTune 提供 LoRA/QLoRA 微调食谱 A

8.1.4 vLLM / SGLang

vLLM PagedAttention(SOSP 2023,arXiv:2309.06180)将 KV Cache 按 OS 虚拟内存分页管理,内存利用率 ~95%,吞吐 2--4× 于 HF TGI B。SGLang RadixAttention(arXiv:2312.07104,NeurIPS 2024)以基数树共享前缀 KV Cache,多轮对话场景 5× 加速 B

8.2 PaLM (Google 2022):Pathways + TPU v4 Pod

540B 参数,首次大规模使用 Pathways 系统跨 2 个 TPU v4 Pod 扩展至 6144 芯片(每 Pod 3072 芯片),无需 pipeline 并行 。HFU 57.8%,为当时 LLM 最高。PaLM 验证了一个关键论点:专用 ASIC + 大规模 Pod + 跨 Pod 调度系统可以绕开流水线并行的复杂性,直接通过数据和模型并行达到超大规模 A B

8.3 Llama 3.1 405B (Meta 2024):16K H100集群

16K H100 GPU(700W TDP, 80GB HBM3),Grand Teton 平台,每服务器 8 GPU+2 CPU。网络:RDMA over RoCE 400Gbps。存储:Tectonic 240PB / 7500 SSD 服务器 / 2TB/s 持续吞吐。采用 4D 并行(TP+PP+DP+CP),MFU 38%--43%。调度器为 MAST A B

关键工程数据:

  • 54 天训练周期,419 次意外中断,平均每 9 天 1 次 SDC;
  • 故障分布:硬件 35%(GPU/主机 148 次)、网络 24%(IB/NIC 101 次)、软件 16%(BUG/驱动 69 次)、存储 12%(数据/ckpt 52 次)、其他 13%;
  • MAST 调度器 + 自动恢复链路把 MTTR 控制在 20 分钟以内。

8.4 DeepSeek-V3 (2024):DualPipe + FP8 + MoE

671B 总参 / 37B 激活/token。三大工程优化:

  • 架构层 - MLA + MoE:MLA(Multi-head Latent Attention)把 KV Cache 压缩成低维隐变量,显存占用降到 GQA 的 1/4;细粒度 MoE:256 个专家、每 token 激活 8 个、加上 1 个共享专家,激活比例 ~4%;专家负载均衡用 auxiliary loss-free 方法(complementary sequence-wise bias)保证专家激活均匀;
  • 训练层 - FP8 + DualPipe:FP8 训练(权重 + 激活 + 梯度全部 FP8),比 BF16 节省 30--50% 算力和显存,工业界首次大规模成功;DualPipe 双向流水并行,PP bubble 几乎降到 0;跨节点 All-to-All 优化,自研通信库比 NCCL 默认快 30%;
  • 数据层:14.8T 高质量 tokens,数学和代码占比明显高于一般预训练;MTP(Multi-Token Prediction)每次预测多个 token 提高数据利用率;数据课程学习先简单后复杂加速收敛。

训练配置:2048 H800 GPU,EP=64(8 节点),PP=16,ZeRO-1。H800 上划 20/132 个 SM 专门做通信(自写 PTX 级 kernel,非 NCCL)。总训练仅 2.788M H800 GPU 小时,约 557 万美元------是同等性能 GPT-4 类模型训练成本的 1/30 B

💡 DeepSeek-V3 给行业的几个启示 :(1) 算法 × 工程同等重要,光堆 GPU 不行,工程优化能差 5--10×;(2) FP8 训练时代正式到来,后续大模型都会跟进;(3) MoE 是工程红利,同样的训练算力可以做更大模型;(4) 创新可以来自任何团队,不只是 OpenAI/Anthropic/Google。

8.5 xAI Colossus:100K+ H100单一fabric

100K+ H100 GPU,单一 RDMA fabric,122 天从空仓库到训练就绪。Memphis TN 前 Electrolux 工厂。4 个 25K GPU 大厅。后扩展至 200K GPU(加 50K H200)。网络:NVIDIA Spectrum-X 以太网 400G。Colossus 验证了"大规模单一 fabric + 标准以太网"路线的可行性------不依赖 NVSwitch 全互连域,靠 Spectrum-X 的高性能 RoCE 实现万卡级训练 A

8.6 BLOOM (BigScience 2022):低碳训练范本

176B 参数,法国 Jean Zay 超算上训练,384 A100 80GB(48 节点),117 天,1,082,990 GPU-hours。Megatron-DeepSpeed 框架,3D 并行(TP=4, PP=12, DP=8)。能耗 433 MWh,碳足迹仅 25 吨 CO₂------受益于法国低碳电网(核电为主)A。BLOOM 是开源大模型训练的范本,也是绿色 AI 的标杆案例。

8.7 超大规模训练系统

8.7.1 百度文心 / 昆仑芯

基于自研昆仑芯 P800 构建国内首个自研万卡集群(11,040 颗),训练文心 5 系列 MoE 模型。有效训练率 97.12%,万卡线性扩展度 85%。BCCL 通信库实现分钟级故障恢复。天池 256 超节点(256 卡)推理吞吐提升 3.5× A C

8.7.2 阿里通义千问 / Whale / PAI-DLC

Whale 框架统一抽象 DP/PP/EP 等并行策略,480 V100 3 天完成万亿 M6 预训练(算力节省 80%)。PAI-DLC 基于 K8s,含 AIMaster 容错引擎、EasyCKPT 检查点框架、灵骏智算资源 A

8.7.3 华为盘古 / 昇腾

MindSpore 五维自动并行(算子级 + 模型 + 流水 + 数据 + 优化器并行),2048 昇腾处理器训练盘古 200B。CANN 算子融合提升单算子性能 30%+,集群线性度提升 20%。ModelArts 提供 E 级算力调度 A

8.7.4 GLM-130B (清华 2022)

中英双语 130B,清华学术实验室,768 A100 GPU 训练 2 个月,采用 GLM 填充目标 B

8.8 案例对比矩阵

系统 GPU/芯片 规模 核心算法 训练时长 关键指标
PaLM TPU v4 6144芯片 Pathways跨Pod --- HFU 57.8%
Llama 3.1 405B H100 16K 4D并行(TP+PP+DP+CP) 54天 MFU 38-43%
DeepSeek-V3 H800 2048 DualPipe+FP8+MoE+MLA --- 2.788M GPU小时
xAI Colossus H100 100K+ Spectrum-X RoCE单一fabric 122天搭建 ---
BLOOM A100 384 3D并行(TP4 PP12 DP8) 117天 1.08M GPU小时,25tCO₂
百度文心5 昆仑芯P800 11040 BCCL+天池超节点 --- 有效训练率97.12%
阿里M6 V100 480 Whale统一并行 3天 万亿参数
华为盘古200B 昇腾910 2048 MindSpore五维自动并行 --- 集群线性度提升20%

第9章 前沿趋势与开放问题

NVIDIA GB200 NVL72 是36 Grace CPU + 72 Blackwell GPU 的 72-GPU NVLink 域。第五代 NVLink 1.8 TB/s/GPU(14× PCIe Gen5)。液冷机架级,1.8T MoE 推理 30× vs H100 ANVLink Switch System (NVL576) :9 个 NVLink 交换机托盘,每个 144 端口 × 100GB,总计 1 PB/s 聚合带宽,240TB 快存,可扩展至 576 GPU 域。这一架构的哲学是:把 Scale-Up 域从单节点扩展到单机架甚至多机架,让 TP 不再受"节点内 NVLink"约束

Google TPU v5p:每 Pod 8,960 芯片,3D 环面拓扑,ICI 4,800 Gbps/芯片,训练 LLM 速度 2.8× vs TPU v4 A。AWS Trainium2:190 TFLOPS FP16/BF16,32GB HBM,NeuronLink 互联,EC2 UltraClusters 可扩展至 100K 芯片,训练速度 4× vs Trainium1,能效 2× A

9.2 Ultra Ethernet Consortium (UEC)

2023 年 7 月成立(AMD/Arista/Broadcom/Cisco/Intel/Meta/Microsoft 等)。Spec 1.0 于 2025 年 6 月发布。核心特性:packet spray (单消息跨所有路径散射)、multi-path RDMA、乱序交付 + NIC 重组、现代拥塞控制。支持百万级端点 A B。UEC 代表了"标准以太网替代 InfiniBand"的方向,把万卡集群的组网成本从专有协议拉回标准生态。

9.3 推理服务前沿:分离架构 + 投机解码

DistServe (OSDI 2024) :分离 Prefill 与 Decode 到不同 GPU 池,消除干扰。7.4× 更多请求或 12.6× 更紧 SLO BSplitwise (Microsoft 2024):将 prompt 计算与 token 生成分离到不同机器,1.4× 吞吐/20% 低成本或 2.35× 吞吐/同成本 B

Speculative Decoding:小 draft 模型预测 K 个 token,大模型并行验证。Medusa 多 head 并行预测;EAGLE-2 自回归 draft head,接受率更高。vLLM 支持 n-gram/EAGLE/Medusa 策略。这一类算法把"推理算力成本"进一步压缩 2--3×。

9.4 异构计算与CXL

  • CXL 3.0:64 GT/s,引入 Fabric 管理、内存池化/共享、增强一致性、对等通信。支持多设备级联。CXL 4.0 基于 PCIe 7.0,512GB/s A
  • NVIDIA GH200:Grace CPU + Hopper GPU,NVLink-C2C 900 GB/s 互联,GPU 透明访问 CPU 512GB 内存 A
  • AMD MI300X:3D Chiplet 封装,256GB HBM3e,统一内存架构消除 CPU-GPU 拷贝开销 A
  • Intel Falcon Shores:GPU+CPU 融合架构,原定 2025 发布。

9.5 绿色AI与能效优化

  • PUE 范围:Google 最优数据中心 PUE=1.10,典型企业 PUE=2.5 A
  • Patterson et al. 2022 :GPT-3 训练能耗 1,287 MWh,碳排放估算公式 CO₂eq = N×P×T×PUE×CI B
  • CodeCarbon:Python 库,自动监控 GPU/CPU 功耗 × 区域碳强度 A
  • Carbontracker:深度学习能耗预测 + 碳足迹追踪 B
  • BLOOM 训练碳足迹:433 MWh / 25 tCO₂(法国低碳电网优势)A

9.6 智能体驱动训练

Anthropic 的 GPU-Bound 和 OpenAI 的 o-series 推理模型揭示了一个新方向:训练过程本身由智能体调度 ------智能体根据训练曲线、loss 异常、资源可用性动态调整 batch size、学习率、并行策略,甚至决定何时切换数据课程。这一方向把"训练"从批处理脚本转变为"闭环控制系统",是 AlgoPerf、AutoML 之后的下一阶段。

9.7 开放问题

  1. 带宽墙 :HBM 带宽 4× 增长(2→8TB/s),但 FP8/FP4 算力增长 12--14×,带宽将成为下一代训练瓶颈,需要更激进的通信隐藏与压缩;
  2. 自动并行的搜索代价:Alpa 编译 40 分钟(GPT-39B, 64GPU),如何把搜索时间降到秒级以支持在线动态切换?
  3. SDC 检测的算法化:Bauer 实验显示 17.7% 的 bit 翻转会破坏训练,如何在不冗余执行的前提下检测?ABFT(Algorithm-Based Fault Tolerance)是候选方向;
  4. 多集群训练:跨数据中心带宽远低于集群内(10--25GB/s vs 400Gbps),如何在跨 DC 场景下保持线性加速比?
  5. 国产栈的并行算法适配:HCCL 9 种拓扑算法 vs NCCL Ring/Tree/NVLS,国产芯片需要与之匹配的自动并行搜索算法。

第10章 结论与展望

10.1 核心结论

本报告系统梳理了面向大规模可扩展分布式 GPU 系统的智能算法谱系,可归纳为五条核心结论:

  1. 三层互连构成规模化的物理基础:NVLink/NVSwitch(节点内 1.8TB/s)、InfiniBand/RoCE(节点间 400--800Gbps)、CXL/UEC(下一代内存语义与可扩展以太网)。"节点内全互连 + 节点间 Clos"的层级范式是所有大规模训练系统的共同基底。GB200 NVL72 把 NVLink 域从 8 GPU 扩展到 72 GPU,是范式跃迁的标志 A
  2. 集合通信算法决定性能天花板:Ring AllReduce 带宽最优(通信量 2(N−1)/N × M)、Tree AllReduce 延迟最优(O(log N))、Rabenseifner 在二者间取得平衡;NCCL 通过 Simple/LL/LL128 三协议、Channel 流水线、NVLS 网络内归约等机制落地到生产代码 A B
  3. 自动并行搜索是智能化的主战场:从手工 DP/TP/PP/ZeRO/FSDP 到 Alpa(ILP+DP 层级化)、Galvatron(决策树剪枝)、Unity(图替换联合优化)、TorchTitan(DTensor 1D→4D 可组合),"让编译器替人决定怎么并行"已成标准范式 B
  4. 调度+容错+可观测构成生产化最后里程:拓扑感知调度、弹性训练、SDC 检测、DCGM/Nsight/Perfetto 全栈可观测,共同把集群可用率从 99% 推到 99.9%+ A B
  5. "万卡级 + 国产栈"已具雏形:百度 11,040 卡昆仑芯集群、阿里 Whale、华为 MindSpore+昇腾、DeepSeek-V3 在 H800 上的 DualPipe+FP8------既验证了"算法 × 工程 × 数据"乘数效应,也指明国产芯片从 A100 阶段向 H100 阶段过渡的路径 A C

10.2 算法-工程-数据的乘数效应

DeepSeek-V3 案例揭示了大规模训练的"三层乘数效应":

  • 算法层:MLA 把 KV Cache 压到 GQA 的 1/4,MoE 把激活参数从 671B 降到 37B,DualPipe 把气泡压到接近零------这三项算法创新合计贡献 ~5× 算力节省;
  • 工程层:FP8 把显存与算力都节省 30--50%,自研跨节点 All-to-All kernel 比 NCCL 默认快 30%,warp specialization 把通信隐藏到计算背后------这三项工程优化合计贡献 ~2× 算力节省;
  • 数据层:14.8T 高质量 tokens、数学/代码高占比、MTP 多 token 预测、数据课程学习------四项数据策略合计贡献 ~1.5× 收敛加速。

三层相乘:5 × 2 × 1.5 = 15× 综合效率提升,使 DeepSeek-V3 在 2048 H800 上以 557 万美元训练成本达到 GPT-4o 量级的性能。这是"算法 × 工程 × 数据"乘数效应的最强证据 B

10.3 给工程团队的落地建议

  1. 互连优先:规划万卡集群时,互连成本(IB 网络约占 30--40% TCO)应作为第一优先级,Fat-Tree + rail topology 是稳妥选择;
  2. 分层并行:TP 限制在节点内(NVLink),PP 跨节点(IB P2P),DP 为最外层------这是 Megatron 3D 并行的"黄金标准",DeepSeek-V3 在此基础上加入 CP 与 EP;
  3. 自动并行是趋势:小型团队可直接用 TorchTitan + DTensor,大型团队应考虑自研类似 Alpa/Galvatron 的搜索器,结合 profile 数据建立本地化代价模型;
  4. 检查点频率:30 分钟异步 checkpoint 是工业最佳实践,配合 torchrun 弹性重启 + Fleetscanner 周期扫描,可把 MTTR 控制在 20 分钟以内;
  5. FP8 训练:DeepSeek-V3 验证了 trillion 参数 FP8 训练的可行性,新项目应直接采用 FP8 + delayed scaling,而不是从 BF16 起步;
  6. 可观测性投资:DCGM + nsys + Perfetto + HolisticTraceView 四件套应作为生产标配,工程师需掌握"nsys before ncu"的原则。

10.4 展望

未来 3--5 年,分布式 GPU 系统的智能算法将沿五条主线演进:

  • 带宽墙突围:FP4 + 4-bit 量化 + 通信压缩 + 计算通信比优化,把"带宽"瓶颈推到下一代 HBM 5/6;
  • 超节点标准化:GB200 NVL72/576 + UEC 把 Scale-Up 域从单节点扩展到机架/多机架,TP 不再受"节点内"约束;
  • 智能体驱动训练:训练过程由智能体闭环控制,动态调整 batch/学习率/并行策略/数据课程;
  • 跨 DC 训练:UEC + 多 ncclNet 抽象让万卡集群扩展到跨 DC 10 万卡级;
  • 国产栈成熟:昇腾 950/思元 590/沐曦 C700 对标 H100/B200,CANN/MindSpore 自动并行算法生态跟进。

本报告所述算法谱系,本质上是把**"做大模型"从手工艺变成工程科学的过程。Ring AllReduce、ZeRO、Alpa、DualPipe、FP8、SDC 检测------每一项都是这一工程化进程的里程碑。下一阶段的竞争,将围绕把这些算法与硬件、软件、数据、调度全栈协同优化**展开,谁能把"算法 × 工程 × 数据"的乘数效应做到极致,谁就能在万亿参数时代占据有利位置。

参考文献与可核验引用

本报告所有引用按主题分组,证据评级:A 官方白皮书/产品页/Hot Chips 演讲;B 顶会论文 arXiv/USENIX/OSDI/SC/NeurIPS;C 行业分析/社区资料/媒体报道。

A. GPU架构与互连(第2章)

  1. A NVIDIA. A100 Datasheet (PDF)
  2. A NVIDIA. H100/H200 Product Page
  3. A NVIDIA. NVLink Product Page
  4. A NVIDIA. GB200 NVL72 Product Page
  5. A NVIDIA. GB300 NVL72 Product Page
  6. A NVIDIA Developer Blog. NVSwitch Architecture
  7. A AMD. MI300 Product Page
  8. A AMD. Accelerator Specifications
  9. A Habana. Gaudi Architecture Docs
  10. A Intel. Gaudi 3 White Paper (PDF)
  11. A TPU Type Reference / TPU Pod Reference
  12. A JAX Scaling Book - TPUs
  13. A CXL Consortium. CXL 3.0 White Paper (PDF)
  14. A Ultra Ethernet Consortium. UEC Official
  15. B Besta & Hoefler. Slim Fly. ISCA 2014
  16. B Singh et al. Jellyfish. SIGCOMM 2012
  17. A 华为. 昇腾产品页
  18. A 寒武纪. 思元370产品页
  19. A 摩尔线程. MTT S4000文档
  20. A HPCwire. Biren BR100
  21. C 2026 国产 AI 算力卡选型
  22. C 沐曦 IPO 问询(腾讯新闻)

B. 集合通信(第3章)

  1. B Patarasuk & Yuan. Bandwidth Optimal All-reduce Algorithms. JPDC 2009
  2. A 百度 Ring Allreduce (CCF)
  3. B Sergeev & Del Balso. Horovod (arXiv:1802.05799)
  4. B Hu et al. Demystifying NCCL (arXiv:2507.04786)
  5. A NVIDIA. NCCL Collective Operations
  6. A NVIDIA. NCCL 2.20.3 Release Notes
  7. A HCCL 概述(昇腾)
  8. B xCCL Survey (JCST)

C. 并行策略与自动并行(第4章)

  1. A PyTorch. DDP Design Note
  2. B Rajbhandari et al. ZeRO. SC 2020 / DeepSpeed GitHub
  3. A DeepSpeed ZeRO Tutorial
  4. B ZeRO-Offload (arXiv:2101.06840)
  5. B ZeRO-Infinity (arXiv:2104.07857)
  6. B ZeRO++ (arXiv:2306.10209)
  7. A PyTorch. FSDP2 Documentation
  8. B Shoeybi et al. Megatron-LM (arXiv:1909.08053)
  9. B Korthikanti et al. Sequence Parallelism (arXiv:2205.05198)
  10. B FlashAttention-3 (arXiv:2407.08608)
  11. B GPipe (arXiv:1811.06965)
  12. B Narayanan et al. Megatron-LM v2 / Interleaved 1F1B (arXiv:2104.04473)
  13. B Zero Bubble Pipeline Parallelism (arXiv:2401.10241)
  14. B DeepSeek-V3 Technical Report (arXiv:2412.19437)
  15. B Zheng et al. Alpa. OSDI 2022 / GitHub
  16. B Miao et al. Galvatron-BMW (arXiv:2307.02031). VLDB 2023
  17. B Jia et al. FlexFlow (arXiv:1807.05358). MLSys 2019
  18. B Unger et al. Unity. OSDI 2022 / USENIX
  19. B Liang et al. TorchTitan (arXiv:2410.06511)

D. 调度与容错(第5、7章)

  1. A K8s Topology-aware GPU Scheduling
  2. A HAMi 百度百科
  3. A Volcano. Gang Scheduling
  4. A Slurm GRES 文档
  5. A PyTorch. torchrun Documentation
  6. B Pollux. OSDI 2021 / GitHub
  7. B AntMan. OSDI 2020
  8. B Varuna (EuroSys 2022)
  9. B Tiresias. NSDI 2019
  10. B Themis (NSDI 2020)
  11. B Salus. MLSys 2020
  12. B Bauer et al. MLSys 2022 (NVDLA SDC)
  13. A NVIDIA. DCGM Documentation
  14. A NVIDIA. Nsight Systems / Nsight Compute Documentation

E. 自适应优化(第6章)

  1. A NVIDIA. Transformer Engine 文档
  2. A FP8 Training 指南
  3. B You et al. LAMB. 2019
  4. B Liu et al. Sophia. 2023
  5. B Jordan et al. Muon. 2024
  6. B Defazio et al. Schedule-Free AdamW. 2024
  7. B AlgoPerf 2024 Benchmark

F. 案例与前沿(第8、9章)

  1. A NVIDIA. Megatron-Core
  2. A Microsoft. DeepSpeed/ZeRO Blog
  3. A PyTorch 2.4 Release Blog
  4. B vLLM PagedAttention (arXiv:2309.06180). SOSP 2023
  5. B SGLang (arXiv:2312.07104). NeurIPS 2024
  6. A Google PaLM Blog
  7. B PaLM Paper (arXiv:2204.02311)
  8. B Llama 3 Paper
  9. B DeepSeek-V3 Technical Report
  10. A xAI Colossus (NVIDIA 官方)
  11. A GENCI BLOOM Award
  12. A 百度开发者: 国产 AI Infra
  13. A 阿里云 PAI-DLC 文档
  14. A MindSpore 盘古千亿模型
  15. B DistServe (arXiv:2401.09670). OSDI 2024
  16. B Splitwise (arXiv:2311.18677)
  17. A NVIDIA GB200 NVL72 Product Page
  18. A Google Cloud TPU v5p Blog
  19. A AWS Trainium2 Blog
  20. A UEC Spec 1.0 Announcement
  21. B Patterson et al. Carbon Emissions of NLP (2022)
  22. A CodeCarbon Project

报告说明 :本报告基于公开可核验资料整理,所有数据均附引用链接与证据评级(A 官方 / B 论文 / C 行业社区)。

部分国产芯片规格来自开发者论坛、CSDN 等社区资料,非官方发布,已在原文中以 C 标注。

读者引用具体数字时建议复核原始链接。报告作者:Buddy · 2026-08-19 · 总字数约 3 万字 · 10 章 · 3 张图表

相关推荐
LHX sir1 小时前
医疗设备外设多、协议杂?HubPort 让出厂设备自带 AI
人工智能·物联网·医疗设备·设备智能化
chuan.bai1 小时前
Java RAG 实战附录:qwen3 与 bge-m3 模型切换指南
java·人工智能·算法
wuyk5551 小时前
7.AVL 树:第一个自平衡二叉搜索树
开发语言·stm32·单片机·算法
武子康1 小时前
Pi Extension 写完不等于可用:从类型检查到真实 Runtime 的证据阶梯
人工智能·llm·agent
rannn_1111 小时前
【力扣hot100】二叉树专题+总结
java·算法·leetcode·二叉树
润乾软件1 小时前
如何给已有报表系统增加 AI 语言查询能力——AI 赋能数据分析技术探讨与实践
人工智能·chatbi
微硬创新1 小时前
不用换设备,也能接入智能系统:耐达讯自动化NY-B801网关的神奇功效
人工智能·网络协议·自动化·信息与通信
Elastic 中国社区官方博客1 小时前
Elasticsearch:什么是向量数据库?
大数据·运维·数据库·人工智能·elasticsearch·搜索引擎·ai
啊嘞嘞?1 小时前
力扣(岛屿数量)
算法·leetcode
SomeB1oody1 小时前
【RustyML入门】5.3. 聚类指标
开发语言·后端·机器学习·rust·教程