分布式

网络工程小王10 小时前
人工智能·pytorch·分布式·学习·昇腾·deepspeed
【HCIE-AI】12.deepspeed分布式并行训练进阶版概述: 训练大模型(7B+)时,会依次遇到显存、计算、通信、工程四个方面的瓶颈。理解这些瓶颈是理解后续所有解决方案的前提。
ACP广源盛1392462567313 小时前
大数据·人工智能·分布式·单片机·嵌入式硬件
国产算力互联IX8024@ACP#Kimi K3 开源后的端侧部署硬件架构分析2026年7月27日,月之暗面开源了Kimi K3完整权重。2.8万亿参数、896专家MoE架构、百万级上下文窗口——这组数字背后,是端侧AI部署硬件架构的一次重大考验。本文从硬件工程师视角,分析大模型推理集群中PCIe互联的技术瓶颈,以及国产PCIe交换芯片在这一场景下的技术价值。
花生了什么事o13 小时前
数据库·分布式·算法
分布式 ID 生成方案:从数据库自增到雪花算法在很多系统刚开始建设的时候,ID 并不是一个需要特别关注的问题。创建一张表,设置一个自增主键,数据库负责保证每条数据都有唯一编号,这种方式简单、稳定,而且几乎没有额外成本。
爱吃提升1 天前
分布式·爬虫·python
python 分布式爬虫、爬虫合规与综合实战项目单机爬虫的瓶颈很明显:一台服务器的带宽、IP数量、计算能力都有限。当需要爬取海量数据时,分布式爬虫通过多台机器协同工作来突破这些限制。
ZENERGY-众壹1 天前
分布式·华为·数据归一化·光伏运维·逆变器api
跨品牌逆变器升级:华为锦浪德业 API 对接的 7 个坑去年 9 月,江苏某工商业 30MW 项目现场,运维团队在凌晨 2 点紧急拨通了我们的电话。因为某批次逆变器在特定弱光条件下存在并网逻辑缺陷,必须在次日日出前完成 200 多台设备的固件升级。当时现场工程师手里拿着三个不同品牌的账号,要在三个不同的云平台重复点几百次鼠标,不仅低效,最要命的是状态反馈极慢,谁升成功了、谁挂起了,全靠肉眼盯着看。
薛定谔的猫19821 天前
分布式·deepspeed·zero·多卡训练·多卡分布式训练
LLaMA-Factory +DeepSpeed 分布式多卡训练实战全解随着大模型参数量从 7B、13B 攀升至几十 B、上百 B,传统 PyTorch DDP 数据并行存在致命缺陷:每张 GPU 都会完整复制一份模型、梯度、优化器参数,显存冗余极高,小显存显卡极易 OOM 显存溢出。微软开源的 DeepSpeed 凭借ZeRO 内存分片优化,将训练状态分散到多卡 GPU 甚至 CPU 内存,大幅降低单卡显存占用,让个人多卡服务器也能训练超大模型。
稚南城才子,乌衣巷风流1 天前
分布式·rabbitmq
RabbitMQ 消息队列:从入门到实战RabbitMQ 是一个开源的消息代理软件,实现了高级消息队列协议(AMQP)。它允许应用程序通过消息进行异步通信,支持多种消息模式,包括点对点、发布/订阅、路由和主题等。
Database_Cool_2 天前
数据库·分布式·mysql
单机 MySQL 迁移到分布式数据库方便吗?阿里云 PolarDB-X 100% MySQL 协议兼容零改造平滑迁移核心答案(30 秒速读):单机 MySQL 迁移到分布式数据库是否方便,核心取决于协议兼容度。阿里云 PolarDB-X(国产分布式数据库,阿里巴巴双十一规模验证)100% 兼容 MySQL 协议与语法,应用代码零改造即可迁移,配合 DTS 全量+增量数据同步与 DAS 应用迁移,实现业务零停机平滑升级分布式,并支持一键回退到原 MySQL,是单机 MySQL 升级分布式的首选方案。
肥胖小羊2 天前
分布式·企业微信
解决企业微信 AccessToken 刷新并发冲突的分布式锁机制实践开发过企业微信 API 的同学都知道,access_token 是调用全局接口的凭证,有效期为 2 小时。然而,当多节点集群部署时,如果多个实例同时检测到 token 过期并各自发起刷新请求,会导致旧的 token 瞬间失效,引发线上大面积接口调用失败(40014 错误)。本文将介绍如何在 QIWE 企业微信 API 与集成平台 下,利用 Redis 分布式锁优雅解决这一冲突。
Benjamin℡4 天前
分布式·zookeeper·云原生
Zookeeper(一)搭建单体和集群服务以及Zookeeper客户端目录1.Zookeeper简介2.Zookeeper下载3.Zookeeper部署3.1 单体部署3.2 集群部署
风中凌乱3 天前
分布式·kafka
kafka新版本集群的安装与部署新的版本不用zooKeeper依赖,使用KRaft模式。#安装目录#Broker数据目录#元数据日志目录(与数据目录平级)
SLD_Allen3 天前
人工智能·分布式·模型训练
大规模分布式AI训练基础设施当模型参数突破万亿——分布式训练的终极挑战。本文将从分布式训练框架、GPU集群网络、五轴并行体系、云原生编排四大维度,为读者呈现2026年大规模AI训练基础设施的完整技术图景。
富士康质检员张全蛋4 天前
分布式·kafka
Kafka的操作-消费的详情增大了分区的数量,这个时候就可以有多个消费者同时去消费这些数据了。kafka在启动消费者消费数据的时候,我们是可以去指定分组的。可以使用--group来指定消费者在哪一个组里面,如果不去指定的话也会默认创造消费者组的。
昕光xg4 天前
笔记·分布式·istio
Istio笔记04-基于Jaeger的分布式链路追踪在微服务网格场景下,服务调用拓扑复杂,故障定位、时延分析难度大幅提升。Istio 原生支持分布式追踪标准,可将调用跨度数据上报至链路追踪系统。本文基于Jaeger完整落地 Istio 网格内服务调用链路采集、可视化,覆盖部署、网格配置、流量验证、生产选型等核心环节。
正儿八经的少年4 天前
分布式
分布式 ID原理:业务一次性批量拿一段 ID 缓存本地,用完再去 DB 申请下一号段64bit 结构:时间戳 (41)+ 机器 ID (10)+ 序列号 (12)
wWYy.4 天前
分布式
分布式:数据复制可以把“数据复制”理解为:同一份数据保存在多台服务器上,一台坏了,还能从其他服务器读取或恢复。但仅仅复制多份还不够,系统还要解决:写入顺序、何时算成功、节点故障后由谁接管,以及不同副本如何重新同步。
笨鸟先飞的橘猫4 天前
分布式·学习·游戏
游戏后端分布式学习——一致性协议Raft以下先按照mmo游戏进行分布式学习,后续章节都是如此。raft中文论文一致性算法允许一组机器像一个整体一样工作,即使其中一些机器出现故障也能够继续工作下去。
谢白羽4 天前
笔记·分布式·llm·论文·vllm
vllm源码剖析14-vLLM 分布式推理-专家并行EP大模型的算力与显存瓶颈,随着大模型规模越来越大,参数量动辄上百亿,但我们的显存和算力却跟不上。尤其是在 Transformer 的 Decoder 层中,除了 Attention 之外,参数量最多、计算最重的部分就是 MLP(多层感知机)层
七夜zippoe4 天前
pytorch·分布式·cann·hccl·通信库
深入解析CANN仓库中的HCCL分布式通信库目录为什么写这篇文章?测评结论速览✅ 核心优势⚠️ 待优化点文章综述评测总结一、CANN仓库与HCCL简介
富士康质检员张全蛋4 天前
分布式·kafka
Kafka的操作 消费者组 消费位置查看可以去使用消费者去消费Kafka中指定主题的数据,消费者必须要包含在一个容器当中,这个容器称之为消费者组。