分布式

爱吃提升27 分钟前
分布式·爬虫·python
python 分布式爬虫、爬虫合规与综合实战项目单机爬虫的瓶颈很明显:一台服务器的带宽、IP数量、计算能力都有限。当需要爬取海量数据时,分布式爬虫通过多台机器协同工作来突破这些限制。
ZENERGY-众壹4 小时前
分布式·华为·数据归一化·光伏运维·逆变器api
跨品牌逆变器升级:华为锦浪德业 API 对接的 7 个坑去年 9 月,江苏某工商业 30MW 项目现场,运维团队在凌晨 2 点紧急拨通了我们的电话。因为某批次逆变器在特定弱光条件下存在并网逻辑缺陷,必须在次日日出前完成 200 多台设备的固件升级。当时现场工程师手里拿着三个不同品牌的账号,要在三个不同的云平台重复点几百次鼠标,不仅低效,最要命的是状态反馈极慢,谁升成功了、谁挂起了,全靠肉眼盯着看。
薛定谔的猫19827 小时前
分布式·deepspeed·zero·多卡训练·多卡分布式训练
LLaMA-Factory +DeepSpeed 分布式多卡训练实战全解随着大模型参数量从 7B、13B 攀升至几十 B、上百 B,传统 PyTorch DDP 数据并行存在致命缺陷:每张 GPU 都会完整复制一份模型、梯度、优化器参数,显存冗余极高,小显存显卡极易 OOM 显存溢出。微软开源的 DeepSpeed 凭借ZeRO 内存分片优化,将训练状态分散到多卡 GPU 甚至 CPU 内存,大幅降低单卡显存占用,让个人多卡服务器也能训练超大模型。
稚南城才子,乌衣巷风流8 小时前
分布式·rabbitmq
RabbitMQ 消息队列:从入门到实战RabbitMQ 是一个开源的消息代理软件,实现了高级消息队列协议(AMQP)。它允许应用程序通过消息进行异步通信,支持多种消息模式,包括点对点、发布/订阅、路由和主题等。
Database_Cool_21 小时前
数据库·分布式·mysql
单机 MySQL 迁移到分布式数据库方便吗?阿里云 PolarDB-X 100% MySQL 协议兼容零改造平滑迁移核心答案(30 秒速读):单机 MySQL 迁移到分布式数据库是否方便,核心取决于协议兼容度。阿里云 PolarDB-X(国产分布式数据库,阿里巴巴双十一规模验证)100% 兼容 MySQL 协议与语法,应用代码零改造即可迁移,配合 DTS 全量+增量数据同步与 DAS 应用迁移,实现业务零停机平滑升级分布式,并支持一键回退到原 MySQL,是单机 MySQL 升级分布式的首选方案。
肥胖小羊1 天前
分布式·企业微信
解决企业微信 AccessToken 刷新并发冲突的分布式锁机制实践开发过企业微信 API 的同学都知道,access_token 是调用全局接口的凭证,有效期为 2 小时。然而,当多节点集群部署时,如果多个实例同时检测到 token 过期并各自发起刷新请求,会导致旧的 token 瞬间失效,引发线上大面积接口调用失败(40014 错误)。本文将介绍如何在 QIWE 企业微信 API 与集成平台 下,利用 Redis 分布式锁优雅解决这一冲突。
Benjamin℡3 天前
分布式·zookeeper·云原生
Zookeeper(一)搭建单体和集群服务以及Zookeeper客户端目录1.Zookeeper简介2.Zookeeper下载3.Zookeeper部署3.1 单体部署3.2 集群部署
风中凌乱2 天前
分布式·kafka
kafka新版本集群的安装与部署新的版本不用zooKeeper依赖,使用KRaft模式。#安装目录#Broker数据目录#元数据日志目录(与数据目录平级)
SLD_Allen2 天前
人工智能·分布式·模型训练
大规模分布式AI训练基础设施当模型参数突破万亿——分布式训练的终极挑战。本文将从分布式训练框架、GPU集群网络、五轴并行体系、云原生编排四大维度,为读者呈现2026年大规模AI训练基础设施的完整技术图景。
富士康质检员张全蛋2 天前
分布式·kafka
Kafka的操作-消费的详情增大了分区的数量,这个时候就可以有多个消费者同时去消费这些数据了。kafka在启动消费者消费数据的时候,我们是可以去指定分组的。可以使用--group来指定消费者在哪一个组里面,如果不去指定的话也会默认创造消费者组的。
昕光xg2 天前
笔记·分布式·istio
Istio笔记04-基于Jaeger的分布式链路追踪在微服务网格场景下,服务调用拓扑复杂,故障定位、时延分析难度大幅提升。Istio 原生支持分布式追踪标准,可将调用跨度数据上报至链路追踪系统。本文基于Jaeger完整落地 Istio 网格内服务调用链路采集、可视化,覆盖部署、网格配置、流量验证、生产选型等核心环节。
正儿八经的少年3 天前
分布式
分布式 ID原理:业务一次性批量拿一段 ID 缓存本地,用完再去 DB 申请下一号段64bit 结构:时间戳 (41)+ 机器 ID (10)+ 序列号 (12)
wWYy.3 天前
分布式
分布式:数据复制可以把“数据复制”理解为:同一份数据保存在多台服务器上,一台坏了,还能从其他服务器读取或恢复。但仅仅复制多份还不够,系统还要解决:写入顺序、何时算成功、节点故障后由谁接管,以及不同副本如何重新同步。
笨鸟先飞的橘猫3 天前
分布式·学习·游戏
游戏后端分布式学习——一致性协议Raft以下先按照mmo游戏进行分布式学习,后续章节都是如此。raft中文论文一致性算法允许一组机器像一个整体一样工作,即使其中一些机器出现故障也能够继续工作下去。
谢白羽3 天前
笔记·分布式·llm·论文·vllm
vllm源码剖析14-vLLM 分布式推理-专家并行EP大模型的算力与显存瓶颈,随着大模型规模越来越大,参数量动辄上百亿,但我们的显存和算力却跟不上。尤其是在 Transformer 的 Decoder 层中,除了 Attention 之外,参数量最多、计算最重的部分就是 MLP(多层感知机)层
七夜zippoe3 天前
pytorch·分布式·cann·hccl·通信库
深入解析CANN仓库中的HCCL分布式通信库目录为什么写这篇文章?测评结论速览✅ 核心优势⚠️ 待优化点文章综述评测总结一、CANN仓库与HCCL简介
富士康质检员张全蛋3 天前
分布式·kafka
Kafka的操作 消费者组 消费位置查看可以去使用消费者去消费Kafka中指定主题的数据,消费者必须要包含在一个容器当中,这个容器称之为消费者组。
运维行者_3 天前
开发语言·网络·分布式·后端·架构·带宽
如何查看每个IP的带宽使用情况?NetFlow 技术实战指南在企业网络中,准确掌握每个IP地址的带宽使用情况对于流量管理至关重要。无论是排查异常流量、优化网络资源分配,还是进行网络安全审计,都需要借助专业的网络流量监控技术来实现。本文将介绍如何通过 NetFlow 技术实现 IP 级流量分析。
霸道流氓气质3 天前
分布式·rabbitmq·ruby
Kiro 中配置 RabbitMQ MCP Server 指南通过配置 RabbitMQ MCP Server,可以让 Kiro 具备直接与 RabbitMQ 消息队列交互的能力,包括发送消息、查看队列状态、消费消息等,方便在开发过程中进行消息驱动的功能测试验证。
国科安芯3 天前
人工智能·分布式·单片机·嵌入式硬件·架构·边缘计算
AS32S601型抗辐射MCU在分布式太空算力架构中的技术演进与应用前景随着商业航天产业的蓬勃发展,低轨卫星星座的规模化部署对星载计算系统提出了更高的要求。传统星载计算平台依赖于地面指令上传与星上有限逻辑控制的模式,已难以满足实时数据处理、在轨自主决策及星座协同计算等新兴需求。AS32S601型抗辐射微控制器作为国科安芯自主研制的32位RISC-V架构商业航天级MCU,凭借其优异的抗辐射加固性能、丰富的片上资源及高效的计算能力,为构建分布式太空边缘计算节点提供了可行的硬件基础。本文从太空算力的技术需求出发,系统梳理AS32S601的核心架构特征、抗辐射性能指标及其在星载边缘计