阿里云全球故障凸显“云集中”风险

阿里云12日发生的全球性故障再次将"云集中风险"推上风口浪尖。这一公有云史上罕见的事件不仅影响了数以万计的企业和服务,也引发了对云服务集中化趋势的深刻反思。

2023年11月12日17:44(GMT+8)开始,阿里云基础设施发生严重故障,导致阿里巴巴大量产品无法连接,"阿里云盘崩了""淘宝又崩了""闲鱼崩了""钉钉崩了" 等话题相继登上热搜,阿里系诸多产品受到影响。

故障期间阿里云控制台无法正常登录,API调用异常,导致阿里云全系列产品服务及全球区域(包括阿里云位于中国内地、港澳台、亚洲其他地区、欧洲、北美、中东、政务云以及金融云等)数据中心均受影响。

故障恢复期间,一些用户抱怨由于DNS服务也出现问题,导致无法做故障转移,"想跑都跑不了"。

根据阿里云发布的通知,故障持续了3个多小时后才基本完全恢复:

  • **17:50------**阿里云确认故障原因与某个底层服务组件有关,工程师正在紧急处理中。

  • **18:54------**经过工程师处理,杭州、北京等地域控制台及API服务已恢复,其他地域控制台服务逐步恢复中。

  • **19:20------**工程师通过分批重启组件服务,绝大部分地域控制台及API服务已恢复。

  • **19:43------**异常管控服务组件均已完成重启,除个别云产品(如消息队列MQ、消息服务MNS)仍需处理,其余云产品控制台及API服务已恢复。

  • **20:12------**北京、杭州等地域消息队列MQ已完成重启,其余地域逐步恢复中。

  • **21:11------**受影响云产品均已恢复,因故障影响部分云产品的数据(如监控、账单等)可能存在延迟推送情况,不影响业务运行。

阿里云此次全球性故障的严重程度、影响规模和范围在公有云历史上都极为罕见,严重打击了各行业用户对公有云可靠性和安全性的信心,进一步凸显了Gartner三季度风险报告中强调的"云集中"风险。

相关推荐
rcms1527026921815 小时前
Nikon 4T070-360-1精准控制器模块
网络
金立基胶粘16 小时前
如何利用替塑油推动环保发展?
大数据·安全
数安旭说16 小时前
终端防火墙深度拆解:网络隔离、进程级管控与流量治理的落地避坑指南
网络·数据安全·企业安全·防火墙·终端安全·终端防火墙·违规外联
数智工坊16 小时前
NTIRE2024×4图像超分竞赛综述|Mamba崛起、数据缩放、频域增强成为新趋势
网络·人工智能·深度学习·cnn·机器人
聚美智数17 小时前
网安查询-备案查询-网络安全查询API接口介绍
网络·数据库·web安全
一个向上的运维者17 小时前
Kubernetes 网络三部曲:CNI、kube-proxy 与 CoreDNS 是如何协作的?
网络·容器·kubernetes
2301_8150910118 小时前
TCP 并发服务器模型:4 种 IO 模型完整梳理
服务器·网络·tcp/ip
斑马13918 小时前
Linux软件编程学习笔记(十二)——TCP并发服务器模型
java·服务器·网络
阿里云大数据AI技术18 小时前
数据平台开始“支撑 Agent”:DataWorks Data Agent 如何重构企业数据生产方式
人工智能·阿里云·dataworks·数据平台·data agent
微财经观圈18 小时前
酒店配送机器人如何选型:普渡和优地从安全到场景的全面对比
大数据·安全·机器人