🔥🔥双十一,阿里云又双叒出问题了

阿里云又挂了

就在双十一热火朝天的进行时,阿里云又双叒出问题了

为什么说又,因为就在不久前,语雀就因为云服务问题出现了故障,在8小时后才得以恢复。 但这次故障影响的范围较上次相比就大得多了,不但语雀出现了问题,淘宝、钉钉等APP均收到了影响,许多依赖阿里云的产品也受到了影响。 "淘宝又崩了""闲鱼崩了" "阿里云盘崩了""钉钉崩了" 等话题陆续登上热搜。知道的以为云服务出现了问题,不知道的还以为马云跑路了。

不久后阿里云发布公告,确定了影响的范围

大约在8点左右,服务陆续恢复

不知道是否有了上次的经验,这次修复问题的速度快了很多。只用的三个小时就修复了问题。 上次语雀出现了问题,给广大用户赠送了会员,不知道这次故障又能给大家带来多少"福利"。

如何处理故障

说完阿里,要是真是我们在实际遇到了这种问题改怎么处理呢

  1. 首先我们要确认故障发生的原因,有可能虽然是我们负责的服务在不停的报错,但问题的根源不在我们这里,这时我们要及时的向上反馈,找到上游的同学,共同确定问题的原因
  2. 如果在修改配置或上线代码后发生了报错,不要想 首要的就是将配置或代码回滚,恢复问题比确认原因更加重要,问题可以下来后慢慢复盘,但对用户造成的影响是很大的。
  3. 如果自己掌控不住局面或者确定不了原因,及时摇人。还是那句话,优先解决问题,其他的都是次要的。
  4. 如果确定了问题的原因,及时向上级和受影响的团队说明原因,千万不要闷头一直干,每当有进展及时通报。在制定修复的临时方案时也最好拉上团队的小伙伴,避免二次问题。每次刷数据或者修改的代码上线前一定要第二个人review,不然忙中出错就更是添乱。如果时间充裕,能有测试同学帮忙测试那是最好的。
  5. 在问题解决后,也要总结经验教训,无论是好的还是坏的。这对我们都是一次成长,做的好的地方在团队内可以推广,形成制度规范。做的坏的也找原因,避免下次出现同样的问题。

尾声

有一说一,阿里的技术能力在国内也是数一数二的,但在近期却频繁发生这样的问题,不仅是对自身产品的不负责,更是对广大用户的不负责。异地多活这种不应该只出现在面试中,更应该在实际中落地。作为技术开发者,任何时候都要对系统保持敬畏之心,一个小小bug就可能导致业务上的重大损失。

相关推荐
你的人类朋友1 小时前
✍️【Node.js程序员】的数据库【索引优化】指南
前端·javascript·后端
玩转4G物联网4 小时前
零基础玩转物联网-串口转以太网模块如何快速实现与MQTT服务器通信
服务器·物联网·网络协议·tcp/ip·信息与通信·iot·fs100p
爬呀爬的水滴4 小时前
解决Ubuntu24.04版本,右键没有共享选项的问题
linux·服务器·ubuntu·samba·共享文件夹
雾岛心情5 小时前
【黑客与安全】Linux的常用命令之系统架构信息获取系列命令
linux·运维·服务器
why技术6 小时前
翻译翻译,什么叫“编程专用”的显示器?
前端·后端
卫生纸不够用6 小时前
(三)Linux性能优化-CPU-CPU 使用率
linux·运维·服务器
野生技术架构师7 小时前
SpringBoot集成Tess4j :低成本解锁OCR 图片识别能力
spring boot·后端·ocr
天天摸鱼的java工程师7 小时前
要在 Spring IoC 容器构建完毕之后执行一些逻辑,怎么实现
后端
程序猿小D7 小时前
第25节 Node.js 断言测试
后端·node.js·log4j·编辑器·vim·apache·restful