🔥🔥双十一,阿里云又双叒出问题了

阿里云又挂了

就在双十一热火朝天的进行时,阿里云又双叒出问题了

为什么说又,因为就在不久前,语雀就因为云服务问题出现了故障,在8小时后才得以恢复。 但这次故障影响的范围较上次相比就大得多了,不但语雀出现了问题,淘宝、钉钉等APP均收到了影响,许多依赖阿里云的产品也受到了影响。 "淘宝又崩了""闲鱼崩了" "阿里云盘崩了""钉钉崩了" 等话题陆续登上热搜。知道的以为云服务出现了问题,不知道的还以为马云跑路了。

不久后阿里云发布公告,确定了影响的范围

大约在8点左右,服务陆续恢复

不知道是否有了上次的经验,这次修复问题的速度快了很多。只用的三个小时就修复了问题。 上次语雀出现了问题,给广大用户赠送了会员,不知道这次故障又能给大家带来多少"福利"。

如何处理故障

说完阿里,要是真是我们在实际遇到了这种问题改怎么处理呢

  1. 首先我们要确认故障发生的原因,有可能虽然是我们负责的服务在不停的报错,但问题的根源不在我们这里,这时我们要及时的向上反馈,找到上游的同学,共同确定问题的原因
  2. 如果在修改配置或上线代码后发生了报错,不要想 首要的就是将配置或代码回滚,恢复问题比确认原因更加重要,问题可以下来后慢慢复盘,但对用户造成的影响是很大的。
  3. 如果自己掌控不住局面或者确定不了原因,及时摇人。还是那句话,优先解决问题,其他的都是次要的。
  4. 如果确定了问题的原因,及时向上级和受影响的团队说明原因,千万不要闷头一直干,每当有进展及时通报。在制定修复的临时方案时也最好拉上团队的小伙伴,避免二次问题。每次刷数据或者修改的代码上线前一定要第二个人review,不然忙中出错就更是添乱。如果时间充裕,能有测试同学帮忙测试那是最好的。
  5. 在问题解决后,也要总结经验教训,无论是好的还是坏的。这对我们都是一次成长,做的好的地方在团队内可以推广,形成制度规范。做的坏的也找原因,避免下次出现同样的问题。

尾声

有一说一,阿里的技术能力在国内也是数一数二的,但在近期却频繁发生这样的问题,不仅是对自身产品的不负责,更是对广大用户的不负责。异地多活这种不应该只出现在面试中,更应该在实际中落地。作为技术开发者,任何时候都要对系统保持敬畏之心,一个小小bug就可能导致业务上的重大损失。

相关推荐
QX_hao2 小时前
【Go】--反射(reflect)的使用
开发语言·后端·golang
小坏讲微服务2 小时前
Docker-compose 搭建Maven私服部署
java·spring boot·后端·docker·微服务·容器·maven
yuuki2332332 小时前
【数据结构】用顺序表实现通讯录
c语言·数据结构·后端
你的人类朋友3 小时前
【Node】手动归还主线程控制权:解决 Node.js 阻塞的一个思路
前端·后端·node.js
史不了3 小时前
静态交叉编译rust程序
开发语言·后端·rust
余—笙4 小时前
Linux(docker)安装搭建CuteHttpFileServer/chfs文件共享服务器
linux·服务器·docker
lang201509284 小时前
Linux高效备份:tar与gzip完全指南
linux·运维·服务器
码事漫谈4 小时前
C++中的多态:动态多态与静态多态详解
后端
码事漫谈4 小时前
单链表反转:从基础到进阶的完整指南
后端