程序员黑话之故障专辑(中英文对照版)

去年出过一期「程序员黑话集」,一直想着更新一季,正好最近业内接连发生了几起影响比较大的故障,那我们就专门做一期「故障专辑」吧。

故障

故障有好几种叫法,比较正式的

  • 故障 - Outage
  • 事故 - Incident

不怎么严重的,时间很短的

  • 抖了一下 - Jitter(多用于网络)
  • Hiccup (中文翻译是打了个嗝,不过中文里貌似没有这个讲法)

通俗点的说法

  • 挂了/崩了- Down

500

当在请求某个网络资源时,服务器内部发生错误时,返回的错误编号。扩展为系统发生内部故障。

变更

虽然突然的流量暴涨,或者光缆被挖断,数据中心着火,被雷劈都有可能,但绝大多数时候,故障都是变更导致的。

变更分为三大类:

  • 代码变更 - Code Change
  • 配置变更 - Config Change
  • 数据库变更 - Database Change

左移 (shift-left)

降低变更风险的一个方法,就是做变更前检查,问题越早发现越好。因为变更的流水线是从左往右画的,起点在左边。所以左移就是把检查尽量靠近起点。

金丝雀 (Canary)

以前矿工下井,会带一只金丝雀,如果井下空气出现状况,更敏感的金丝雀会先有异常。这个概念也带到了软件研发里。会循序渐进地做变更。另外一种叫法是灰度 (Grayscale)。

单元化/区域化 (Regionalization)

在互联网公司逐渐普及的架构,主要由 AWS 发扬光大,把服务进行隔离。

爆炸半径 (Blast Radius)

金丝雀和单元化都是为了降低爆炸半径,减少故障的影响面。

值班 (On-call)

也叫 Carry the pager。以前带着的传呼机叫做 Pager。现在传呼机被手机/软件取代了,但 Pager 这个名字沿用了下来。

复盘 (Postmortem)

原义是尸检报告。在软件研发领域,指详细的故障分析报告。

惊群 (Thundering Herd)

打雷后,动物一下子被惊醒了,到处乱窜,造成混乱。在故障恢复阶段要小心的问题,很容易刚拉起一个服务,立马又被积压的请求打挂。

结语

船停在港口是最安全的,但那不是造船的目的。软件需要持续的变更迭代,变更就有风险。但研发团队可以通过引入工具,来降低风险,针对一开始变更的三种类型,市面上也有成熟的开源方案: 代码变更 - 老牌的有 Jenkins,新兴的有 Drone CI 和 Zadig

配置变更 - Apollo

数据库变更 - Bytebase

🍀好运!


💡 更多资讯,请关注 Bytebase 公号:Bytebase

相关推荐
C语言Plus10 分钟前
C++ SqlBuilder一个简单、灵活且类型安全的 C++ SQL 构建器库
数据库·sql·安全·c++20
喝茶与编码13 分钟前
真实业务场景:高并发 Upsert 死锁频发?InnoDB 锁机制与重试机制深度解析
数据库·python
BreezeJiang19 分钟前
做完 AI 日记本后,我终于理解了:向量数据库不是用来替代 MySQL 的
数据库
VALENIAN瓦伦尼安教学设备23 分钟前
转子/行星/平行轴齿轮箱综合故障模拟实验台可复现常见机械问题
大数据·数据库·人工智能·嵌入式硬件·算法
不好听61327 分钟前
向量数据库:Milvus 与 MySQL 的本质差异
数据库
用户0942485680339 分钟前
第18章:Mongo复制集运维——故障切换、节点扩容与数据重同步
数据库·mongodb
智码看视界1 小时前
Day33-数据层 × 中间件AI化篇:Redis缓存经典问题-击穿、穿透、雪崩的终极解决方案
数据库·redis·缓存·中间件·穿透·雪崩·击穿
会编程的土豆1 小时前
功能详解 01 · 用户注册:从表单到数据库一行
开发语言·数据库·后端·mysql·golang
夏贰四1 小时前
数据资产平台如何落地企业数据分级合规管控?数据资产平台怎样满足行业数据监管审查要求?
大数据·数据库·人工智能
吴声子夜歌1 小时前
MongoDB 4.2——聚合框架
数据库·mongodb