业务代码写不好直接把RabbitMQ干崩了

最近做了一次技术改造,由于对业务细节的不熟悉,开发代码细节处理不好,导致出了线上事故,把线上的服务和RabbitMQ内存都打满了。

事故回顾

  1. 中午11点左右业务人员反映系统异常,无法操作使用。
  2. 随后前台门户网站部分功能访问异常
  3. 开发人员进行紧急排查,发现是mq挤压
  4. 11点半左右,后台A服务所有副本已处于瘫痪状态,各种操作都是超时。
  5. 12点16左右紧急处理完问题上线服务,把挤压数据处理掉,线上服务逐渐恢复正常

原因剖析

1、生产者在推送mq消息的时候推送发布时间字段是空,导致queue消费端一直消费失败,消费者是开启自动ack,消费失败后又回到queue,接着再被消费,变成死循环,造成消息积压,导致rabbitmq机器内存一直在增长,吞吐量下降。 错误代码 错误日志: 2、因为queue消息积压内存持续增长,处理消息能力下降。生产者推送消息也要很久才会被ack确认。生产者的推送线程长时间处于阻塞状态,越来越多线程阻塞住,生产者也会被逐渐被拖垮。

生产者接口调用:

后续处理

迅速进行了线上服务回滚,保证了系统可用。相关开发人员根据问题定位做又一次迭代优化。 对于这种小架构级别的改动还是详细调用业务,梳理业务流程,画业务流程图,以方便测试人员针对性测试.

相关推荐
库库林_沙琪马9 分钟前
REST接口幂等设计深度解析
spring boot·后端
IT_陈寒12 分钟前
Redis性能提升50%的7个关键优化策略,90%开发者都不知道第5点!
前端·人工智能·后端
智商偏低17 分钟前
ASP.NET Core 身份验证概述
后端·asp.net
冷冷的菜哥17 分钟前
ASP.NET Core使用MailKit发送邮件
后端·c#·asp.net·发送邮件·mailkit
canonical_entropy35 分钟前
XDef:一种面向演化的元模型及其构造哲学
后端
小林coding1 小时前
再也不怕面试了!程序员 AI 面试练习神器终于上线了
前端·后端·面试
lypzcgf1 小时前
Coze源码分析-资源库-删除插件-后端源码-错误处理与总结
人工智能·后端·go·coze·coze源码分析·ai应用平台·agent平台
文心快码BaiduComate1 小时前
WAVE SUMMIT深度学习开发者大会2025举行 文心大模型X1.1发布
前端·后端·程序员
SamDeepThinking1 小时前
在Windows 11上配置Cursor IDE进行Java开发
后端·ai编程·cursor
知其然亦知其所以然1 小时前
面试官微笑发问:第100万页怎么查?我差点当场沉默…
后端·mysql·面试