RocketMQ5.0 线上集群部署一定要注意这个OOM问题

这里是weihubeats ,觉得文章不错可以关注公众号小奏技术,文章首发。拒绝营销号,拒绝标题党

RocketMQ 版本

  • 5.1.0

背景

测试环境的RocketMQ总会在运行一段时间后,莫名其妙就挂掉,刚开始以为就是简单的内存不够导致的

因为测试环境给的资源不多,但是时间久了总需要重启也麻烦。总会影响测试环境,所以打算排查一下解决掉。

增加内存

开始的解决方式是增加内存,由原先的4g增加到8g,结果还是OOM,这里就怀疑可能是RocketMQ有bug导致的

OOM log分析

RocketMQ的OOM log默认是保存在distribution/target/rocketmq-xxx/rocketmq-xxx目录下

文件名称hs_err_pid1879893.log

这里给大家推荐一个OOM的log分析平台,目前是免费的

gceasy.io/?tdsourceta...

我们在Active Thread中看到所有的线程数有32380个线程,明显是不正常的

看样子还想继续增加,所以很明显就是RocketMQbug

那么为什么会创建如此多的FlowMonitor线程呢

问题定位

首先我们看看是哪里创建FlowMonitor这个线程的

可以看到主要是在创建AutoSwitchHAConnection对象的时候对FlowMonitor对象进行创建的,这里的FlowMonitor线程还没有启动

何时创建AutoSwitchHAConnection

跟随代码我们可以很快发现是在NIOSelector接受网络请求的时候就会创建一个AutoSwitchHAConnection

创建完AutoSwitchHAConnection会执行conn.start();

其中start就会启动flowMonitor线程

我们查看masterslave的log也能看到masterslave有大量的连接log

  • master
java 复制代码
2023-09-13 20:31:15 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:56700
2023-09-13 20:31:22 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:56714
2023-09-13 20:31:29 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:59700
2023-09-13 20:31:36 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:36956
2023-09-13 20:31:43 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:36972
2023-09-13 20:31:50 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:48866
2023-09-13 20:31:57 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:56400
2023-09-13 20:32:04 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:36922
2023-09-13 20:32:11 INFO AutoSwitchAcceptSocketService - HAService receive new connection, /192.168.1.172:36926
  • slave
java 复制代码
2023-09-14 03:17:32 INFO AutoSwitchHAClient - AutoSwitchHAClient connect to master 192.168.1.171:30922
2023-09-14 03:17:39 INFO AutoSwitchHAClient - AutoSwitchHAClient connect to master 192.168.1.171:30922
2023-09-14 03:17:46 INFO AutoSwitchHAClient - AutoSwitchHAClient connect to master 192.168.1.171:30922
2023-09-14 03:17:53 INFO AutoSwitchHAClient - AutoSwitchHAClient connect to master 192.168.1.171:30922
2023-09-14 03:18:00 INFO AutoSwitchHAClient - AutoSwitchHAClient connect to master 192.168.1.171:30922
2023-09-14 03:18:07 INFO AutoSwitchHAClient - AutoSwitchHAClient connect to master 192.168.1.171:30922
2023-09-14 03:18:14 INFO AutoSwitchHAClient - AutoSwitchHAClient connect to master 192.168.1.171:30922

修复问题

可以看到主要是主从连接断开后没有销毁flowMonitor线程。所以我们修改下NIO的连接关闭代码即可

相关代码可以查看这个pr

总结

目前来看5.1.0之前的版本可能都有这个问题。所以大家在实际使用的时候一定要注意自己的RocketMQ这个bug是否修复了.

不过影响说大不大,说小不小。因为masterslave频繁建立连接本身也有问题

相关推荐
Victor35613 小时前
MongoDB(118)如何在升级过程中进行数据备份?
后端
手握风云-13 小时前
Spring AI:让大模型住进 Spring 生态(三)
java·后端·spring
Victor35613 小时前
MongoDB(117)如何从旧版本迁移到新版本?
后端
pe7er16 小时前
window管理开发环境篇 - 持续更新
前端·后端
陈随易21 小时前
有生之年系列,Nodejs进程管理pm2 v7.0发布
前端·后端·程序员
陈随易1 天前
AI时代,你还在坚持手搓文章吗
前端·后端·程序员
大鱼七成饱1 天前
VMware NAT模式下固定内网IP(附详细图文)
后端
IT_陈寒1 天前
Vue的这个响应式陷阱,我debug了一整天才爬出来
前端·人工智能·后端
兔子零10241 天前
手把手教你在 Claude Code 中接入 DeepSeek-V4
后端
phenhorlin1 天前
我做了个工具,让切换 Homebrew 镜像像切 npm 源一样简单
后端·shell