记一次RocketMQ Netty通信频繁出现 IDLE exception问题排查及修复

这里是小奏 ,觉得文章不错可以关注公众号小奏技术

RocketMQ version

  • 5.1.0

背景

  1. 线上RocketMQ偶尔出现从Nameserve获取元数据TimeOut
java 复制代码
TopicPublishInfo topicPublishInfo = this.tryToFindTopicPublishInfo(msg.getTopic());

之前排查过一次,可以参考线上RocketMQ偶发sendDefaultImpl call timeout问题排查及优化方向总结:mp.weixin.qq.com/s/bPxq-knvO...

  1. 查看Nameserve发现打印大量NETTY CLIENT PIPELINE: IDLE exceptionlog

初步解决方案

最开想的是既然超时了,那就直接增加超时时间,优先让程序正常运行。

client增加如下配置

java 复制代码
producer.setSendMsgTimeout(8000);

实际早起出现过类似的问题,超时时间由默认3s调整为5s了。现在暂时调整为8s看能不能解决这个问题

实际结果是增加了超时时间还是会出现TimeOut问题

由于之前分析过出现sendDefaultImpl call timeout 是还没发送消息就超时了,所以这里重点关注Nameserve

问题排查

通过阅读源码发现几个问题

  1. client会定时去扫描所有Nameserve并与所有Nameserve建立连接
java 复制代码
            int connectTimeoutMillis = this.nettyClientConfig.getConnectTimeoutMillis();
            TimerTask timerTaskScanAvailableNameSrv = new TimerTask() {
                @Override
                public void run(Timeout timeout) {
                    try {
                        NettyRemotingClient.this.scanAvailableNameSrv();
                    } catch (Exception e) {
                        LOGGER.error("scanAvailableNameSrv exception", e);
                    } finally {
                        timer.newTimeout(this, connectTimeoutMillis, TimeUnit.MILLISECONDS);
                    }
                }
            };
            this.timer.newTimeout(timerTaskScanAvailableNameSrv, 0, TimeUnit.MILLISECONDS);
  1. 但是client并不会主动给Nameserve发送心跳
  2. netty通信模块clientserver都配置了空闲检测
  • client
  • server

Netty心跳检测机不熟悉的朋友可以参考我之前的文章 Netty心跳检测机制实战(附源码):mp.weixin.qq.com/s/-luniYo8v...

  1. nameserver只会定时30s从单个Nameserve获取元数据,这个操作也就是充当了clientNameserve的心跳机制
java 复制代码
        this.scheduledExecutorService.scheduleAtFixedRate(() -> {
            try {
                MQClientInstance.this.updateTopicRouteInfoFromNameServer();
            } catch (Exception e) {
                log.error("ScheduledTask updateTopicRouteInfoFromNameServer exception", e);
            }
        }, 10, this.clientConfig.getPollNameServerInterval(), TimeUnit.MILLISECONDS);

问题定位

经过上面的源码分析就很清晰了。我们这里举例说明

现在比如有三个服务orderproducerpay

nameserver有三个节点Nameserve-aNameserve-bNameserve-c

  • order 连接 Nameserve-a ,与 Nameserve-bNameserve-c 频繁触发NETTY CLIENT PIPELINE: IDLE exception。, Nameserve-bNameserve-c为此产生大量 NETTY CLIENT PIPELINE: IDLE exception,然后触发频繁的断线重连

  • producer 连接 Nameserve-b ,与 Nameserve-aNameserve-c 频繁触发NETTY CLIENT PIPELINE: IDLE exception。, Nameserve-aNameserve-c为此产生大量 NETTY CLIENT PIPELINE: IDLE exception,然后触发频繁的断线重连

  • pay 连接 Nameserve-c ,与 Nameserve-aNameserve-b 频繁触发NETTY CLIENT PIPELINE: IDLE exception。, Nameserve-aNameserve-b为此产生大量 NETTY CLIENT PIPELINE: IDLE exception,然后触发频繁的断线重连

如何修复

定位到问题之后就很好修复了。

实际我们client并不需要与所有nameserver建立连接,仅与单个nameserver建立连接即可。

如果单个nameserver挂了,client会自动切换到其他nameserver

相关代码

所以修复方式很简单,我们不让client与所有nameserver建立连接,仅与单个nameserver建立连接即可

相关修复pr: github.com/apache/rock...

相关推荐
Warren9841 分钟前
Java面试八股Spring篇(4500字)
java·开发语言·spring boot·后端·spring·面试
背帆1 小时前
go的interface接口底层实现
开发语言·后端·golang
IT成长史2 小时前
deepseek梳理java高级开发工程师springboot面试题2
java·spring boot·后端
qq_266348732 小时前
springboot AOP中,通过解析SpEL 表达式动态获取参数值
java·spring boot·后端
bing_1583 小时前
MQTT 在Spring Boot 中的使用
java·spring boot·后端·mqtt
阑梦清川6 小时前
关于Go语言的开发环境的搭建
开发语言·后端·golang
lyrhhhhhhhh6 小时前
Spring 模拟转账开发实战
java·后端·spring
tonngw6 小时前
【Mac 从 0 到 1 保姆级配置教程 12】- 安装配置万能的编辑器 VSCode 以及常用插件
git·vscode·后端·macos·开源·编辑器·github
noravinsc7 小时前
InforSuite RDS 与django结合
后端·python·django
Brookty8 小时前
【MySQL】基础知识
后端·学习·mysql