elasticsearch CPU居高不下的问题排查

elasticsearch CPU居高不下的问题排查

问题发现

某天早上收到钉钉消息,ES集群CPU负载很高,赶快上控制台看了一下发现都飚到90多了,下面的图片是算的一段时间的平均值,所以显示CPU使用80左右,实际上很长一段时间都是90多了

问题排查

首先先看了一下查询写入的QPS,发现并没有特别高,接着看了一下那段时间的慢查询,因为是用的阿里云的ES服务,所以在控制台用下面的语句就能查询3s以上的慢查询了。查询后发现下面的has_child子文档查询很多,由此可以判断出应该是某个业务场景使用了大量的子文档查询。

vbnet 复制代码
search_time_ms: [3000.0 TO *]

问题解决

排查了一下业务代码,发现有一处使用多线程进行了子文档查询,查询的数据比较少的时候还能抗住,这也是当时测试能通过的原因。但是今天查询的数据量很大的时候就崩溃了,然后紧急修复了业务代码,去掉了多线程。

但是现在还有一个问题,怎么快速把ES的CPU降下去,减少对线上的影响? 了解得知,可以通过kill掉比较耗CPU的任务来实现,命令如下

查询对应的任务: actions=search是过滤出与索引搜索相关的任务

ini 复制代码
GET _tasks?detailed=true&actions=search

然后取消掉对应的任务就好了:

javascript 复制代码
POST _tasks/<task_id名>:<任务ID号>/_cancel

问题总结

个人认为,如果ES有相应的高性能计算节点,子文档查询可以使用,但是在集群性能不高的情况下,子文档查询还是尽量避免使用吧,因为这种子文档查询在大批量或者多线程的查询下很容易就会导致CPU飙升,这种的风险还是挺高的。除了子文档其实还有其他的解决方案,例如在数据层面进行处理,冗余相应的字段,也可以做到子文档的效果

相关推荐
jonyleek5 小时前
企业文档私有化实践:基于JVS数字底座的可控协同架构设计与落地要点
elasticsearch·私有化部署·springcloud·微服务架构·信创适配·jvs·企业文档
深海鱼肝油ya9 小时前
向量数据库Elasticsearch(二)介绍&安装&常用操作
人工智能·elasticsearch·kibana·向量数据库·文档操作·索引操作·域的属性
汽车网络安全爱好者12 小时前
AI应用(四)之 AI 编程全流程
大数据·人工智能·elasticsearch
Elasticsearch1 天前
jina-ocr-v1:一个支持布局、表格、数学公式和 100 多种语言的 OCR 模型
elasticsearch
先吃饱再说1 天前
为什么 MySQL 的 LIKE 查询这么慢?Elasticsearch 倒排索引完全解析
elasticsearch·agent
Elastic 中国社区官方博客2 天前
列式存储并不等同于列式数据库。Columnar 模式为 Elasticsearch 带来了什么
大数据·运维·数据库·elasticsearch·搜索引擎
Elasticsearch2 天前
一个按钮,三个位置:我们如何通过更严格的 API 重构 Kibana 的页面页眉
elasticsearch
Elasticsearch2 天前
信任,但要进行基准测试:我们如何让 AI agent 优化 Elasticsearch
elasticsearch
艾莉丝努力练剑2 天前
【Git:综合复盘】Git 原理与使用
大数据·人工智能·git·elasticsearch·面试
Elasticsearch3 天前
列式存储并不等同于列式数据库。Columnar 模式为 Elasticsearch 带来了什么
elasticsearch