ElasticSearch常用优化点

  1. 关闭交换分区:因为Linux采用了三级页表虚存管理,关闭交换分区可以减少系统IO,页面换入唤出时所耗费的总线时间以及减少系统中断次数;swap的使用会显著增加延迟和降低吞吐量。
  2. 文件描述符配置:任何网络应用都需要增加文件描述符的数量,默认进程的文件描述符是1024. 我们进行网络IO,打开文件,管道,内存映射等操作都需要文件描述符资源;一般调整到65532;
  3. JVM内存设置: max(节点系统内存/2, 32G),因为JVM有一项技术叫指针压缩技术,如果地址大于4字节的,无法压缩到4字节,只能用8个字节存放地址,造成内存浪费,另外,内存越大,从概率上来讲,GC的effort越大,时间越长。另外,真正在工作的是Lucene分片,也需要给他预留足够的内存;
  4. mlock技术:用C语言写过服务的同学队mlock这个系统调用应该不会感到陌生,这个可以使得堆内存被锁定,不被MMU进行换入唤出,对高并发服务端系统这个是必须的,就像我们对于一些高并发的C语言系统,需要自己使用伙伴算法和slab/slob内存管理算法管理内存;
  5. 线程池和队列大小:ES并发处理请求的能力,根据业务自行调整,不建议非常大;
  6. 建索引:不建议大报文频繁建索引,可以把写入过程理解为一次embeding,只不过我们用的是非常简单的TF-IDF算法,分词越多,生成的倒排索引规模越大,对性能消耗越大,对于一些复杂的embeding算法,更加建议使用向量数据库。一般只对需要搜索的字段建索引,然后由上层应用去聚合输出;
  7. 根据业务优先级,紧急程度,使用队列消峰限速写入ES;
相关推荐
Rosanci6 小时前
谷歌浏览器插件开发实战指南:从 Hello World 到上架发布
大数据·人工智能·chrome·程序人生
m0_466525297 小时前
云从科技上线云起ModelHub:AI团队时代的模型算力基础设施
大数据·人工智能·科技
蓝速科技8 小时前
会议室门牌公告通知发布选型与落地指南丨蓝速科技
大数据·运维·数据库·人工智能·科技
SelectDB11 小时前
同等资源下 Apache Doris 4.2 vs StarRocks 4.1.1:1TB SSB 与 TPC-H 性能实测
大数据·数据库·数据分析
SelectDB12 小时前
Doris vs ClickHouse:企业 OLAP 走向下一阶段,两种技术路线如何选择
大数据·数据库·数据分析
vx-程序开发12 小时前
【计算机毕设】django校园跑腿服务系统83141
java·数据库·vue.js·spring boot·spring·elasticsearch·django
当下新鲜事12 小时前
脱硫脱硝塔动力系统科普:四方DL500变频器工作原理解析
大数据·运维·物联网·业界资讯
珠海西格电力12 小时前
零碳园区管理系统“智慧大脑”功能对园区运营成本的影响有哪些?
大数据·人工智能·安全·系统架构·能源
发量惊人的中年网工13 小时前
2026年DDoS防护方案怎么选?从攻击响应、清洗位置到成本账单,解析全球高防方案
大数据·网络·安全·ddos
Elasticsearch13 小时前
jina-ocr-v1:在低成本 GPU 上实现更快速的文档解析
elasticsearch