高并发架构实战 Day44

ELK基本都用过,一条日志在入库时,它的具体内容并不会被真实保存在倒排索引中。 在日志入库之前,会先进行分词,过滤掉无用符号等分隔词,找出文档中每个关键词(Term)在文档中的位置及频率权重;然后,将这些关键词保存在 Term Index 以及 Term Dictionary 内;最后,将每个关键词对应的文档 ID 和权重、位置等信息排序合并到 Posting List 中进行保存。通过上述三个结构就实现了一个优化磁盘 IO 的倒排索引。 而查询时,Elasticsearch 会将用户输入的关键字通过分词解析出来,在内存中的 Term Index 单词索引查找到对应 Term Dictionary 字典的索引所在磁盘的 block。接着,由 Term Dictionary 找到对关键词对应的所有相关文档 DocId 及权重,并根据保存的信息和权重算法对查询结果进行排序返回结果。

相关推荐
用户8356290780519 分钟前
使用 Python 对 Excel 工作表进行排序
后端·python
用户83562907805137 分钟前
使用 Python 合并 PowerPoint 演示文稿
后端·python
掘金者阿豪1 小时前
数据同步软件技术实践:从异构数据库迁移到实时数据流转,解析电科金仓KFS架构设计
后端
ServBay1 小时前
不会写代码,如何搭建自己的 AI 自动化工作流
后端·aigc·ai编程
天远大数据1 小时前
从调用账单到业务回执:Agent单位成本核算实践
人工智能·后端
沐言人生2 小时前
又一个神级考公脑库-22,375篇真题终于按考点整理了
后端·面试
xn71332 小时前
EmbeddingGemma 2 270M 实测:278 Chunk、32 个查询与 RRF 反例
人工智能·后端·架构
丨只要微微辣2 小时前
从前端到后端:第一次把项目部署 上云的完整实战(含踩坑实录)
后端
newerp2 小时前
Execution Trace 深入实战:可视化调度与系统停顿分析
后端·程序员·go
Lambert2812 小时前
SAA 停摆的答案:前团队的 ARGI 我上手跑了一遍,缝了三针才跑通
后端·openai·ai编程