全文检索

for_ever_love__1 天前
java·python·mysql·全文检索·分词·索引·ngram
MySQL 全文索引实战:FULLTEXT、ngram 中文分词与 MATCH AGAINST 到底该怎么用一个模糊查询把接口拖到超时,十有八九是 LIKE '%关键词%' 干的。本篇讲清楚 MySQL 自带的 FULLTEXT 全文索引:它为什么快、中文要怎么分词、 布尔模式怎么写、哪些参数必须改,以及——什么时候你不该用它。
haerapi2 天前
开发语言·python·全文检索
KingbaseES 全文检索实战之前:先建立中文搜索的可解释基线中文分词、GIN 索引和相关性排名是全文检索的三个常见关键词,但把它们接上并不自动得到可用搜索。分词词典、停用词、字段权重、短语规则和排序解释都会改变结果。本文围绕 KingbaseES 全文检索设计一套基线:先固定语料和分析规则,再验证索引覆盖、查询计划与相关性,最后用可回放的样本约束优化方向。
搬砖小趴菜3 天前
大数据·论文阅读·人工智能·全文检索·ai自动写文章
【科研速递】Applied Sciences | 冻融循环作用下玄武岩的三轴力学行为与强度模型:对寒区工程结构的意义【科研速递】Applied Sciences | 冻融循环作用下玄武岩的三轴力学行为与强度模型:对寒区工程结构的意义
Elastic 中国社区官方博客4 天前
java·大数据·数据库·elasticsearch·搜索引擎·全文检索·lucene
使用 Lucene 搜索你的 Bean — 索引作者:来自 Elastic David Pilato在上一篇文章中,我们将 Lucene 添加到了 Maven 中,选择了一个 analyzer,并将 Track Bean 映射为一个可用于搜索的 Lucene Document。这只是故事的一半:你仍然需要一个用于管理索引的小型类 — — 同时,你还应该了解,对于像 bob 这样的 token 来说,“倒排”究竟意味着什么。
Elastic 中国社区官方博客6 天前
大数据·数据库·elasticsearch·全文检索
将你自己的密钥用于现有 Elastic Cloud 部署作者:来自 Elastic Alex Chalkias在运行中的部署中直接添加客户管理的加密密钥,无需重新创建部署。
Elastic 中国社区官方博客6 天前
大数据·运维·数据库·sql·elasticsearch·搜索引擎·全文检索
错误最多的服务运行正常:使用 ES|QL 从日志进行根因分析作者:来自 Elastic Jeffrey Rengifo指标显示三个服务的错误率完全相同,均为 19.1%。针对同一批 4,688 条 OpenTelemetry 日志记录的四条 ES|QL 查询,将 956 条故障链中的 955 条追溯到了其中一个服务,而且无需任何服务依赖模型。
Elastic 中国社区官方博客9 天前
大数据·运维·elasticsearch·全文检索
使用 Jev 作为 search reranker:基准测试与实现方法作者:来自 Elastic Dustin Coates我们让 Jev 为 Elasticsearch hybrid search 结果进行评分,并让一个简短的 Python policy 执行 reranking,在 250 个 Amazon Shopping Queries 上将 nDCG@10 从 0.9351 提升到了 0.9565,所有代码都在这里。
Elastic 中国社区官方博客10 天前
java·大数据·elasticsearch·搜索引擎·贪心算法·kubernetes·全文检索
Kubernetes attributes processor v1:它对 EDOT Collector 意味着什么作者:来自 Elastic Christos Markou高效存储高基数指标,使用 time series data streams,并继续使用你的 Prometheus 和 PromQL 工作流。
Elastic 中国社区官方博客10 天前
大数据·数据库·elasticsearch·搜索引擎·serverless·全文检索
Elasticsearch Serverless 如何通过 hollow shards 将索引节点关闭次数降低 30%作者:来自 Elastic Iraklis Psaroudakis, Eugene Cistiakovas
Elastic 中国社区官方博客10 天前
大数据·运维·数据库·elasticsearch·搜索引擎·全文检索
14 个 alerts,1 个 incident:使用 Elasticsearch 中的 ES|QL 衡量 alerting rule 噪声作者:来自 Elastic Jeffrey Rengifo分组键决定一个 incident 会产生多少个 alerts,而由于 Kibana 会为每个 alert document 添加 rule revision,你可以针对最初导致这些 alerts 的同一个 incident,衡量 alert 噪声的减少程度。
SelectDB技术团队11 天前
大数据·数据库·elasticsearch·搜索引擎·全文检索·日志·apache doris
一条日志两套引擎的账:把 Elasticsearch 检索与分析合并到同一份数据的落地写法摘要:日志既要关键词检索又要多维聚合时,常见做法是 ES + 分析库双写双存。第三方公开基准给出了一组可直接对照的数字:在 1 亿行 observation、m6i.8xlarge(32 vCPU / 128 GiB / gp3)同规格环境下,Apache Doris hot 场景 slowdown x1.14,相比 ES / OpenSearch 快约 3 倍,cold 场景 x1.60(ES x1.65),存储占用 57.94 GiB(AgentLogsBench,2026 年 5 月,定期更新)。本
Elastic 中国社区官方博客11 天前
大数据·开发语言·人工智能·elasticsearch·搜索引擎·全文检索·lucene
使用 Lucene 搜索你的 Bean —— Elasticsearch作者:来自 Elastic David Pilato我们完成了 Bean 的映射,拥有一个 writer,输入了 Bob,筛选了 Club,统计了 facets,提供了前缀建议,并绘制了搜索结果。这就是 JVM 旁边的 Lucene。
金士镧厦门新材11 天前
全文检索
第2期|抑烟剂到底是什么?那么,抑烟剂到底是什么?简单来说,抑烟剂是一类用于降低或调控材料在受热、热解和燃烧过程中烟气生成与释放的功能性助剂。
SelectDB技术团队11 天前
大数据·python·clickhouse·elk·elasticsearch·全文检索·复杂查询
Agent Trace 数据底座建设:宽表建模、全文检索与成本聚合的配置与验证步骤摘要:Agent Trace 的数据形态与传统应用日志不同:单条记录长度从几百字节到 1 MB 不等,JSON 路径随工具与模型迭代持续新增,排查过程同时依赖全文检索与多维聚合。本文给出基于 Apache Doris 的完整落地配置:建表 DDL(VARIANT 列 + 倒排索引 + 宽表存储格式 V3)、索引与存储参数逐项说明、Stream Load 写入配置、search() 的 TERM + PHRASE + NOT 组合写法与 NESTED 数组检索写法、检索与成本聚合同语句写法,以及五项可执行的
Elastic 中国社区官方博客11 天前
大数据·数据库·elasticsearch·搜索引擎·全文检索·安全威胁分析
使用 NVIDIA cuVS 在 Elasticsearch 中实现 GPU 加速的向量索引:在 10 分钟内处理 1.38 亿个向量作者:来自 Elastic Bao Tong, Manas Singh, Corey Nolet将索引构建任务转移到 GPU 后,CPU 可以空出来处理查询,因此向量索引吞吐量提升了 7 倍,在索引运行期间 p90 搜索延迟降低了 6 倍,同时召回率没有变化。
小林ixn12 天前
sql·elasticsearch·全文检索·agent·关键词
从 MySQL 的 LIKE 到 ES 倒排索引:一次把全文检索和混合检索讲透做后端的朋友大概率都遇到过这个场景:产品经理跑过来跟你说,“能不能给文章加个搜索功能?就按内容搜,跟百度那样。”
Elastic 中国社区官方博客12 天前
大数据·数据库·spring boot·elasticsearch·搜索引擎·全文检索·prometheus
两个依赖和一个配置块:通过 Prometheus 远程写入将 Spring Boot 指标发送到 Elasticsearch作者:来自 Elastic Christoph HegerPrometheus 远程写入会将 Micrometer 的 Actuator 指标转发到 Elasticsearch 时序数据流中。JVM 堆、请求延迟、GC 暂停时间和 HikariCP 活动都可以通过 ES|QL 进行查询,而且无需在其旁边运行任何新的组件。
SelectDB技术团队12 天前
大数据·clickhouse·elk·elasticsearch·全文检索·复杂查询·实时更新
ELK 太占磁盘、ES 总报写入拒绝:从归因到可执行的优化清单【摘要】ELK 集群的两个高频故障——磁盘占用持续上涨、写入报拒绝——往往同源:索引开销被低估、写入批太小、副本重复构建。本文先给出 Elasticsearch 侧的归因方法与可调整项(字段索引范围、best_compression、refresh_interval、副本、ILM 与磁盘水位线),再给出 Apache Doris 侧的对应解法:单副本导入、时序 Compaction、攒批与参数配置。文中所有性能与成本数字均带场景前提与出处,包含中信信用卡中心、网易的实测数据,以及可复现第三方基准 Agen
乐迪绘防伪油墨技术分享13 天前
全文检索
水性刮刮银油墨印刷工艺解析:遮盖力与刮感的参数平衡水性刮刮银油墨是刮刮墨系列中以水为分散介质的功能性产品,印刷干燥后形成银灰色可刮除遮盖层,轻刮即可露出底层图文。相比溶剂型体系,水性刮刮银 VOC 含量低、气味温和,在儿童画本、促销卡、密码标签等场景中应用广。本文从成膜原理、应用场景、印刷工艺要点三个维度展开,附常见故障排查方法。
Elastic 中国社区官方博客19 天前
大数据·数据库·elasticsearch·搜索引擎·全文检索·jina
jina-ocr-v1:在低成本 GPU 上实现更快速的文档解析作者:来自 Elastic https://jina.ai/reader一个 34 亿参数的混合专家文档解析器,每个 token 仅激活 5.7 亿个参数。它读取页面图像,并通过单次处理返回包含文本、公式、表格和阅读顺序的 Markdown。jina-ocr-v1 是一个拥有 34 亿参数、每次激活 5.7 亿参数的视觉语言模型,在 OmniDocBench v1.6 上得分 91.1,在 olmOCR-Bench 上得分 83.4。