全文检索

Elastic 中国社区官方博客2 天前
大数据·sql·elasticsearch·搜索引擎·全文检索
驯服 PUNKs:ES|QL 如何查询 Elasticsearch 从未被告知的字段作者:来自 Elastic Alexander Spies在 Elasticsearch 9.5 中,ES|QL 可以查询未映射的字段。它会从 _source 中读取这些字段,或者返回 null,因此即使某个字段从映射中消失,查询仍然可以正常工作,从而避免需要数小时的重新索引。
Elastic 中国社区官方博客3 天前
大数据·数据库·人工智能·elasticsearch·搜索引擎·ai·全文检索
搜索倍增器:推动收入、生产力和 AI 实现规模化作者:来自 Elastic Nicole Volk组织通过 AI 驱动的搜索每年获得 1340 万美元的收益,实现 517% 的投资回报率。
醉颜凉3 天前
全文检索·dm数据库·数据库查询·文档检索·搜索技术
DM数据库全文检索技术:高效查询文档内容的实现方法全文检索是一种通过建立文本内容的索引,实现对非结构化文本数据高效查询的技术。与传统的基于精确匹配的查询不同,全文检索能够处理自然语言文本,支持模糊匹配、关键词提取、相关性排序等高级功能。
Cx330❀4 天前
大数据·elasticsearch·搜索引擎·性能优化·langchain·全文检索
【LangChain】LangChain 核心技术全景指南:从基础入门到 LCEL 链式编程🔥个人主页:Cx330🌸❄️个人专栏:《C语言》《LeetCode刷题集》《数据结构-初阶》《C++知识分享》
Wang's Blog7 天前
笔记·postgresql·全文检索
PostgreSQL笔记48: 全文检索与向量检索的对比与混合检索实践信息检索技术的发展大致经历了三个阶段。第一阶段:关键词匹配(Keyword Matching) 。最初的搜索方式本质上是字符串匹配——用户输入什么,系统就在文档中查找完全相同的字符串。这种方式简单直接,但无法处理同义词、拼写变体等问题。
Elastic 中国社区官方博客9 天前
大数据·运维·elasticsearch·搜索引擎·架构·全文检索
ES95:面向 Elasticsearch 时间序列指标的自适应压缩作者:来自 Elastic Salvatore CampagnaES95 是 Elasticsearch 9.5 新推出的自适应时间序列编解码器,可将 @timestamp 的存储空间减少 92%,并将浮点数字段的存储空间最多减少 74%,无需任何配置。
Elastic 中国社区官方博客9 天前
大数据·人工智能·sql·elasticsearch·搜索引擎·json·全文检索
跳过 mapping 爆炸:ES|QL 无需动态 mapping 即可查询无 schema JSON key作者:来自 Elastic Jordan Powers 及 Dima LeontyevFlattened 字段让 Elasticsearch 变成一个读取时定义 schema 的数据存储,你可以在一个 mapping 下索引无 schema 数据,然后使用 ES|QL 的 FIELD_EXTRACT 提取所需的任意 JSON key,用于过滤、分组或 join,同时将谓词下推到列式存储中。
Elastic 中国社区官方博客12 天前
大数据·人工智能·elasticsearch·搜索引擎·重构·全文检索
跳过有状态的 OTel Collector:Elasticsearch 9.5 原生存储两种指标时间类型作者:来自 Elastic Jonas Kunz在同一个 metric 名称下摄入 cumulative 和 delta 两种 OpenTelemetry 指标,同时 ES|QL 和 PromQL 查询会自动按每个时间序列识别指标时间类型,无需新增语法或转换 pipeline。
Elastic 中国社区官方博客15 天前
大数据·人工智能·elasticsearch·机器学习·重构·全文检索·jina
训练量仅占 0.35%,竞争力却达到 100%:jina-embeddings-v5-omni 背后的冻结塔架构作者:来自 Elastic Jon Avezbaki最新的 jina embeddings 模型可以为文本、图像、视频和音频生成多模态嵌入,在向量搜索方面能够与规模接近其 6 倍的模型竞争,而训练的权重仅占 0.35%。
Elastic 中国社区官方博客15 天前
大数据·人工智能·elasticsearch·重构·全文检索
我们如何重构 APM 服务地图以应对事件响应:Observability 9.5 背后的设计故事作者:来自 Elastic Karolina Kurstak14 次企业访谈、两轮原型设计、一次重构的 APM 服务地图。Elastic Observability 9.5 背后的设计故事。
Elastic 中国社区官方博客14 天前
大数据·运维·人工智能·elasticsearch·搜索引擎·全文检索
你的 AI agent 不需要你的 API 密钥:使用 OAuth 2.1 对 Elasticsearch MCP 服务器进行身份验证作者:来自 Elastic Alex ChalkiasOAuth 2.1 让你可以通过浏览器登录,而不是使用 API 密钥,将 AI agent 连接到 Elasticsearch MCP 服务器。你的 agent 会获得一个与你的权限绑定的短期令牌,你可以随时撤销该令牌。
Elastic 中国社区官方博客16 天前
大数据·运维·人工智能·elasticsearch·搜索引擎·自动化·全文检索
Elasticsearch:使用 AI Agent 来创建 workflow对于很多的开发者来说,创建一个没有错误的 workflow 是很困难的。事实上,你需要学习各种语法,并进行不断地测试。我当初创建了我第一个 workflow 也是借助了 AI 的力量才完成的。过程还是挺麻烦的。我需要不断地拷贝,粘贴并测试。自 Elastic Stack 9.5 一来,workflow 的窗口已经集成了 AI Agent。我们可以轻松地借助 AI 的力量来完成我们的设计。
Elastic 中国社区官方博客20 天前
大数据·数据库·sql·elasticsearch·搜索引擎·全文检索
一个 ES|QL 查询替代两个:`WHERE IN` subquery 取代 Elasticsearch 中的复制粘贴循环作者:来自 Elastic Fang XingES|QL 的 WHERE 子句现在可以根据另一个 Elasticsearch subquery 的结果进行过滤,而不再需要手动复制静态 ID 列表;同时还支持嵌套 subqueries、NOT IN 以及复合条件。
AI领路人.16 天前
全文检索·向量检索·语义理解·混合检索·稀疏检索·加权融合
OceanBase混合检索(Hybrid Search):多模态检索实战指南Corrective RAG(CRAG),通过文档评分和托底机制来提升 RAG 系统的可靠性,主要解决检索结果的质量验证问题。但在检索环节本身,传统 RAG 系统还存在一个根本性的问题:单一检索方式的盲区。
Elastic 中国社区官方博客16 天前
大数据·运维·elasticsearch·搜索引擎·架构·全文检索
用两行 JSON 替换你的 ILM 策略:数据流生命周期新增冻结层支持作者:来自 Elastic Jon Avezbaki在 Elasticsearch 9.5 中,数据流生命周期中的 frozen_after 会自动将索引迁移到对象存储上的可搜索快照中,同时保持索引可查询,并与降采样和保留策略协同工作。
爱敲代码的憨仔18 天前
开发语言·python·全文检索
BM25全文检索BM25是一种经典的全文检索排序算法,常用于搜索引擎、RAG和文档检索。它的核心目标是:根据用户查询中的关键词,判断哪些文档最相关,并给这些文档打分排序。
Elastic 中国社区官方博客19 天前
大数据·数据库·elasticsearch·搜索引擎·全文检索
Elasticsearch:列式索引模式 - Columnar index mode注意:这个目前在 Elastic Stack 9.5 版本中是 Preview。后期版本有可能会发生变化。
金士镧厦门新材22 天前
全文检索
稀土抑烟剂在PVC硬质板材中的应用研究PVC硬质板材因具有良好的加工性能、耐腐蚀性以及装饰性能,在建筑装饰领域得到了广泛应用。随着材料安全性能要求不断提高,PVC材料在高温条件下的烟气释放问题逐渐成为行业研究的重要方向。
Elastic 中国社区官方博客22 天前
大数据·数据库·elasticsearch·ai·云原生·pdf·全文检索
一个字段,覆盖所有模态:Elasticsearch 的 semantic 字段如何自动索引和搜索图像、音频、视频和 PDF作者:来自 Elastic Mike PellegriniSemantic 字段会在摄取阶段将图像、音频、视频、PDF 和文本转换为多模态 embedding。你可以通过描述一个场景来找到对应的图片,也可以使用视频中的一帧来检索相关的视频片段,而这一切都只需依赖 Elasticsearch 中的一个字段即可完成。
John jj22 天前
大数据·后端·python·深度学习·搜索引擎·django·全文检索
拆解 Telegram 群组频道收录市场:三类方案,一个可运行的评分模型,目前TG中文人工评分加模型评分机制——LetsTG收录“快速”、“无门槛”本文把市面上的 Telegram 收录方案抽象成三类原型,用一个加权评分模型量化对比。所有数据来自文末可运行脚本,权重可改,结论会跟着变——这正是它的用法。