向量检索

llwszx7 天前
llm·向量检索·rag·ai智能体·大模型应用·agent开发·后端转ai
【Java/Go后端手撸原生Agent(第十一篇):RAG检索——给Agent加上“查资料“能力】系列目录:[Phase 1-2 基础框架] → [Phase 3 状态机+文件读取] → [Phase 4-6 原生FC+Judge校验] → [Phase 5 多工具并行+BashTool] → [Phase 6 流式输出] → [Phase 7 Token预算与滑动窗口] → [Phase 8 摘要压缩] → [Phase 9 规划模式] → [Phase 10 Web UI] → Phase 11 RAG检索(本文) 上一篇链接:【Java/Go后端手撸原生Agent(第十篇):HTTP+SSE+W
llwszx9 天前
agent·ann·hnsw·向量检索·rag
从跳表到HNSW:深度拆解向量ANN检索的分层设计与近似本质在RAG系统的落地过程中,向量检索的性能永远是核心瓶颈之一。暴力检索的时间复杂度为 O(N×D)O(N \times D)O(N×D),当向量规模突破10万条、维度达到1536维时,单次检索就要完成上亿次浮点运算,延迟直接上升到百毫秒级;百万级规模下更是会达到秒级,完全无法满足线上服务的吞吐要求。
段一凡-华北理工大学25 天前
数据库·人工智能·算法·性能优化·向量检索·高炉炼铁·高炉智能化
向量数据库实战:选型、调优与落地~系列文章04:HNSW 索引深度剖析:为什么它是向量检索的“王者算法“?🔥 本文是《向量数据库实战:选型、调优与落地》专栏第 04 篇⏱️ 阅读时间:约 14 分钟一个真实的故事 📖
行者-全栈开发23 天前
embedding·向量检索·ollama·spring ai·pgvector·atomcode·rag电商知识库
【码动四季】Spring AI + RAG 电商知识库:AtomCode 如何让 Embedding 对齐从 3 天缩短到 4 小时💡 摘要: 电商商品知识库要支持"有没有适合送妈妈的护肤套装"这种自然语言查询,传统搜索完全搞不定。我们用 Spring AI 1.0 + Ollama + PgVector 搭建 RAG 系统,却在 Embedding 对齐上卡了 3 天——向量维度不一致、分片策略反复调、检索召回率上不去。引入 AtomCode 后,通过 Rules 校验向量维度、Skill 生成 Embedding Pipeline、Agent 自动测试检索召回率,将对齐周期压缩到 4 小时。本文完整记录 RAG 架构设计、Spr
金融支付架构实战指南2 个月前
spring boot·后端·milvus·向量检索
Milvus 向量检索服务 + SpringBoot 实战:电商商品语义检索与相似商品推荐一、业务背景与需求1. 原有痛点传统电商依靠 MySQL + Elasticsearch 关键词检索,存在明显短板:
尽兴-2 个月前
算法·embedding·欧氏距离·向量检索·余弦相似度
2.1 向量基础:Embedding、余弦相似度、欧氏距离、向量检索如果说 LLM 是大脑,那向量就是它的「神经信号编码」。人类用文字交流,计算机用数字计算,而 Embedding 是连接这两个世界的桥梁。不懂向量,就不懂 RAG;不懂 RAG,就没法让 LLM 真正落地到实际业务中。
码农飞哥2 个月前
python·知识库·向量检索·rag·效果提示
我把RAG召回率从60%提到90%,就改了这两件事💪🏻 1. Python基础专栏,基础知识一网打尽,9.9元买不了吃亏,买不了上当。 Python从入门到精通
这是谁的博客?3 个月前
人工智能·ai·架构·大模型·架构设计·向量检索·rag
RAG 技术原理深度解析:检索增强生成架构与实践RAG(Retrieval-Augmented Generation,检索增强生成)是当前大语言模型应用的核心架构,通过外部知识检索与生成模型结合,显著提升 AI 系统的准确性、时效性和可控性。本文深入解析 RAG 的核心原理、架构组件、分块策略、检索优化、高级技术及评估方法,帮助开发者构建生产级 RAG 系统。
行者-全栈开发3 个月前
人工智能·向量检索·混合搜索·关键词搜索·元数据过滤·rrf算法·检索精度
Spring AI 混合搜索:如何让 RAG 检索准确率达到 95%?(附 RRF 算法实现)💡 摘要: 单一向量搜索存在语义匹配不精确、无法处理专有名词等问题。混合搜索结合关键词搜索(BM25)、向量相似度搜索、元数据过滤三种技术,显著提升检索精度和召回率。本文深入讲解混合搜索的架构设计、Spring AI 集成代码、权重调优技巧、Reciprocal Rank Fusion (RRF) 算法实现。通过实测数据对比单一搜索与混合搜索的准确率、召回率、F1 分数,展示如何在生产环境中实现 95%+ 的检索准确率。掌握这些技能,你将能够构建企业级高精度 RAG 系统。
梵得儿SHI3 个月前
人工智能·缓存·性能优化·milvus·向量检索·rag·spring ai
(第四篇)Spring AI 架构设计与优化:真实生产环境复盘,从 100ms 到 10ms 的响应提速全流程大家好,我是深耕 Spring AI 落地的后端开发。上个月我们团队接到了一个紧急优化需求:线上跑了 3 个月的智能问答服务,平均响应耗时稳定在 100ms,业务高峰期 P99 延迟直接飙升到 500ms,大量用户反馈 “问个问题要等半天”,老板直接下了死命令:2 周内把平均延迟压到 20ms 以内,同时不能降低问答准确率。
__土块__3 个月前
向量检索·embedding微调·rag系统·文档切分·分层召回·相似度阈值·上下文拼装
RAG 检索查不准的工程归因:从向量对齐到分层召回的架构取舍在 2026 年初上线的某金融合规问答系统中,RAG 模块持续出现“用户问 A,系统答 B”的现象。典型场景如用户查询“2025 年反洗钱新规对跨境转账的影响”,系统却返回了“2023 年境内支付结算管理办法”相关内容。初期排查聚焦于 prompt 优化和相似度阈值调整,但效果有限。进一步观察发现,问题并非集中在单一环节,而是贯穿了从文档入库到最终回答生成的全链路。
deephub3 个月前
人工智能·大语言模型·向量检索·rag·bm25
BM25 + Vectors:为什么真实 RAG 系统通常两者都需要RAG 是一个先选内容再做生成的系统;retriever 不搜索文档,它搜索 chunks。 chunks 有问题了那么检索还没开始就已经完蛋了,所以我们可以用结构感知切分修这一点,把标题、代码块、警告框保持在一起。
AI精钢3 个月前
llm·向量检索·rag·ai工程·chunking
RAG 的 Chunking 有什么好方案?从原理到实战选型Reddit 上有一个观点说得很直接:“Chunking 优化的是 embedding 的便利性,不是文档被使用的方式。”
AI精钢3 个月前
大模型·llm·向量检索·rag·ai工程
如何提高 RAG 的检索质量?这才是真正的瓶颈所在有一句在 AI 工程圈流传的话:“RAG 没问题,问题出在你的检索层。”大多数开发者遇到 RAG 效果差时,第一反应是换更大的模型、调 temperature、改 prompt。折腾一圈发现没用——因为根本没对症。
庞轩px3 个月前
人工智能·自然语言处理·embedding·向量检索·余弦相似度·rag·高维向量空间
Embedding与向量语义——大模型是怎样“理解”文字的?在面试中,如果你在简历上写了“RAG”、“向量检索”,面试官几乎一定会追问一句:“你用了 Embedding,那你说说它的原理是什么?为什么两个词的向量相似,就代表它们语义相近?”
你好潘先生3 个月前
spring boot·向量检索·next.js·pgvector·ai对话·多模型对比·sse流式输出
Next.js + Spring Boot 实现 AI 多模型并行对话系统(架构设计与关键实现)最近在做 AI 对话类项目,核心功能包括多模型并行对话、Git 式对话分支、知识自动沉淀、AI 语义搜索等。本文分享下整体架构设计和一些关键技术实现,供同样在做类似项目的同学参考。
INFINI Labs3 个月前
向量检索·knn·easysearch·ai agent·mem0·mcp
用 Easysearch 给 AI Agent 装上长期记忆:Mem0 集成实战你有没有遇到过这样的场景:昨天花了半小时跟 AI 把一个 Bug 的根因讲清楚了,今天新开一个对话,对方又一脸懵地从零问起。每次都要重新交代背景,像是在跟一个永远刚入职的实习生打交道。
deephub4 个月前
人工智能·python·大语言模型·向量检索·rag
从检索到回答:RAG 流水线中三个被忽视的故障点RAG 流水线部署完毕、检索正常运行、LLM 按部就班地生成回答、用户也在持续收到响应,这一切看上去运转良好。但有一个问题大多数工程师从来不问:这些回答真的对吗?
deephub4 个月前
人工智能·python·机器学习·embedding·向量检索
向量相似性搜索详解:Flat Index、IVF 与 HNSW要理解向量搜索先要弄清楚为什么需要向量数据库,关系型数据库处理结构化数据得心应手。所谓结构化数据就是那些具有固定列的表格数据,比如说:姓名、年龄、薪资、日期。这类数据精确匹配查询很简单:"Age > 25"或"Name = Subham"就能拿到想要的结果。