向量数据库

一、核心痛点

  1. 简单暴力检索(遍历全量向量算相似度)仅适用于小数据量;
  2. 百万级高维向量下,MySQL普通字段存储+内存遍历,延迟极高、并发不可用
  3. 传统关系型数据库无原生向量索引,无法支撑海量语义检索。

二、核心核心概念

  1. ANN(近似最近邻搜索)
    放弃100%精确匹配,以极小召回率损耗,换取百倍检索性能提升,是向量检索的核心底层思想。
  2. 向量数据库本质
    专用存储 + ANN向量索引 + 标量过滤能力,专为高维向量相似度检索设计。

三、两大主流ANN索引原理

1. IVF 倒排索引

  • 核心:K-Means聚类分区,先匹配聚类中心,仅在少量目标簇内检索;
  • 优势:内存占用低、适合超大存量数据;
  • 劣势:聚类边界易丢失数据,召回率略低。

2. HNSW 分层小世界图(生产首选)

  • 核心:多层图结构,顶层粗定位、底层精检索,依靠节点跳转快速逼近目标向量;
  • 优势:检索速度最快、召回率高、RAG场景通用;
  • 劣势:内存开销大,需维护图连接关系。

四、主流索引选型规则

  1. 数据<10万:FLAT暴力检索,简单无成本;
  2. 10万~500万:内存充足选HNSW,内存有限选IVF_FLAT;
  3. 千万级以上:IVF_SQ8向量压缩 / DISKANN磁盘索引。

五、向量数据库选型对比

  1. 专用库:Milvus、Qdrant、Chroma,向量检索能力强,适配大规模RAG;
  2. 传统库扩展:pgvector、MySQL向量,低代码低成本,适合小体量项目;
  3. 本项目选型 Milvus:开源免费、Java生态完善、索引丰富、易部署,适配后端RAG开发。

六、Milvus 核心概念(对标MySQL)

  • Collection = 数据表
  • Schema = 表结构
  • Entity = 数据行
  • Index = 向量索引/标量索引
  • Partition = 数据分区
    核心区别:独有高维向量字段与专属ANN索引。

七、完整落地流程

Docker部署Milvus → 定义数据表结构 → 文档向量化 → 批量插入数据 → 创建HNSW向量索引+标量索引 → 加载集合 → 向量检索 → 元数据混合过滤检索。

八、工程关键决策点

  1. 相似度算法:文本RAG统一使用余弦余弦COSINE,通用性最强;
  2. 数据更新:向量库不支持原地修改,采用「删旧插新」方案;
  3. 核心参数:HNSW的M、efConstruction、ef 三者平衡性能与召回率;
  4. 混合检索:向量语义匹配+标量条件过滤,大幅提升检索精准度。
相关推荐
Elastic 中国社区官方博客14 分钟前
列式存储并不等同于列式数据库。Columnar 模式为 Elasticsearch 带来了什么
大数据·运维·数据库·elasticsearch·搜索引擎
我要见SA姐11 小时前
用 Claude Code 重构遗留系统:从评估到落地的完整实践指南
数据库·ide·vscode·oracle·编辑器
Nturmoils2 小时前
一份 KDMS 评估报告,怎样排出迁移先后顺序
数据库
这个DBA有点耶2 小时前
异构数据集成怎么做?5 种同步方案对比 + 金融级 CDC 实战解析
数据库·oracle·架构
独泪了无痕2 小时前
SQL函数实战:GREATEST与LEAST的技巧
数据库·sql·mysql
码少女3 小时前
Linux--多路转接之select
java·服务器·数据库
梁辰兴3 小时前
软件工程:软件维护的副作用
数据库·软件工程·梁辰兴·控制方法·软件维护的副作用·副作用类型·副作用原因
这个DBA有点耶3 小时前
MySQL 8.0.20移除了Block Nested Loop,之前学的JOIN优化知识还适用吗?
数据库·mysql·架构
吉甫作诵4 小时前
Redis 常用命令大全:11 大类命令速查手册
运维·数据库·redis·缓存·nosql
2501_933670794 小时前
库存管理分析岗校招能力模型:SQL、库存周转、补货预测怎么准备
数据库