向量数据库本身存储和检索的是"向量",但它可以支撑文本、图片、音频、视频等多模态数据的语义检索。
不过严格说,不是所有向量数据库都"原生内置"多模态处理能力,很多场景下需要配合 Embedding 模型把原始数据转成向量后再入库。
它是怎么支持多模态的?
表格
| 模态 | 处理方式 | 检索效果 |
|---|---|---|
| 文本 | 用 BERT、BGE、Qwen-Embedding 等模型转成文本向量 | 语义搜索、相似问答、文档召回 |
| 图片 | 用 CLIP、ResNet 等模型转成图像向量 | 以文搜图、以图搜图 |
| 音频 | 提取音频特征向量,也可叠加 ASR 转文本 | 音频相似检索、语音内容检索 |
| 视频 | 抽取关键帧生成图像向量,音频转音频向量,字幕转文本向量 | 以图搜视频、视频片段召回 |
关键点在于:不同模态必须被同一个或对齐的 Embedding 模型映射到统一的向量空间,这样"文本描述"和"图片内容"才能算相似度。
哪些向量数据库支持多模态?
目前主流向量数据库基本都能用于多模态场景,例如 Milvus、Pinecone、Qdrant、Weaviate、Elasticsearch、LanceDB、OceanBase seekdb 等。
它们通常提供:
- 向量存储
- ANN 近似最近邻检索(HNSW、IVF 等)
- 元数据过滤
- 混合检索(向量检索 + 标量/关键词过滤)
但像 视频分帧、音频特征提取、ASR 转写、多模态 Embedding 推理,一般还是由上层服务或 AI 模型完成,向量数据库主要负责存储向量和高效检索。
简单总结
- 文本、图片:支持最成熟,很多产品可以直接用于以文搜图、以图搜文。
- 音频:支持,但通常需要音频特征模型或语音转文本。
- 视频:支持,但通常是拆成关键帧、音频、字幕等多组向量来处理。
- 是否"原生支持多模态":要看具体产品,有的只存向量,有的会内置 Embedding 能力和多模态检索流程。