向量数据库存储的是什么?向量本身还是原始数据ID

向量数据库中存放的是向量本身(即数据向量化后的高维数值表示),同时会关联存储原始数据的ID和元数据

具体来说,向量数据库包含以下内容:

1. 向量本身(核心存储)

  • 原始数据经过embedding模型处理后得到的数值向量
  • 通常是浮点数数组(如128维、768维、1536维等)
  • 这些向量才是向量数据库真正用于相似性搜索的核心数据

2. 关联存储的信息

  • 原始数据的ID:用于反向查找原始数据
  • 元数据:原始数据的其他属性(如文本内容、标签、时间戳等)
  • 索引结构:用于加速相似性搜索的索引(如HNSW、IVF等)

典型存储结构示例:

python 复制代码
{
  "vector": [0.12, -0.34, 0.56, ...],  # 768维向量
  "id": "doc_001",                     # 原始数据ID
  "metadata": {                        # 元数据
    "text": "人工智能是未来...",
    "category": "科技",
    "timestamp": "2024-01-15"
  }
}

工作流程:

复制代码
原始数据 → Embedding模型 → 向量化 → 存入向量数据库
   ↓         ↓
 文本/图片   向量存储 + ID + 元数据
   ↓
 搜索时:查询向量 → 相似度计算 → 返回最相似的向量 → 通过ID获取原始数据

常见的向量数据库:

  • PineconeWeaviateQdrant:同时存储向量和元数据
  • MilvusChroma:向量 + ID + 可选的元数据
  • Faiss(更偏向索引库):主要关注向量索引,元数据需要外部管理

简单说:向量是主角,ID和元数据是重要的配角,三者一起才能实现完整的检索功能。

相关推荐
GISer_Jing10 小时前
全栈AI实战:基于 TypeScript + LangChain + MCP 的企业级智能研发助手
前端·后端·ai·langchain·前端框架
洞窝技术10 小时前
你的 Coding Agent 不是不够聪明,是被 git status 和测试日志淹死了|RTK 实战指南
aigc·ai编程
VIP_CQCRE10 小时前
Ace Data Cloud 两条变现路径:推广平台,还是做自己的白标 AI 平台?
ai·aigc·api·开发者·云服务
0end110 小时前
AI 的终局不会只有一个赢家:从训练数据、现实世界到多极生态
aigc·openai
Ai-_Man11 小时前
豆包智能体把对话批量导出为Word或PDF的正确顺序
人工智能·ai·小程序·pdf·word
安逸sgr11 小时前
视觉 Token 是什么?图片是怎么送进大模型的?
人工智能·ai·大模型·agent·智能体
前沿在线11 小时前
视频模型卷向第二个维度,生数科技 Vidu S1 打响第一枪
人工智能·ai·大模型
Sammyyyyy11 小时前
AI Gateway 与直连 LLM API 的应该怎么选,一篇文章说明白
人工智能·ai·gateway·ai编程·ai-native·servbay
Dawson Zhu11 小时前
长链路Agent架构深度剖析:ReAct、Plan-and-Execute与托管式架构的选型博弈
架构·aigc
yuhulkjv33512 小时前
告别“复制-粘贴-崩格式”:ChatGPT鸿蒙版导出word格式的底层技术重构
ai·chatgpt·word·harmonyos·ai导出鸭