向量数据库存储的是什么?向量本身还是原始数据ID

向量数据库中存放的是向量本身(即数据向量化后的高维数值表示),同时会关联存储原始数据的ID和元数据

具体来说,向量数据库包含以下内容:

1. 向量本身(核心存储)

  • 原始数据经过embedding模型处理后得到的数值向量
  • 通常是浮点数数组(如128维、768维、1536维等)
  • 这些向量才是向量数据库真正用于相似性搜索的核心数据

2. 关联存储的信息

  • 原始数据的ID:用于反向查找原始数据
  • 元数据:原始数据的其他属性(如文本内容、标签、时间戳等)
  • 索引结构:用于加速相似性搜索的索引(如HNSW、IVF等)

典型存储结构示例:

python 复制代码
{
  "vector": [0.12, -0.34, 0.56, ...],  # 768维向量
  "id": "doc_001",                     # 原始数据ID
  "metadata": {                        # 元数据
    "text": "人工智能是未来...",
    "category": "科技",
    "timestamp": "2024-01-15"
  }
}

工作流程:

复制代码
原始数据 → Embedding模型 → 向量化 → 存入向量数据库
   ↓         ↓
 文本/图片   向量存储 + ID + 元数据
   ↓
 搜索时:查询向量 → 相似度计算 → 返回最相似的向量 → 通过ID获取原始数据

常见的向量数据库:

  • PineconeWeaviateQdrant:同时存储向量和元数据
  • MilvusChroma:向量 + ID + 可选的元数据
  • Faiss(更偏向索引库):主要关注向量索引,元数据需要外部管理

简单说:向量是主角,ID和元数据是重要的配角,三者一起才能实现完整的检索功能。

相关推荐
全栈弄潮儿3 小时前
我的 AI 编程工作台:工具、模型与基础配置
aigc·openai·ai编程
wangruofeng4 小时前
iPhone 18 系列全解读:折叠屏 Duo、A20 Pro,和一份最高 2.65 万的账单
aigc·apple
学习日记5255 小时前
第 5 章:自定义 Skill——把重复操作封装成一键命令
人工智能·ai·prompt
leeyi5 小时前
命令行里的平台:df_cli 都会什么(第108篇)
后端·aigc·agent
沈管家AI数字员工6 小时前
对话式数据分析实操:从自然语言到可视化图表的全流程
数据库·人工智能·ai·oracle·数据分析
艾克斯观察6 小时前
一条辞职帖,14小时7700万人看:全网到底在吵什么
人工智能·ai·x·世界末日·传播学
LayZhangStrive6 小时前
LangChain4j-OpenAI - 结构化输出及优化
ai·prompt·agent·json_object·outputstruct·json_schema
蓝星空20006 小时前
GPT Image 2.5 生图模型已上线,支持 Flare 与 Sunburst 型号选择
前端·gpt·aigc·image2·imagen
zhojiew7 小时前
让 Agent 安全地“借用别人的钥匙“:AgentCore 上用 Authentik 打通 OAuth 出站的一次实战
安全·ai·aws·agentcore
秋饼7 小时前
Spring AI 2.0 多模型路由网关:Astra/Sol 到国产模型的智能调度与降级
java·ai·技术分享·后端开发