Milvus 基本概念

Milvus 使用 包含 java 和 python

知道特征向量是什么

向量又称为 embedding vector,是指由embedding技术从离散变量(如xxx等各种非结构化数据)转变而来的连续向量。在数学表示上,向量是一个由浮点数或者二值型数据组成的 n 维数组。通过现代的向量转化技术,比如各种人工智能(AI)或者机器学习(ML)模型,可以将非结构化数据抽象为 n 维特征向量空间的向量。这样就可以采用最近邻算法(ANN)计算非结构化数据之间的相似度。

Milvus 是向量数据库

主要用于存储、索引和管理通过深度神经网络和机器学习模型产生的海量向量数据。

Collection 等价 数据库的表

Collection 包含一组 entity。

Entity

实体包含一组 field

Field

field 与实际对象相对应。

Segment 段

Milvus 在数据插入时通过合并数据自动创建的数据文件。一个 collection 可以包含多个 segment。一个 segment 可以包含多个 entity。在搜索中,Milvus 会搜索每个 segment,并返回合并后的结果。

分片

将数据写入操作分散到不同节点上,使 Milvus 能充分利用集群的并行计算能力进行写入。默认情况下单个 collection 包含 2 个分片(shard)。目前 Milvus 采用基于主键哈希的分片方式,未来将支持随机分片、自定义分片等更加灵活的分片方式。

分区

把 collection 中的数据根据一定规则在物理存储上分成多个部分。这种对 collection 数据的划分就叫分区(partitioning)。每个 partition 可包含多个segment。

归一化

归一化指的是通过数学变换将向量的模长变为 1 的过程。如需使用点积计算向量相似度,则必须对向量作归一化处理。处理后点积与余弦相似度等价。

索引

索引基于原始数据构建,可以提高对 collection 数据搜索的速度。

向量

一种类型的 field,代表对象的特征。非结构化数据可以通过各种 AI 模型和 embedding 技术转化为向量。

Milvus是一个面向向量的存储引擎,主要用于存储、索引和管理通过深度神经网络和机器学习模型产生的海量向量数据。在Milvus中,数据被存储为向量,向量由embedding技术从离散变量(如图片、文本等)转变而来,是n维浮点数或者二值型数据组成的数组。Collection等价于数据库中的表,它包含了一组entity(实体),实体包含了一组field。Segment是在数据插入时通过合并数据自动创建的数据文件。一个Collection可以包含多个Segment,而一个Segment可以包含多个Entity。分片是将数据写入操作分散到不同节点上,使Milvus能够充分利用集群的并行计算能力进行写入。分区是根据一定规则将Collection中数据在物理存储上分成多个部分。归一化是将向量模长变为1的过程。索引是基于原始数据构建,可以提高数据搜索的速度。向量是一种类型的field,代表对象的特征,非结构化数据可以通过各种AI模型和embedding技术转化为向量。

相关推荐
weixin79893765432...9 分钟前
React + Fastify + DeepSeek 实现一个简单的对话式 AI 应用
人工智能·react.js·fastify
大千AI助手22 分钟前
概率单位回归(Probit Regression)详解
人工智能·机器学习·数据挖掘·回归·大千ai助手·概率单位回归·probit回归
狂炫冰美式1 小时前
3天,1人,从0到付费产品:AI时代个人开发者的生存指南
前端·人工智能·后端
LCG元1 小时前
垂直Agent才是未来:详解让大模型"专业对口"的三大核心技术
人工智能
我不是QI2 小时前
周志华《机器学习—西瓜书》二
人工智能·安全·机器学习
操练起来2 小时前
【昇腾CANN训练营·第八期】Ascend C生态兼容:基于PyTorch Adapter的自定义算子注册与自动微分实现
人工智能·pytorch·acl·昇腾·cann
KG_LLM图谱增强大模型2 小时前
[500页电子书]构建自主AI Agent系统的蓝图:谷歌重磅发布智能体设计模式指南
人工智能·大模型·知识图谱·智能体·知识图谱增强大模型·agenticai
声网2 小时前
活动推荐丨「实时互动 × 对话式 AI」主题有奖征文
大数据·人工智能·实时互动
caiyueloveclamp2 小时前
【功能介绍03】ChatPPT好不好用?如何用?用户操作手册来啦!——【AI溯源篇】
人工智能·信息可视化·powerpoint·ai生成ppt·aippt
q***48412 小时前
Vanna AI:告别代码,用自然语言轻松查询数据库,领先的RAG2SQL技术让结果更智能、更精准!
人工智能·microsoft