如何使用DashVector的多向量检索

本文介绍如何使用DashVector的多向量检索功能。

在某些AI检索的场景,会涉及一个实体对应多个向量,在检索时希望通过多个向量检索来找到最可能的实体,例如:

  • 在自然语言处理中,标题和文档分别抽取为不同的向量特征,需要根据标题向量和文档向量同时做检索。

  • 在商品检索时,商品的图片和文字分别抽取为不同的向量特征,需要根据图片向量和文字向量同时做检索。

为了满足这些需求,DashVector支持了多向量检索。

使用示例

前提条件

创建多向量集合

说明

需要使用您的api-key替换示例中的 YOUR_API_KEY、您的Cluster Endpoint替换示例中的YOUR_CLUSTER_ENDPOINT,代码才能正常运行。

复制代码
import dashvector
import numpy as np
from dashvector import VectorParam, Doc, WeightedRanker, VectorQuery, RrfRanker

client = dashvector.Client(
    api_key='YOUR_API_KEY',
    endpoint='YOUR_CLUSTER_ENDPOINT'
)
ret = client.create(
    'multi_vector_demo',
    vectors={
        "title": VectorParam(4),
        "content": VectorParam(6, metric="euclidean"),
    },
    fields_schema={
        'author': str,
    }
)
assert ret

插入数据

说明

insert/upsert要求至少一个向量字段有值。

复制代码
collection = client.get(name='multi_vector_demo')
docs = []
for i in range(10):
    docs.append(Doc(id=str(i),
                    vectors={"title": np.random.random(4),
                             "content": np.random.random(6)
                            },
                    )
                )
ret = collection.insert(docs)
print(ret)

执行检索

说明

  1. 检索时采用的策略为多个向量分别执行检索后融合排序。当前融合排序支持两种策略:RrfRankerWeightedRanker。不指定时,默认为RrfRanker(rank_constant=100)。

  2. VectorQuery 支持的其他参数见 向量检索高级参数

    title_vector = [0.1, 0.2, 0.3, 0.4]
    content_vector = [0.1, 0.2, 0.3, 0.4, 0.5, 0.6]
    vectors = {
    "title": VectorQuery(vector=title_vector, num_candidates=10),
    "content": VectorQuery(vector=content_vector),
    }
    ret = collection.query(
    vector=vectors,
    include_vector=False,
    # 使用RRF融合排序
    # rerank=RrfRanker(rank_constant=100)
    # 使用加权融合排序
    rerank=WeightedRanker(weights={"title": 1.0, "content": 1.0}),
    topk=20
    )
    assert ret
    print(ret.output)

    使用单个向量执行检索

    ret = collection.query(vector={"title": VectorQuery(vector=title_vector)})
    assert ret
    print(ret.output)

    使用单个向量执行分组向量检索

    ret = collection.query_group_by(title_vector, group_by_field='author', vector_field='title')
    assert ret
    print(ret)

限制说明

重要

  1. 当前单个集合最多支持4个向量字段。

  2. 多向量集合暂不支持插入sparse特征。

  3. 随向量字段的个数增加,Cluster中可插入的Doc条数会减少,插入和检索的性能会下降。

  4. 检索时允许只对部分向量做检索,集合中包含n个向量字段时,允许使用1-n个向量字段做向量检索,允许使用其中的任意一个向量字段做分组向量检索

相关推荐
静心问道几秒前
SqueezeBERT:计算机视觉能为自然语言处理在高效神经网络方面带来哪些启示?
人工智能·计算机视觉·自然语言处理
Sherlock Ma1 分钟前
百度开源文心一言4.5:论文解读和使用入门
人工智能·百度·自然语言处理·开源·大模型·文心一言·多模态
weisian1516 分钟前
人工智能-基础篇-18-什么是RAG(检索增强生成:知识库+向量化技术+大语言模型LLM整合的技术框架)
人工智能·语言模型·自然语言处理
DataCastle11 分钟前
第三届Bio-OS AI开源大赛启动会隆重举行
人工智能
后端小肥肠20 分钟前
躺赚必备!RPA+Coze+豆包:公众号自动发文,AI率0%亲测有效(附AI率0%提示词)
人工智能·aigc·coze
向阳@向远方26 分钟前
第二章 简单程序设计
开发语言·c++·算法
GreatSQL社区29 分钟前
用systemd管理GreatSQL服务详解
数据库·mysql·greatsql
掘根29 分钟前
【MySQL进阶】错误日志,二进制日志,mysql系统库
数据库·mysql
摘星编程31 分钟前
CloudBase AI ToolKit实战:从0到1开发一个智能医疗网站
人工智能·腾讯云·ai代码远征季#h5应用·ai医疗应用·cloudbase开发
weixin_4383354031 分钟前
基础知识:mysql-connector-j依赖
数据库·mysql