向量数据库FAISS之六:如何让FAISS更快

1.速度与精度指标参数

1.选择索引家族

2.选择索引参数

通过 faiss.index_factory() 调用实例化索引是很常见的。但这种实例化方式将索引参数设置为安全值,同时存在许多与速度相关的参数。许多 Faiss 组件可以利用:

  • 编码时使用的迭代算法;迭代次数越多,召回率就越高
    • HNSW: efConstruction
    • ResidualQuantizer: niter_codebook_refine
    • LocalSearchQuantizer: encode_ils_iters, icm_iters, train_iters, encode_ils_iters (for vector codecs)
  • 启发式方法限制训练或搜索过程中考虑的可能候选者的数量,例如 束搜索。评估的候选越多,召回率就越高。
    • IndexBinaryIVF: nprobe, max_codes
    • IndexIVF: nprobe, max_codes
    • ResidualQuantizer: max_beam_size
    • HNSW: efSearch
  • 其他可选版本,例如基于 LUT 的近似值;他们允许以速度换取准确性
    • IndexIVFPQ: do_polysemous_training, polysemous_ht, use_precomputed_table
    • IndexIVFPQFastScan: use_precomputed_table
    • IndexPQ: do_polysemous_training, polysemous_ht, search_type
    • ResidualQuantizer: use_beam_LUT, approx_topk_mode, train_type
    • LocalSearchQuantizer: update_codebooks_with_double
  • 针对特定情况优化的计算,例如大批量 IVF 搜索。
  • 用于处理块输入数据的各种内部缓冲区;见下文。
  • 随机数生成器;这些用于确保结果可以重现。

在大多数情况下,默认索引参数应该工作得相当好。但强烈建议研究可用参数,以便在您的特定速度与精度与 RAM 情况下找到最佳点。

秘诀:研究所选 index 及其 subindexes 的可用参数。

3.K-均值聚类

K-means 聚类是 Faiss 内部经常使用的工具。默认情况下,faiss/Clustering.h 中的 k-means 实现使用 25 次迭代(niter 参数)和每个集群所需的输入数据集中最多 256 个样本(max_points_per_centroid 参数)。样本是随机选择的。

例如,默认的 PQx12 训练比 PQx10 训练慢约 4 倍,比 PQx8 训练慢约 16 倍,因为输入数据集中使用的样本数量比例较高。

基于 IVF 的索引默认使用 10 次 k 均值迭代(faiss/IndexIVF.h、faiss/IndexBinaryIVF.h、faiss/gpu/GpuIndexIVF.cu)。

秘诀:使用 k 均值聚类 nitermax_points_per_centroid 参数。

4.查询批次

Faiss 针对批量样本的处理进行了优化,而不是逐个处理样本。

在内部,Faiss 以比调用者执行并行化更有效的方式对批处理元素进行并行化。

秘诀:如果合适的话,尝试分批处理样本

5.PQ训练的train_shared训练模式

考虑对 PQ 使用 Train_shared 训练模式,该模式用于为所有子量化器训练单个码本,而不是为每个子量化器训练单独的码本。

这显着减少了 10 位或 12 位 PQ 的训练时间,但代价是准确性。

相关推荐
muddjsv2 分钟前
HBase与Hadoop:基于什么开发?深度剖析与架构图
数据库·hadoop·hbase
muddjsv2 分钟前
HBase 与 Hadoop 安装与上手使用全指导
数据库·hadoop·hbase
学计算机的计算基5 分钟前
MySQL 锁体系全解:从 MDL 到间隙锁,一次讲透
java·数据库·笔记·python·mysql
Trouvaille ~7 分钟前
【Redis篇】Redis 事务:原子性与脚本执行机制
数据库·redis·后端·算法·junit·lua·原子性
努力攻坚操作系统10 分钟前
Elasticsearch 完全教学指南:从入门到精通
大数据·数据库·elasticsearch·搜索引擎·全文检索
睡不醒男孩03082313 分钟前
行业解决方案二:CLup打造企业级数据库私有云(DBaaS)平台解决方案
数据库·云计算·clup
猴哥聊项目管理13 分钟前
2026年信创项目管理:如何用甘特图提升进度管控
大数据·数据库·项目管理·企业数字化转型·甘特图·敏捷开发·项目进度管理软件
j7~22 分钟前
MySQL C语言连接库和MYSQL连接池原理与简易数据网站数据流动是如何进行的
c语言·数据库·mysql·连接池·mysqlc语言连接库
暗夜猎手-大魔王34 分钟前
转载--Hermes Agent 10 | 7 层安全防线:从用户授权到输入净化
java·数据库·安全
weelinking9 小时前
【产品】12_接入数据库——让数据永久保存
jvm·数据库·python·react.js·数据挖掘·前端框架·产品经理