稀疏向量BM25Retriever不支持中文怎么办?jieba来帮忙

稀疏向量

稀疏向量 :稀疏向量也叫"词法向量"。是基于词频统计的检索方法,简单理解就是统计某一个词在一篇文章中出现的次数。缺点是无法理解语义。常用的算法有:BM25

在LangChain中使用BM25Retriever进行搜索

python 复制代码
from langchain_community.retrievers import BM25Retriever

# BM25检索器  
bm25_retriever = BM25Retriever.from_documents(  
    chunks,  
    k=5
)

# 使用bm25_retriever进行向量搜索
bm25_docs = bm25_retriever.invoke("这里是搜索的关键字")

如果多次执行上面这段代码,你可能会发现一个问题。即使换了搜索关键字,搜索出来的内容还是一样的。这是因为BM25Retriever默认的分词器不支持对中文进行分词。

向量化

使用BM25Retriever进行搜索时,不需要提前将待搜索的内容向量化。因为BM25Retriever 是一个基于关键词的检索器 。核心是统计和匹配 ,而不是"理解"语义。完全基于词项的精确匹配和统计 。只有文档中精确出现目标词汇时,这个词才会被匹配。

当要搜索的内容(chunks)非常多时,可以使用Elasticsearch / OpenSearch 等专业软件。Elasticsearch内置了成熟的 BM25 实现。或者使用bm25s等第三方库。

安装jieba这个库

安装jieba这个中文分词器库。

python 复制代码
uv add jieba

from langchain_community.retrievers import BM25Retriever  
from langchain_core.documents import Document  
import jieba

# 给BM25Retriever指定中文分词器jieba.cut(x)
bm25_retriever = BM25Retriever.from_documents(  
    self.chunks,  
    k=5,  
    preprocess_func= lambda x: list(jieba.cut(x)),  
)

# 使用bm25_retriever进行向量搜索
bm25_docs = bm25_retriever.invoke("这里是搜索的关键字")

jieba是干什么的?

python 复制代码
import jieba  
  
print(jieba.lcut("南京市长江大桥"))  
  
print(jieba.lcut("what are you doing?"))  
  
for item in jieba.cut("南京市长江大桥"):  
    print(item)
相关推荐
兜里只有三分钱~6 分钟前
翻卡_3D 的仪式感,和三个让它穿帮的写法
javascript·css·3d
mayaairi29 分钟前
Vue2 组件通讯(四):v-model、scoped样式、mixins与plugins
前端·javascript·vue.js
遨翔在知识的海洋里36 分钟前
nest(5)-文件上传和静态资源
后端
梦曦i41 分钟前
@meng-xi/uni-router 未来展望:夯实基础、深化体验、探索前沿
前端·uni-app
前端炒粉41 分钟前
DOM 常用 API 速查表
开发语言·javascript·ecmascript
Yeyu41 分钟前
AAOS AppCard 实践:怎么把自己的 App 塞进别人的卡片里
前端
遨翔在知识的海洋里1 小时前
nest(3)-jwt和RBAC
后端
遨翔在知识的海洋里1 小时前
nest(5)-Middleware
后端
星云API技术支持1 小时前
企业微信二次开发:如何建立统一的错误处理、日志与请求追踪机制
javascript·企业微信·ruby
程序员梅雨1 小时前
Linux & Shell 实用干货
linux·运维·服务器·后端·面试·php