稀疏向量BM25Retriever不支持中文怎么办?jieba来帮忙

稀疏向量

稀疏向量 :稀疏向量也叫"词法向量"。是基于词频统计的检索方法,简单理解就是统计某一个词在一篇文章中出现的次数。缺点是无法理解语义。常用的算法有:BM25。

在LangChain中使用BM25Retriever进行搜索

python 复制代码
from langchain_community.retrievers import BM25Retriever

# BM25检索器  
bm25_retriever = BM25Retriever.from_documents(  
    chunks,  
    k=5
)

# 使用bm25_retriever进行向量搜索
bm25_docs = bm25_retriever.invoke("这里是搜索的关键字")

如果多次执行上面这段代码,你可能会发现一个问题。即使换了搜索关键字,搜索出来的内容还是一样的。这是因为BM25Retriever默认的分词器不支持对中文进行分词。

向量化

使用BM25Retriever进行搜索时,不需要提前将待搜索的内容向量化。因为BM25Retriever 是一个基于关键词的检索器 。核心是统计和匹配 ,而不是"理解"语义。完全基于词项的精确匹配和统计 。只有文档中精确出现目标词汇时,这个词才会被匹配。

当要搜索的内容(chunks)非常多时,可以使用Elasticsearch / OpenSearch 等专业软件。Elasticsearch内置了成熟的 BM25 实现。或者使用bm25s等第三方库。

安装jieba这个库

安装jieba这个中文分词器库。

python 复制代码
uv add jieba

from langchain_community.retrievers import BM25Retriever  
from langchain_core.documents import Document  
import jieba

# 给BM25Retriever指定中文分词器jieba.cut(x)
bm25_retriever = BM25Retriever.from_documents(  
    self.chunks,  
    k=5,  
    preprocess_func= lambda x: list(jieba.cut(x)),  
)

# 使用bm25_retriever进行向量搜索
bm25_docs = bm25_retriever.invoke("这里是搜索的关键字")

jieba是干什么的?

python 复制代码
import jieba  
  
print(jieba.lcut("南京市长江大桥"))  
  
print(jieba.lcut("what are you doing?"))  
  
for item in jieba.cut("南京市长江大桥"):  
    print(item)
相关推荐
莪_幻尘19 分钟前
Skill 体检:30 个 Skill 全凭感觉?体检器先自曝了 8 个“假 0 分
前端·人工智能·llm
风骏时光牛马20 分钟前
AI模型综合能力评测:性能、指令遵循与多场景实测对比
前端
Frag0ut25 分钟前
Chrome与Chromium内核浏览器在Windows 11上的新特性全景解析
前端·chrome·windows·web安全·chromium·gemini ai·playready drm
hiahiahia1231 小时前
实现完整 Tool Dispatcher
开发语言·前端
IT_陈寒1 小时前
Java线程池这破玩意,差点让我周末加班排查到凌晨
前端·人工智能·后端
弈栈录2 小时前
Java AI 应用的异步化与高并发设计
java·后端·架构
Mr_Mao2 小时前
告别选型困难!集 VueUse、ahooks、Mantine 于一身:286 个 Hook 的 ReaUse 来了
前端·javascript·react.js
凤山老林2 小时前
Spring Boot 集成 iText 7 实现动态 PDF 生成与电子签章:合同、报表场景实战
spring boot·后端·pdf·itext7·电子签章
孙启超3 小时前
【AI开发之Rust】第 19 课:UniFFI 导出核心能力
开发语言·后端·rust
泡海椒3 小时前
趋势分析报表:jquick-pdf折线图PDF生成实战
java·大数据·运维·服务器·前端·pdf