稀疏向量BM25Retriever不支持中文怎么办?jieba来帮忙

稀疏向量

稀疏向量 :稀疏向量也叫"词法向量"。是基于词频统计的检索方法,简单理解就是统计某一个词在一篇文章中出现的次数。缺点是无法理解语义。常用的算法有:BM25

在LangChain中使用BM25Retriever进行搜索

python 复制代码
from langchain_community.retrievers import BM25Retriever

# BM25检索器  
bm25_retriever = BM25Retriever.from_documents(  
    chunks,  
    k=5
)

# 使用bm25_retriever进行向量搜索
bm25_docs = bm25_retriever.invoke("这里是搜索的关键字")

如果多次执行上面这段代码,你可能会发现一个问题。即使换了搜索关键字,搜索出来的内容还是一样的。这是因为BM25Retriever默认的分词器不支持对中文进行分词。

向量化

使用BM25Retriever进行搜索时,不需要提前将待搜索的内容向量化。因为BM25Retriever 是一个基于关键词的检索器 。核心是统计和匹配 ,而不是"理解"语义。完全基于词项的精确匹配和统计 。只有文档中精确出现目标词汇时,这个词才会被匹配。

当要搜索的内容(chunks)非常多时,可以使用Elasticsearch / OpenSearch 等专业软件。Elasticsearch内置了成熟的 BM25 实现。或者使用bm25s等第三方库。

安装jieba这个库

安装jieba这个中文分词器库。

python 复制代码
uv add jieba

from langchain_community.retrievers import BM25Retriever  
from langchain_core.documents import Document  
import jieba

# 给BM25Retriever指定中文分词器jieba.cut(x)
bm25_retriever = BM25Retriever.from_documents(  
    self.chunks,  
    k=5,  
    preprocess_func= lambda x: list(jieba.cut(x)),  
)

# 使用bm25_retriever进行向量搜索
bm25_docs = bm25_retriever.invoke("这里是搜索的关键字")

jieba是干什么的?

python 复制代码
import jieba  
  
print(jieba.lcut("南京市长江大桥"))  
  
print(jieba.lcut("what are you doing?"))  
  
for item in jieba.cut("南京市长江大桥"):  
    print(item)
相关推荐
BreezeJiang1 小时前
JWT 登录不是存个 token:React 鉴权真正要闭合的是一条数据流
javascript·react.js·axios
驳是1 小时前
代码洁癖患者会喜欢的几款 CLI 小工具
前端
Csvn1 小时前
🛋️ requestIdleCallback:把非关键任务塞进浏览器的"空闲时间",告别卡顿
前端
江华森1 小时前
从 fork 到协程:一次完整的操作系统并发编程实操
前端·程序员
Code额1 小时前
Python 连接 DeepSeek API,OpenAI 对话方式总结
后端·python·ai·ai编程
星火10241 小时前
【LangChain4j系列10】Guardrails 安全护栏
人工智能·后端
用户6919026813391 小时前
Docker基本概念
后端·docker·容器
这是个栗子1 小时前
【JS代码分析】前端鉴权基础:Token 的本地存储与状态重置实践
开发语言·前端·javascript
颜进强1 小时前
14 - OpenSpec 老页面改造骨架:定位 + 增量 + 回归三件套
前端·后端·ai编程