支持CPU本地部署向量与重排模型推荐,覆盖轻量入门到中文高精度全场景。
📌 文本向量化(Embedding)CPU友好模型
- paraphrase-multilingual-MiniLM-L12-v2:384维多语言轻量模型,CPU下推理速度达3200句/秒,内存仅占1.8GB,中文CLUE基准准确率86.7%,适合入门级多语言场景 。
- text2vec-base-chinese:专为中文优化的768维模型,纯CPU环境下i7-12700实测推理流畅,8GB内存即可运行,Ollama部署后速度比原生PyTorch快30%,是中文语义搜索的入门首选 。
- Qwen3-Embedding-0.6B:1024维原生中文嵌入模型,CPU下仅需16GB内存即可运行,对中英混排、技术术语表征稳定,兼容OpenAI API协议,适合中文RAG系统落地 。
- all-MiniLM-L6-v2:384维英文轻量模型,CPU下推理速度达5800句/秒,内存仅占1.2GB,是英文场景下速度优先的入门选择 。
🔍 重排序(Reranker)CPU友好模型
- Qwen3-Reranker-0.6B:0.6B参数轻量重排模型,纯CPU无需CUDA,Intel i5+16GB内存即可流畅运行,支持32K长文本处理,5分钟就能完成本地部署,是RAG系统CPU部署的首选 。
- bge-reranker-v2-mini:轻量化中文重排模型,FP32模式下CPU内存占用仅2GB左右,推理速度比大尺寸bge-reranker-large快3倍,精度损失极小,适合小批量候选文档快速重排。
- gte-reranker-base:开源轻量重排模型,针对CPU推理做了算子优化,支持中英文混合场景,8GB内存即可启动,在公开重排基准上表现接近大尺寸模型,适合低配置设备部署。
⚙️ CPU部署通用优化技巧
- 启用量化精度:将模型转为INT8量化格式,内存占用直接减半,推理速度提升2~3倍,精度损失控制在2%以内。
- 控制线程数:设置环境变量
OMP_NUM_THREADS=4,避免CPU多线程过载,平衡速度与系统资源占用。 - 小批量处理:向量生成batch_size设为16~32,重排序候选数控制在Top20以内,避免CPU单次处理压力过大。