LLM之RAG实战(五十六)| Ollama部署下载Qwen3-Embedding向量模型和Qwen3-Reranker重排模型

参考文献:https://blog.csdn.net/qq363685855/article/details/148512248

之前分享过LLM之RAG实战(五十五)| 阿里开源新模型,Qwen3-Embedding与Qwen3 Reranker强势来袭!。本文将分享如何使用ollama来部署这些模型。

一、首先,需要安装Ollama

打开官网下载:https://ollama.com/download

根据自己的操作系统下载对应的版本即可。正常来说,是可以安装成功的。下面介绍一下特殊情况或者其他安装方式。

a)对于Mac电脑,也可以通过Homebrew进行安装

复制代码
brew install ollama

b)对linux服务器,有时候不能连接外网,因此需要离线安装,可以参考文献:https://blog.csdn.net/m0_71142057/article/details/143186418。

核心点是可以copy文章的install.sh然后下载ollama离线文件,并把他们放到同一个目录下,执行运行install.sh即可,如下图所示:

可以通过命令lscpu来查看操作系统版本,我是x86_64。

复制代码
chmod +x ./install.sh./install.sh

二、下载Qwen3-Embedding模型

复制代码
ollama run dengcao/Qwen3-Embedding-0.6B:F16

下面列出Qwen3-Embedding和Qwen3-Reranker各个版本的Ollama安装命令。

Qwen3-Embedding-0.6B系列:​​​​​​​

复制代码
ollama run dengcao/Qwen3-Embedding-0.6B:Q8_0ollama run dengcao/Qwen3-Embedding-0.6B:F16

Qwen3-Embedding-4B系列:​​​​​​​

复制代码
ollama run dengcao/Qwen3-Embedding-4B:Q4_K_Mollama run dengcao/Qwen3-Embedding-4B:Q5_K_Mollama run dengcao/Qwen3-Embedding-4B:Q8_0ollama run dengcao/Qwen3-Embedding-8B:F16

Qwen3-Embedding-8B系列:​​​​​​​

复制代码
ollama run dengcao/Qwen3-Embedding-8B:Q4_K_Mollama run dengcao/Qwen3-Embedding-8B:Q5_K_Mollama run dengcao/Qwen3-Embedding-8B:Q8_0

Qwen3-Reranker-0.6B系列:​​​​​​​

复制代码
ollama run dengcao/Qwen3-Reranker-0.6B:Q8_0ollama run dengcao/Qwen3-Reranker-0.6B:F16

Qwen3-Reranker-4B系列:​​​​​​​

复制代码
ollama run dengcao/Qwen3-Reranker-4B:Q4_K_Mollama run dengcao/Qwen3-Reranker-4B:Q5_K_Mollama run dengcao/Qwen3-Reranker-4B:Q8_0

Qwen3-Reranker-8B系列:​​​​​​​

复制代码
ollama run dengcao/Qwen3-Reranker-8B:Q3_K_Mollama run dengcao/Qwen3-Reranker-8B:Q4_K_Mollama run dengcao/Qwen3-Reranker-8B:Q5_K_Mollama run dengcao/Qwen3-Reranker-8B:Q8_0ollama run dengcao/Qwen3-Reranker-8B:F16

关于量化版本的说明:

  • q8_0:与浮点数16几乎无法区分。资源使用率高,速度慢。不建议大多数用户使用。

  • q6_k:将Q8_K用于所有张量。

  • q5_k_m:将 Q6_K 用于一半的 attention.wv 和 feed_forward.w2 张量,否则Q5_K。

  • q5_0: 原始量化方法,5位。精度更高,资源使用率更高,推理速度更慢。

  • q4_k_m:将 Q6_K 用于一半的 attention.wv 和 feed_forward.w2 张量,否则Q4_Kq4_0:原始量化方法,4 位。

  • q3_k_m:将 Q4_K 用于 attention.wv、attention.wo 和 feed_forward.w2 张量,否则Q3_K

  • q2_k:将 Q4_K 用于 attention.vw 和 feed_forward.w2 张量,Q2_K用于其他张量。

    根据经验,建议使用 Q5_K_M,因为它保留了模型的大部分性能。或者,如果要节省一些内存,可以使用 Q4_K_M。

相关推荐
EnCi Zheng8 天前
06. Embedding模型与向量化
embedding
nudt_qxx8 天前
讲透Transformer(二):深入解析Embedding
语言模型·transformer·embedding
芒果不茫QAQ10 天前
Upstash Vector 免费版完整使用指南
python·aigc·embedding·rag·upstash
香芋Yu12 天前
【大模型面试突击】04_Embedding与表示学习
学习·面试·embedding
jFWTpMJfJjq13 天前
今天搞了个好玩的——用COMSOL复现光子晶体扭转结构的能带和透射谱。这玩意儿和魔角石墨烯有点像,两个光子晶体叠一起转个角度,能带结构就开始整活了
embedding
2401_8288906414 天前
正/余弦位置编码 Sinusoidal Encoding
python·自然语言处理·transformer·embedding
忧郁的橙子.16 天前
02-嵌入模型和向量数据库
数据库·embedding
钱彬 (Qian Bin)19 天前
基于Qwen3-VL-Embedding-2B与vLLM构建高精度多模态图像检索系统
embedding·vllm·多模态检索·qwen3-vl
AI资源库19 天前
解构嵌入模型之王:All-MiniLM-L6-v2 的文件树解密、蒸馏机制与工业级应用生态
langchain·nlp·bert·embedding·hugging face·fine-tuning·ai agent
CCPC不拿奖不改名19 天前
Langflow源代码解析01:源代码拉取、安装依赖项,并运行langflow
人工智能·python·深度学习·langchain·embedding·rag·langflow