本地部署Ollama及部署模型

Ollama:是一款旨在简化大模型语言模型本地部署和运行过程的开源软件。

ollama提供一个轻量级、易扩展的框架,让开发者可以在本地机器构建和管理LLMs(大语言模型)

通过ollama,开发者可以导入和定制自己的模型,无需关注复杂的底层实现细节。

简单来说,就是在自己电脑部署和运行大模型,由自己电脑的硬件提供算力支撑模型运行。

1.1Ollama下载安装

https://ollama.com/download

下载后默认安装路径是C盘,可以使用命令,修改安装路径

复制代码
OllamaSetup.exe /DIR="D:\tools\Ollama\Models"

安装后,可以输入,查看安装的版本号

复制代码
Ollama -v

接下就可以拉取模型,可以拉取

复制代码
ollama pull deepseek-r1:8b
ollama pull qwen3:8b
ollama list

开源的文本嵌入模型工具

复制代码
ollama pull nomic-embed-text
复制代码
ollama run deepseek-r1:8b "你好,请做一个简单的自我介绍"

总结:

Ollama部署:在官网下载并安装客户端即可

蒸馏模型就是对标准大模型核心技能的学习,并进行瘦身,从而获得更低的性能要求。

简单来说蒸馏模型就是标准大模型的学生,学到了老师的核心本领,但是没有老师强。根据参数量的不同,参数量越大,蒸馏模型学到老师核心本领就越扎实,性能越好。

集显:1.5b左右

4G独显:8b以内

8G独显:14b以内

相关推荐
奔跑中的小象2 天前
UOS V2500 沐曦mx-exporter监控加速卡(非K8S)
grafana·prometheus·uos·vllm·沐曦
陈 洪 伟2 天前
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
bug·mlp·vllm
花无缺pize2 天前
vLLM框架:LLM推理的高效机制
服务器·人工智能·vllm
Briwisdom3 天前
MoE 推理优化实战——从“瓶颈罗列“到“性能调优“
gemm·vllm·moe·decode·prefill
Briwisdom4 天前
LLM 推理引擎三强争霸——vLLM vs SGLang vs TensorRT-LLM
tensorrt·vllm·推理引擎·sglang
西柚小萌新4 天前
【大模型:部署】--使用VLLM架构部署本地大模型
vllm
白驹_过隙5 天前
【大模型OCR落地终极排坑:OvisOCR2+vLLM从报错到批量稳定部署全过程】
人工智能·ocr·vllm
一个王同学6 天前
从零到一 | CV转多模态大模型 | week19 | 基于 FastAPI 和 vLLM 的多模态大模型部署
人工智能·深度学习·计算机视觉·fastapi·改行学it·vllm
wyg_0311137 天前
nano-vllm环境安装
vllm
GPUStack9 天前
怎么优雅地在GPUStack上使用minerU?
ai·大模型·llm·gpu·vllm·gpu集群·gpustack