Ollama 本地部署 DeepSeek 完全指南:macOS / Windows / Linux 三端安装 + GPU 配置 + API 调用

发布日期:2026-07-22 | 关键词:Ollama / DeepSeek / 本地部署 / LLM

Ollama 是目前最流行的本地大模型运行工具,GitHub 累计 176,741 Star,底层基于 Georgi Gerganov 的 llama.cpp 项目,支持 macOS、Windows、Linux 三端一键安装,三条命令即可在本地跑起 DeepSeek-R1。本文基于 Ollama 官方文档和模型库,完整覆盖三端安装流程、NVIDIA / AMD GPU 驱动配置、DeepSeek 各版本显存需求对照、REST API 调用,以及 Open WebUI 可视化界面搭建,适合零基础到有经验的开发者。


先看硬件:你的显卡能跑哪个版本?

DeepSeek 模型按参数量分多个档位,选错了要么跑不动,要么速度极慢。以下是 Ollama 官方模型库的实际文件大小与推荐配置:

模型版本 文件大小 上下文 推荐显存 适合场景
deepseek-r1:1.5b 1.1 GB 128K 4 GB+ 入门体验,M 系列 Mac / 低端 PC
deepseek-r1:7b 4.7 GB 128K 8 GB+ 日常使用首选
deepseek-r1:8b(latest) 5.2 GB 128K 8 GB+ 当前默认版本(Qwen3-8B 蒸馏)
deepseek-r1:14b 9.0 GB 128K 16 GB+ 效果更好,RTX 3080 / M2 Pro
deepseek-r1:32b 20 GB 128K 24 GB+ 高质量推理,RTX 4090 / M3 Max
deepseek-r1:70b 43 GB 128K 多卡或 48 GB+ 接近满血效果
deepseek-r1:671b 404 GB 160K 多卡服务器 完整模型

deepseek-v3:671b 同样需要 404 GB,需 Ollama v0.5.5+,适合服务器部署。

GPU 兼容性快速检查:

  • NVIDIA:计算能力 5.0+(GTX 750 Ti 及以上)、驱动版本 550+,RTX 20/30/40/50 全系支持
  • AMD:Linux 需 ROCm v7,支持 RX 6000/7000/9000 系列;Windows 仅支持 RX 7000 系列
  • Apple Silicon:M1 / M2 / M3 / M4 全系支持,统一内存直接当显存用,16 GB 内存可流畅跑 14b

macOS 安装

方法一:命令行(推荐)

bash 复制代码
curl -fsSL https://ollama.com/install.sh | sh

方法二:图形界面安装

前往 ollama.com/download 下载 Ollama.dmg,拖入应用程序文件夹,双击启动。

安装完成后,菜单栏出现 Ollama 图标即代表服务已在后台运行(默认监听 localhost:11434)。

拉取并运行 DeepSeek-R1:

bash 复制代码
# 拉取默认版本(8b,5.2 GB)
ollama pull deepseek-r1

# 直接运行(自动下载+启动交互对话)
ollama run deepseek-r1

# 指定版本
ollama run deepseek-r1:14b

下载完成后,终端出现 >>> 提示符即可直接对话。输入 /bye 退出交互模式,模型仍在后台保持加载状态。


Windows 安装

方法一:PowerShell 一键安装

powershell 复制代码
irm https://ollama.com/install.ps1 | iex

方法二:图形界面安装

前往 ollama.com/download 下载 OllamaSetup.exe,双击安装,完成后系统托盘出现 Ollama 图标。

确认服务运行:

powershell 复制代码
# 检查服务状态
curl http://localhost:11434

# 拉取模型
ollama pull deepseek-r1

# 运行
ollama run deepseek-r1

多 GPU 配置(NVIDIA):

如果有多张显卡,可以通过环境变量限制 Ollama 使用哪张:

powershell 复制代码
# 查看 GPU UUID
nvidia-smi -L

# 指定使用第一张卡(在系统环境变量中设置)
$env:CUDA_VISIBLE_DEVICES = "0"

Linux 安装

一键安装脚本:

bash 复制代码
curl -fsSL https://ollama.com/install.sh | sh

安装完成后 Ollama 会自动配置为 systemd 服务。

NVIDIA GPU 配置

bash 复制代码
# 验证 GPU 驱动(需要 550+)
nvidia-smi

# 确认驱动版本
nvidia-smi --query-gpu=driver_version --format=csv,noheader

如果驱动版本低于 550,前往 NVIDIA 官网下载最新驱动后重新运行安装脚本。

Linux 休眠唤醒后 GPU 丢失问题: 重新加载驱动模块:

bash 复制代码
sudo rmmod nvidia_uvm && sudo modprobe nvidia_uvm

AMD GPU 配置(ROCm v7)

bash 复制代码
# 安装 ROCm(参考 AMD 官方 amdgpu-install 工具)
# 安装完成后下载 Ollama ROCm 扩展
curl -fsSL https://ollama.com/download/ollama-linux-amd64-rocm.tar.zst \
    | sudo tar x -C /usr

如果你的 AMD GPU 不在官方支持列表,可以尝试强制指定最近的 LLVM target,例如 RX 5400(gfx1034)可以尝试使用 gfx1030 的参数:

bash 复制代码
export HSA_OVERRIDE_GFX_VERSION="10.3.0"

配置为 systemd 服务(生产环境推荐)

安装脚本已自动创建服务,手动管理命令:

bash 复制代码
# 查看服务状态
sudo systemctl status ollama

# 设置开机自启
sudo systemctl enable ollama

# 重启服务
sudo systemctl restart ollama

# 查看日志
journalctl -u ollama -f

自定义配置(如修改监听端口或开启远程访问):

bash 复制代码
sudo systemctl edit ollama

在弹出编辑器中添加:

ini 复制代码
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"

常用命令速查

bash 复制代码
# 查看已下载的模型
ollama list

# 删除模型
ollama rm deepseek-r1:7b

# 更新模型
ollama pull deepseek-r1

# 查看模型详情
ollama show deepseek-r1

# 后台运行服务(不启动终端 UI)
ollama serve

REST API 调用

Ollama 在本地 11434 端口提供完整的 REST API,兼容 OpenAI 接口格式:

bash 复制代码
# 基础对话
curl http://localhost:11434/api/chat \
  -d '{
    "model": "deepseek-r1",
    "messages": [{"role": "user", "content": "用 Python 写一个快速排序"}],
    "stream": false
  }'

Python 调用:

bash 复制代码
pip install ollama
python 复制代码
from ollama import chat

response = chat(
    model='deepseek-r1',
    messages=[{'role': 'user', 'content': '用 Python 写一个快速排序'}]
)
print(response.message.content)

JavaScript 调用:

bash 复制代码
npm i ollama
javascript 复制代码
import ollama from 'ollama'

const response = await ollama.chat({
  model: 'deepseek-r1',
  messages: [{ role: 'user', content: '用 Python 写一个快速排序' }]
})
console.log(response.message.content)

本地资源不足时,也可以通过支持 OpenAI 兼容接口的云端服务补充------例如七牛云 AI 推理服务提供 DeepSeek 系列模型的 API 接入,只需将 base_url 替换即可,代码结构与本地调用完全一致。


搭一个可视化界面:Open WebUI

不想用命令行,可以用 Open WebUI,Docker 一条命令搞定:

bash 复制代码
docker run -d \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

浏览器打开 http://localhost:3000,在设置中将 Ollama API 地址填入 http://host.docker.internal:11434,即可在 Web 界面与本地 DeepSeek 对话。


常见问题

Q:ollama run 后模型下载很慢,能加速吗?

Ollama 模型托管在 Cloudflare,国内直连速度因网络环境差异较大。可以在 ollama pull 命令前设置代理:

bash 复制代码
export https_proxy=http://127.0.0.1:7890
ollama pull deepseek-r1

或者在局域网内搭一台已经下好模型的机器,通过 OLLAMA_HOST=0.0.0.0 开启远程访问,其他机器直接用。

Q:CPU 能不能跑?

能,但很慢。Ollama 在没有 GPU 时自动回退 CPU 推理,7b 模型在 CPU 上大约每秒 3-8 个 token。1.5b 模型 CPU 体验相对可接受,14b 以上建议有 GPU 再运行。

Q:M 系列 Mac 怎么最大化利用统一内存?

Ollama 会自动调度 Apple Neural Engine + GPU,无需额外配置。M2 Pro(16 GB)跑 14b 问题不大;M3 Max(36 GB)可以流畅跑 32b。注意不要同时开其他内存占用大的应用。

Q:Ollama 更新后模型需要重新下载吗?

不需要,模型文件存储在独立路径(macOS/Linux:~/.ollama/models;Windows:C:\Users\<用户名>\.ollama\models),Ollama 版本更新不影响已下载的模型。


结语

Ollama 把本地大模型部署的门槛压到了极低------三端安装命令都在 1-2 行之内,DeepSeek-R1 的 8b 版本在任何有 8 GB 显存的机器上都能流畅运行。从 1.5b 到 671b,覆盖了从入门体验到生产部署的完整参数区间,MIT 协议可商用。

Ollama 官方 GitHub 最后更新于 2026 年 7 月,GPU 支持文档涵盖 NVIDIA RTX 50xx 最新架构和 AMD ROCm v7 全系支持,本文所有命令基于当前官方文档,建议定期访问 docs.ollama.com 获取最新信息。


延伸资源

相关推荐
我星期八休息3 小时前
网络编程—NAT、代理服务与内网穿透
linux·服务器·网络·网络协议
Logintern094 小时前
Langgraph使用MemorySaver建立有记忆的图
开发语言·windows·python
北漂燕郊杨哥4 小时前
phpStudy 手工安装最新稳定版 PHP 8.5.9(NTS)方法(Windows 本地开发)
windows·php·phpstudy
RisunJan4 小时前
Linux命令-sysctl(运行时修改内核参数)
linux·网络·智能路由器
yunwei374 小时前
eBPF 教程:使用 fsession 追踪慢速 vfs_read 调用
linux·云原生
A_humble_scholar4 小时前
Linux 网络基础(三)下的 HTTP 核心详解:从请求响应到状态管
linux·网络·http
Albart5754 小时前
Docker Desktop最新版安装踩坑全记录(Windows_Mac_Linux)【2026 4.74.0 终版】
linux·windows·macos·docker·环境搭建·踩坑记录
青 春 记 忆5 小时前
零基础入门python07:让程序记住数据——JSON文件和异常处理
开发语言·windows·python·json·python3.11
举手5 小时前
Epoll模型
linux·c++·学习
Escalating_xu5 小时前
【Linux】基础 I/O 深度解析:FILE、文件描述符、open/read/write、重定向与缓冲区
java·linux·服务器