Ollama 使用速查(Windows / RTX 5060 Ti 16GB)
本机环境:Ollama 0.14.2 · RTX 5060 Ti 16GB · 32GB 内存 关键认知:「关模型」和「关服务」是两件事。服务常驻只占几十 MB 内存,显存只在加载模型时才被占用。
一、拉取模型(pull)
bash
ollama pull qwen3-vl:8b # 拉取指定模型
ollama pull qwen3.5:9b # 同档备选
ollama pull gemma4:e4b # 支持音频输入的多模态
拉取过程可中断,重新执行 ollama pull 会断点续传。
二、查看与管理本地模型
| 命令 | 作用 |
|---|---|
ollama list |
列出已下载的全部模型及体积 |
ollama show qwen3-vl:8b |
查看某模型的参数、模板、量化信息 |
ollama rm qwen3-vl:8b |
删除模型,释放磁盘 |
ollama ps |
查看当前正在运行(加载在显存)的模型 |
ollama ps 的输出列含义:
| 列 | 含义 |
|---|---|
| SIZE | 占用的显存/内存总量 |
| PROCESSOR | 100% GPU = 全在显存;出现 CPU/GPU = 溢出到内存,速度暴跌 |
| UNTIL | 还有多久自动卸载(倒计时,默认 5 分钟后) |
三、启动模型(三种方式)
1)交互式对话(最常用)
bash
ollama run qwen3-vl:8b
进入对话界面后直接输入问题;输入 /bye 或按 Ctrl+D 退出。
2)单次提问(问完就走,适合脚本)
bash
ollama run qwen3-vl:8b "用一句话解释什么是量化"
3)只启动服务,用 API 调用(适合接客户端/程序)
bash
ollama serve # Windows 托盘程序通常已在后台跑着,无需手动执行
curl http://localhost:11434/api/chat -d "{\"model\":\"qwen3-vl:8b\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}"
常用启动参数(ollama run 支持):
bash
ollama run qwen3-vl:8b --verbose # 输出真实的 tok/s 速度数据
ollama run qwen3-vl:8b --keepalive 0 # 问完立刻卸载,不占显存
ollama run qwen3-vl:8b --keepalive 2h # 保持加载 2 小时
四、关闭 / 卸载模型
| 场景 | 做法 |
|---|---|
| 立即卸载显存(推荐) | ollama stop qwen3-vl:8b |
| 用完自动卸载,不手动敲命令 | ollama run qwen3-vl:8b --keepalive 0 |
| 什么都不做 | 默认 5 分钟无请求后自动卸载,无需干预 |
| 查看卸载倒计时 | ollama ps,看 UNTIL 列 |
| 退出对话界面 | /bye 或 Ctrl+D(注意:退出对话不会卸载模型) |
时长写法 :0(立即)· 30s · 5m · 2h · -1(永不卸载)
五、关闭 Ollama 服务本身(不想它 24 小时开着)
-
退出托盘程序 :任务栏右下角找到 Ollama 图标 → 右键 → Quit Ollama。 服务随之停止,端口 11434 关闭。
-
临时停止进程 (图形界面不好找时):
bashtaskkill /IM "ollama app.exe" /F taskkill /IM ollama.exe /F -
取消开机自启 :设置 → 应用 → 启动 → 把 Ollama 关掉; 或任务管理器 → 启动应用 → Ollama → 禁用。 (本机注册表启动项中未发现 Ollama 条目,可能装在了其他位置或以服务方式注册,可用任务管理器启动项页确认。)
-
手动再启动 :开始菜单搜索 Ollama 双击即可,或命令行
ollama serve。
六、设置模型存储位置
!IMPORTANT 实测踩坑(2026-09-21 本机验证) Ollama 0.34 桌面版:只改
OLLAMA_MODELS环境变量是无效的! 桌面应用把自己的设置存在C:\Users\<你>\AppData\Local\Ollama\db.sqlite→ 表settings→ 字段models, 应用内设置优先于环境变量。只改环境变量时,服务器日志里依然显示旧路径。判断当前实际生效路径的方法------查看服务器启动日志:
C:\Users\<你>\AppData\Local\Ollama\server.log搜索msg="server config",该行里的OLLAMA_MODELS:就是真正的生效值。
✅ 正确改法(推荐,0.34.2 实测确认有此项)
打开 Ollama 桌面应用 → 设置(Settings) → 找到 「Model location」 (副标题:Location where models are stored.)→ 该输入框是只读的,不能手打 ,点右侧 「Browse」 按钮 → 在系统目录选择器里选目标文件夹 → 自动生效。
实测:Browse 按钮调用的是应用内
selectModelsDirectory()原生目录选择器,选完直接写回设置项Models。 改完建议重启一次 Ollama ,再按上面的方法看server.log确认生效。
备选:直接改数据库(需先完全退出应用)
-
托盘右键 → Quit Ollama(确保进程全部退出)
-
用 SQLite 工具把
settings.models改成目标路径:sqlUPDATE settings SET models = 'D:\ollama\models' WHERE id = 1; -
重新启动 Ollama
环境变量(仅对命令行 / 无桌面应用场景有意义)
powershell
[Environment]::SetEnvironmentVariable("OLLAMA_MODELS", "D:\ollama\models", "User")
设完必须完全重启 Ollama。注意在桌面版上它可能被 db.sqlite 里的设置覆盖。
迁移已有模型(下完再搬也可以,但要守三条)
模型本体就是 models 目录下的普通文件,迁移是官方支持的常规操作,但下面三条缺一不可:
- 必须先完全退出 Ollama(托盘 → Quit Ollama)。服务进程会锁住分片文件,运行中搬会失败或搬出损坏文件。
- 整个
models目录一起搬 ,blobs+manifests两层必须完整。只搬blobs→ollama list会全部变空(磁盘还占着,模型"消失"了)。 - 搬完必须同步把上面的 Model location 改成新路径。只搬文件夹不改设置,Ollama 会继续往旧目录下载。
bash
# 同盘移动是瞬时的;跨盘移动等于复制,6GB 级模型约 1~2 分钟
move C:\Users\35006\.ollama\models D:\ollama\models
搬完验证:
bash
ollama list # 模型列表应和搬之前完全一致
ollama ps # 空表 = 没有模型占用显存
⚠️ 下载到一半不要搬 :分片文件(
*-partial*)只在原目录内可续传,换目录后 Ollama 会丢弃重下。 要么等下载完再搬,要么先改路径再重下(后者更省事)。
其他相关环境变量
| 变量 | 建议值 | 作用 |
|---|---|---|
OLLAMA_KEEP_ALIVE |
5m(默认)或 0 |
全局默认卸载时间;-1 常驻显存 |
OLLAMA_MAX_LOADED_MODELS |
1 |
同时只加载一个模型,16GB 显存建议设 1 |
OLLAMA_MODELS |
见上文警告 | 模型存储位置(桌面版可能被应用设置覆盖) |
OLLAMA_HOST |
127.0.0.1:11434 |
服务监听地址 |
七、本机推荐动作清单
bash
ollama pull qwen3-vl:8b # 先拉基准模型
ollama run qwen3-vl:8b --verbose # 跑一次,看真实 tok/s
ollama ps # 确认 PROCESSOR 是 100% GPU
ollama stop qwen3-vl:8b # 不用时手动卸载
注意 :你的卡是 16GB,一旦 ollama ps 里出现 CPU/GPU 混合,说明模型溢出到系统内存,速度会从 50 tok/s 掉到个位数,直接 ollama stop 换更小的模型即可。