Ollama-使用速查

Ollama 使用速查(Windows / RTX 5060 Ti 16GB)

本机环境:Ollama 0.14.2 · RTX 5060 Ti 16GB · 32GB 内存 关键认知:「关模型」和「关服务」是两件事。服务常驻只占几十 MB 内存,显存只在加载模型时才被占用。


一、拉取模型(pull)

bash 复制代码
ollama pull qwen3-vl:8b        # 拉取指定模型
ollama pull qwen3.5:9b         # 同档备选
ollama pull gemma4:e4b         # 支持音频输入的多模态

拉取过程可中断,重新执行 ollama pull断点续传


二、查看与管理本地模型

命令 作用
ollama list 列出已下载的全部模型及体积
ollama show qwen3-vl:8b 查看某模型的参数、模板、量化信息
ollama rm qwen3-vl:8b 删除模型,释放磁盘
ollama ps 查看当前正在运行(加载在显存)的模型

ollama ps 的输出列含义:

含义
SIZE 占用的显存/内存总量
PROCESSOR 100% GPU = 全在显存;出现 CPU/GPU = 溢出到内存,速度暴跌
UNTIL 还有多久自动卸载(倒计时,默认 5 分钟后)

三、启动模型(三种方式)

1)交互式对话(最常用)

bash 复制代码
ollama run qwen3-vl:8b

进入对话界面后直接输入问题;输入 /bye 或按 Ctrl+D 退出。

2)单次提问(问完就走,适合脚本)

bash 复制代码
ollama run qwen3-vl:8b "用一句话解释什么是量化"

3)只启动服务,用 API 调用(适合接客户端/程序)

bash 复制代码
ollama serve    # Windows 托盘程序通常已在后台跑着,无需手动执行
curl http://localhost:11434/api/chat -d "{\"model\":\"qwen3-vl:8b\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}"

常用启动参数(ollama run 支持):

bash 复制代码
ollama run qwen3-vl:8b --verbose          # 输出真实的 tok/s 速度数据
ollama run qwen3-vl:8b --keepalive 0      # 问完立刻卸载,不占显存
ollama run qwen3-vl:8b --keepalive 2h     # 保持加载 2 小时

四、关闭 / 卸载模型

场景 做法
立即卸载显存(推荐) ollama stop qwen3-vl:8b
用完自动卸载,不手动敲命令 ollama run qwen3-vl:8b --keepalive 0
什么都不做 默认 5 分钟无请求后自动卸载,无需干预
查看卸载倒计时 ollama ps,看 UNTIL 列
退出对话界面 /byeCtrl+D注意:退出对话不会卸载模型

时长写法0(立即)· 30s · 5m · 2h · -1(永不卸载)


五、关闭 Ollama 服务本身(不想它 24 小时开着)

  1. 退出托盘程序 :任务栏右下角找到 Ollama 图标 → 右键 → Quit Ollama。 服务随之停止,端口 11434 关闭。

  2. 临时停止进程 (图形界面不好找时):

    bash 复制代码
    taskkill /IM "ollama app.exe" /F
    taskkill /IM ollama.exe /F
  3. 取消开机自启 :设置 → 应用 → 启动 → 把 Ollama 关掉; 或任务管理器 → 启动应用 → Ollama → 禁用。 (本机注册表启动项中未发现 Ollama 条目,可能装在了其他位置或以服务方式注册,可用任务管理器启动项页确认。)

  4. 手动再启动 :开始菜单搜索 Ollama 双击即可,或命令行 ollama serve


六、设置模型存储位置

!IMPORTANT 实测踩坑(2026-09-21 本机验证) Ollama 0.34 桌面版:只改 OLLAMA_MODELS 环境变量是无效的! 桌面应用把自己的设置存在 C:\Users\<你>\AppData\Local\Ollama\db.sqlite → 表 settings → 字段 models应用内设置优先于环境变量。只改环境变量时,服务器日志里依然显示旧路径。

判断当前实际生效路径的方法------查看服务器启动日志: C:\Users\<你>\AppData\Local\Ollama\server.log 搜索 msg="server config",该行里的 OLLAMA_MODELS: 就是真正的生效值。

✅ 正确改法(推荐,0.34.2 实测确认有此项)

打开 Ollama 桌面应用 → 设置(Settings) → 找到 「Model location」 (副标题:Location where models are stored.)→ 该输入框是只读的,不能手打 ,点右侧 「Browse」 按钮 → 在系统目录选择器里选目标文件夹 → 自动生效。

实测:Browse 按钮调用的是应用内 selectModelsDirectory() 原生目录选择器,选完直接写回设置项 Models。 改完建议重启一次 Ollama ,再按上面的方法看 server.log 确认生效。

备选:直接改数据库(需先完全退出应用)

  1. 托盘右键 → Quit Ollama(确保进程全部退出)

  2. 用 SQLite 工具把 settings.models 改成目标路径:

    sql 复制代码
    UPDATE settings SET models = 'D:\ollama\models' WHERE id = 1;
  3. 重新启动 Ollama

环境变量(仅对命令行 / 无桌面应用场景有意义)

powershell 复制代码
[Environment]::SetEnvironmentVariable("OLLAMA_MODELS", "D:\ollama\models", "User")

设完必须完全重启 Ollama。注意在桌面版上它可能被 db.sqlite 里的设置覆盖。

迁移已有模型(下完再搬也可以,但要守三条)

模型本体就是 models 目录下的普通文件,迁移是官方支持的常规操作,但下面三条缺一不可:

  1. 必须先完全退出 Ollama(托盘 → Quit Ollama)。服务进程会锁住分片文件,运行中搬会失败或搬出损坏文件。
  2. 整个 models 目录一起搬blobs + manifests 两层必须完整。只搬 blobsollama list 会全部变空(磁盘还占着,模型"消失"了)。
  3. 搬完必须同步把上面的 Model location 改成新路径。只搬文件夹不改设置,Ollama 会继续往旧目录下载。
bash 复制代码
# 同盘移动是瞬时的;跨盘移动等于复制,6GB 级模型约 1~2 分钟
move C:\Users\35006\.ollama\models D:\ollama\models

搬完验证:

bash 复制代码
ollama list          # 模型列表应和搬之前完全一致
ollama ps            # 空表 = 没有模型占用显存

⚠️ 下载到一半不要搬 :分片文件(*-partial*)只在原目录内可续传,换目录后 Ollama 会丢弃重下。 要么等下载完再搬,要么先改路径再重下(后者更省事)。

其他相关环境变量

变量 建议值 作用
OLLAMA_KEEP_ALIVE 5m(默认)或 0 全局默认卸载时间;-1 常驻显存
OLLAMA_MAX_LOADED_MODELS 1 同时只加载一个模型,16GB 显存建议设 1
OLLAMA_MODELS 见上文警告 模型存储位置(桌面版可能被应用设置覆盖)
OLLAMA_HOST 127.0.0.1:11434 服务监听地址

七、本机推荐动作清单

bash 复制代码
ollama pull qwen3-vl:8b                     # 先拉基准模型
ollama run qwen3-vl:8b --verbose            # 跑一次,看真实 tok/s
ollama ps                                   # 确认 PROCESSOR 是 100% GPU
ollama stop qwen3-vl:8b                     # 不用时手动卸载

注意 :你的卡是 16GB,一旦 ollama ps 里出现 CPU/GPU 混合,说明模型溢出到系统内存,速度会从 50 tok/s 掉到个位数,直接 ollama stop 换更小的模型即可。

相关推荐
ServBay44 分钟前
Jev是什么?哑巴模型居然全网爆火
后端·aigc·ai编程
烈风逍遥1 小时前
第六篇:RAG 知识库构建与检索全链路
前端·人工智能·后端
花椒技术1 小时前
Agent 沙箱怎么接入生产?花椒的选型、持久化与执行协议实践
人工智能·后端·agent
独泪了无痕1 小时前
Hutool之ArrayUtil:解锁数组操作的新境界
后端
杨运交1 小时前
[074][示例]基于Redisson的分布式锁在定时任务中的实践与异常模拟
java·后端·spring
步行cgn1 小时前
Spring 中完整的 Scope 选项详解
java·后端·spring
LEE2 小时前
前端转型全栈 03:接口失败也返回 200,OpenAPI 契约与错误码怎么定
前端·后端·全栈
打工仔折腾 AI3 小时前
用 Docker 部署 Excalidraw 手绘白板并配置固定公网访问的完整实践
人工智能·后端·python
山岚的运维笔记3 小时前
mysql 专业笔记 -- 第 36 章:MySQL 管理
运维·数据库·笔记·后端·mysql·oracle·dba