一 . Ollama学习笔记
1. ollama概述
Ollama 可以理解成"本地版的 OpenAI API",可以直接调用,不需要通过互联网。
没有部署的:
你的电脑
│
▼
Spring AI
│
▼
互联网
│
▼
DeepSeek / OpenAI / 豆包
│
▼
返回结果
部署ollama的:
你的电脑
│
▼
Spring AI
│
▼
Ollama
│
▼
Qwen3 8B
│
▼
返回结果
2. ollama的优势
1. 模型切换方便
想测试:
Qwen3
DeepSeek
Llama
Gemma
Mistral
直接下面命令下载:
ollama pull qwen3:8b
ollama pull gemma3:4b
ollama list进行查看:
想使用哪个,可以直接运行:
ollama run qwen3:8b
ollama run gemma3:4b
2. ollama不是运行器
AI应用
│
▼
Spring AI
│
▼
┌───────────┐
│ Ollama │ ← 运行器/API
└───── ┬─────┘
│
┌─────── ┴────────┐
▼ ▼
Qwen3 8B Embedding模型
│
▼
GPU / CPU
ollama不是大模型,它是一个负责运行大模型的软件。
- 后续学习路线
spring ai和ollama本地大模型进行交互


3. CPU,GPU,Ollama,大模型之间的关联
1. 本机电脑说明
例如下面电脑的配置:
CPU:i7-8750H
RAM:16GB
GPU:GTX 1060 6GB
运行:
Ollama
↓
Qwen3 8B
实际上是 CPU + RAM + GPU + 显存一起协作,只是各自负责的工作不一样。

RAM 是"仓库",显存是"GPU旁边的小仓库",CPU/GPU 是"工人"。
2. Ollama 为什么会消耗 GPU?
因为Ollama是模型运行器,真正工作的是CPU/GPU。

真正消耗GPU的是:Qwen3 模型的神经网络计算。
Ollama 只是负责把这些计算任务安排给 CPU/GPU。
3. 为什么大模型特别喜欢 GPU
因为大模型最核心的工作,本质上是:
大量矩阵运算。
比如神经网络里面会出现大量:
矩阵 × 矩阵
矩阵 × 向量
假设有:
A = 1000 × 1000
B = 1000 × 1000
计算:
A × B
需要做非常多的乘法和加法。
cpu也可以算。
但是 CPU 更擅长:
少量、复杂、串行
而 GPU 非常擅长:
大量、简单、并行
所以:
CPU:
一个工人
一个一个处理
GPU:
几千个小工人
同时处理
这就是为什么大模型推理非常适合 GPU。
4. RAM 和显存有什么区别

RAM:
容量比较大,CPU使用。
VRAM:
GPU自己的高速内存,GPU使用。
5. ollama启动时候,模型是如何进行加载的
启动:
ollama run qwen3:8b
发生:

流程:
第一步: 模型放在E盘
第二步: Ollama运行模型
E盘
↓
RAM
把模型加载到内存。
第二步: 如果 GPU 可用
RAM
↓
VRAM
把一部分模型放到显存。
第四步:GPU开始计算:
GPU
↓
矩阵运算
↓
生成token
- CPU + GPU 混合运行

一部分计算放 GPU。另一部分留给 CPU。
电脑运行时候大模型的真实情况:

6. CPU消耗啥
① 模型加载
硬盘 → RAM
② CPU上的模型计算
如果模型有一部分没有放到 GPU
CPU
↓
计算
③ 数据处理
Prompt
↓
Tokenizer
↓
Token
这些也可能消耗 CPU。
7. RAM 到底消耗什么
模型权重
CPU计算部分
GPU传输缓存
KV Cache
Ollama
Windows
IDEA
Spring Boot
8. GPU 到底消耗什么
GPU主要负责:
大规模并行计算。
比如:
Token
↓
Embedding
↓
Transformer
↓
Attention
↓
Linear
↓
Transformer
↓
...
↓
下一个Token
其中大量矩阵计算可以交给 GPU。

9. GPU利用率和显存占用不是一回事
GPU利用率: GPU计算有多忙。
显存占用: GPU里面放了多少数据.
例如: 5.5GB / 6GB
说明:GPU显存快装满了。
10. 为什么 GPU 会比 CPU 快
100万对的相似的小计算,cpu一个一个串行处理,gpu大量的的并行处理。