2026/08/16 AI学习笔记

一 . Ollama学习笔记

1. ollama概述

Ollama 可以理解成"本地版的 OpenAI API",可以直接调用,不需要通过互联网。

没有部署的:

你的电脑

│

▼

Spring AI

│

▼

互联网

│

▼

DeepSeek / OpenAI / 豆包

│

▼

返回结果

部署ollama的:

你的电脑

│

▼

Spring AI

│

▼

Ollama

│

▼

Qwen3 8B

│

▼

返回结果

2. ollama的优势

1. 模型切换方便

想测试:

Qwen3

DeepSeek

Llama

Gemma

Mistral

直接下面命令下载:

ollama pull qwen3:8b

ollama pull gemma3:4b

ollama list进行查看:

想使用哪个,可以直接运行:

ollama run qwen3:8b

ollama run gemma3:4b

2. ollama不是运行器

AI应用

│

▼

Spring AI

│

▼

┌───────────┐

│ Ollama │ ← 运行器/API

└───── ┬─────┘

│

┌─────── ┴────────┐

▼ ▼

Qwen3 8B Embedding模型

│

▼

GPU / CPU

ollama不是大模型,它是一个负责运行大模型的软件。

  1. 后续学习路线

spring ai和ollama本地大模型进行交互

3. CPU,GPU,Ollama,大模型之间的关联

1. 本机电脑说明

例如下面电脑的配置:

CPU:i7-8750H

RAM:16GB

GPU:GTX 1060 6GB

运行:

Ollama

↓

Qwen3 8B

实际上是 CPU + RAM + GPU + 显存一起协作,只是各自负责的工作不一样。

RAM 是"仓库",显存是"GPU旁边的小仓库",CPU/GPU 是"工人"。

2. Ollama 为什么会消耗 GPU?

因为Ollama是模型运行器,真正工作的是CPU/GPU。

真正消耗GPU的是:Qwen3 模型的神经网络计算。

Ollama 只是负责把这些计算任务安排给 CPU/GPU。

3. 为什么大模型特别喜欢 GPU

因为大模型最核心的工作,本质上是:

大量矩阵运算。

比如神经网络里面会出现大量:

矩阵 × 矩阵

矩阵 × 向量

假设有:

A = 1000 × 1000

B = 1000 × 1000

计算:

A × B

需要做非常多的乘法和加法。

cpu也可以算。

但是 CPU 更擅长:

少量、复杂、串行

而 GPU 非常擅长:

大量、简单、并行

所以:

CPU:

一个工人

一个一个处理

GPU:

几千个小工人

同时处理

这就是为什么大模型推理非常适合 GPU。

4. RAM 和显存有什么区别

RAM:

容量比较大,CPU使用。

VRAM:

GPU自己的高速内存,GPU使用。

5. ollama启动时候,模型是如何进行加载的

启动:

ollama run qwen3:8b

发生:

流程:

第一步: 模型放在E盘

第二步: Ollama运行模型

E盘

↓

RAM

把模型加载到内存。

第二步: 如果 GPU 可用

RAM

↓

VRAM

把一部分模型放到显存。

第四步:GPU开始计算:

GPU

↓

矩阵运算

↓

生成token

  1. CPU + GPU 混合运行

一部分计算放 GPU。另一部分留给 CPU。

电脑运行时候大模型的真实情况:

6. CPU消耗啥

① 模型加载

硬盘 → RAM

② CPU上的模型计算

如果模型有一部分没有放到 GPU

CPU

↓
计算

③ 数据处理

Prompt

↓

Tokenizer

↓

Token

这些也可能消耗 CPU。

7. RAM 到底消耗什么

模型权重

CPU计算部分

GPU传输缓存

KV Cache

Ollama

Windows

IDEA

Spring Boot

8. GPU 到底消耗什么

GPU主要负责:

大规模并行计算。

比如:

Token

↓

Embedding

↓

Transformer

↓

Attention

↓

Linear

↓

Transformer

↓

...

↓

下一个Token

其中大量矩阵计算可以交给 GPU。

9. GPU利用率和显存占用不是一回事

GPU利用率: GPU计算有多忙。

显存占用: GPU里面放了多少数据.

例如: 5.5GB / 6GB

说明:GPU显存快装满了。

10. 为什么 GPU 会比 CPU 快

100万对的相似的小计算,cpu一个一个串行处理,gpu大量的的并行处理。

相关推荐
一隅论数智6 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
XiHongShi20166 天前
STM32F407 RTC定时器例程,建议保存
stm32·单片机·学习
爱吃苹果的日记本6 天前
离散数学第六课
学习·离散数学
AI职业加油站6 天前
AI智能体应用工程师证书:政策红利下的职业新风口
大数据·运维·人工智能·学习·职场发展
深圳老胡6 天前
STM32F407 控制 L6470 步进电机驱动 —— 控制过程简介
笔记·stm32·单片机·嵌入式硬件·代码规范
旖旎夜光6 天前
力控面试题 01.01: 判定字符是否唯一(位运算) —— 题解
c++·学习·算法·leetcode·力控
奇思妙想聪明勤奋的小羊6 天前
DeepAgents第5章:子Agent 与上下文隔离—让 Agent学会委派
人工智能·python·学习·语言模型
Because_of_Her16 天前
并查集-听课笔记
笔记·算法·并查集
霍霍的袁6 天前
【C++】map 和 set 的使用 | 从用法到底层
开发语言·c++·学习·visual studio