2026/08/16 AI学习笔记

一 . Ollama学习笔记

1. ollama概述

Ollama 可以理解成"本地版的 OpenAI API",可以直接调用,不需要通过互联网。

没有部署的:

你的电脑

Spring AI

互联网

DeepSeek / OpenAI / 豆包

返回结果

部署ollama的:

你的电脑

Spring AI

Ollama

Qwen3 8B

返回结果

2. ollama的优势

1. 模型切换方便

想测试:

Qwen3

DeepSeek

Llama

Gemma

Mistral

直接下面命令下载:

ollama pull qwen3:8b

ollama pull gemma3:4b

ollama list进行查看:

想使用哪个,可以直接运行:

ollama run qwen3:8b

ollama run gemma3:4b

2. ollama不是运行器

AI应用

Spring AI

┌───────────┐

│ Ollama │ ← 运行器/API

└───── ┬─────┘

┌─────── ┴────────┐

▼ ▼

Qwen3 8B Embedding模型

GPU / CPU

ollama不是大模型,它是一个负责运行大模型的软件。

  1. 后续学习路线

spring ai和ollama本地大模型进行交互

3. CPU,GPU,Ollama,大模型之间的关联

1. 本机电脑说明

例如下面电脑的配置:

CPU:i7-8750H

RAM:16GB

GPU:GTX 1060 6GB

运行:

Ollama

Qwen3 8B

实际上是 CPU + RAM + GPU + 显存一起协作,只是各自负责的工作不一样。

RAM 是"仓库",显存是"GPU旁边的小仓库",CPU/GPU 是"工人"。

2. Ollama 为什么会消耗 GPU?

因为Ollama是模型运行器,真正工作的是CPU/GPU。

真正消耗GPU的是:Qwen3 模型的神经网络计算。

Ollama 只是负责把这些计算任务安排给 CPU/GPU。

3. 为什么大模型特别喜欢 GPU

因为大模型最核心的工作,本质上是:

大量矩阵运算。

比如神经网络里面会出现大量:

矩阵 × 矩阵

矩阵 × 向量

假设有:

A = 1000 × 1000

B = 1000 × 1000

计算:

A × B

需要做非常多的乘法和加法。

cpu也可以算。

但是 CPU 更擅长:

少量、复杂、串行

而 GPU 非常擅长:

大量、简单、并行

所以:

CPU:

一个工人

一个一个处理

GPU:

几千个小工人

同时处理

这就是为什么大模型推理非常适合 GPU。

4. RAM 和显存有什么区别

RAM:

容量比较大,CPU使用。

VRAM:

GPU自己的高速内存,GPU使用。

5. ollama启动时候,模型是如何进行加载的

启动:

ollama run qwen3:8b

发生:

流程:

第一步: 模型放在E盘

第二步: Ollama运行模型

E盘

RAM

把模型加载到内存。

第二步: 如果 GPU 可用

RAM

VRAM

把一部分模型放到显存。

第四步:GPU开始计算:

GPU

矩阵运算

生成token

  1. CPU + GPU 混合运行

一部分计算放 GPU。另一部分留给 CPU。

电脑运行时候大模型的真实情况:

6. CPU消耗啥

① 模型加载

硬盘 → RAM

② CPU上的模型计算

如果模型有一部分没有放到 GPU

CPU


计算

③ 数据处理

Prompt

Tokenizer

Token

这些也可能消耗 CPU。

7. RAM 到底消耗什么

模型权重

CPU计算部分

GPU传输缓存

KV Cache

Ollama

Windows

IDEA

Spring Boot

8. GPU 到底消耗什么

GPU主要负责:

大规模并行计算。

比如:

Token

Embedding

Transformer

Attention

Linear

Transformer

...

下一个Token

其中大量矩阵计算可以交给 GPU。

9. GPU利用率和显存占用不是一回事

GPU利用率: GPU计算有多忙。

显存占用: GPU里面放了多少数据.

例如: 5.5GB / 6GB

说明:GPU显存快装满了。

10. 为什么 GPU 会比 CPU 快

100万对的相似的小计算,cpu一个一个串行处理,gpu大量的的并行处理。

相关推荐
wp123_14 小时前
硬件设计笔记:1μH功率电感选型实战——线艺 XFL4020-102MEC 与 国产 pin to pin MVLH4020-1R0M 详细参数测评
笔记·科技·硬件架构·硬件工程
zyf1044164 小时前
暑期实践日志 Day48:复盘大纲与知识点对照表,系统汇总整理成果
学习·计算机网络·剪辑·暑期实践·课题任务
摇滚侠4 小时前
《SpringBoot 3:入门与应用实战》第 14 章 打包与部署 Spring Boot 应用打包 阅读笔记 41
spring boot·笔记·后端
金立基包装胶水4 小时前
纸袋热封胶常见都有哪些问题?
大数据·笔记·其他
chnyi6_ya5 小时前
论文阅读笔记 | HoneyBee: Data Recipes for Vision-Language Reasoners
论文阅读·笔记
repetitiononeoneday5 小时前
【每日规划与反思】2026.9.4
笔记
江湖人称菠萝包5 小时前
【Windows】《深入浅出Windows API程序设计:编程基础篇》笔记-Chapter1-基础知识
windows·笔记
m4Rk_5 小时前
【论文阅读】Agent 记忆机制(61):CFGM——用粗到细的记忆落地贯通经验采集、知识蒸馏与在线纠错
论文阅读·人工智能·学习·开源·github
边境悍匪5 小时前
蜗牛学苑 Java 智能体学习 Day33|AOP 面向切面编程、日志技术思维导图复盘
学习
我是你的开心果7786 小时前
ai全栈软件开发day21(第四阶段喽)
人工智能·学习