文章目录
-
- 电脑配置
- 下载安装Ollama
- [使用ollama 下载 LLM 和 Embedding 模型](#使用ollama 下载 LLM 和 Embedding 模型)
- [API 调用](#API 调用)
-
- [使用Ollama 的http服务接口调用](#使用Ollama 的http服务接口调用)
- 在代码中调用
-
- [方式1:通过 Python 调用http接口](#方式1:通过 Python 调用http接口)
- [方式2:直接引入ollama Python 包(推荐)调用](#方式2:直接引入ollama Python 包(推荐)调用)
- 方式3:自定义API调用,这里使用FastApi自定义http服务接口
- python3安装环境依赖
电脑配置
| 配置项 | 最低配置 | 推荐配置(个人笔记本) | 生产配置 |
|---|---|---|---|
| 💻 CPU | 4 核 | 8 核 | 16 核+ |
| 🧠 RAM | 8GB | 16GB | 32GB+ |
| 🎮 GPU | ❌ 不需要 | ⚡ 可选 (加速推理) | 🚀 NVIDIA A100 |
| 💾 磁盘 | 10GB | 50GB | 200GB+ |
| 🕒 响应速度 | 5-10秒 | 1-3秒 | < 1秒 |
这里我用的是个人笔记本配置
下载安装Ollama
在官网选择对应的版本下载
OllamaSetup.exe
Windows直接双击启动时,它默认安装C盘,无法界面选择。当我需要装到D盘时使用如下命令,在下载路径中打开CMD
bash
.\OllamaSetup.exe /DIR="D:\Ollama"
可以看到它的安装日志已经显示是D盘了

直到下图说明安装完成

CMD命令行验证安装完成,版本号如下
bash
ollama --version
ollama version is 0.32.1
更改模型存放地址
默认它会存放在
Linux/macOS系统
默认路径通常为 ~/.ollama/models (用户主目录下的隐藏文件夹)。
- 验证方法:终端执行 ls -la ~/.ollama/models ,若存在则显示模型文件列表。
Windows系统
默认路径为 %APPDATA%\Ollama\models (如 C:\Users<用户名>.ollama\models )。
◦ 验证方法:Win+R输入 %APPDATA% ,导航至 Ollama\models 文件夹。

使用ollama 下载 LLM 和 Embedding 模型
常见大模型特点
| 模型 | 大小 | 特点 | 推荐用途 |
|---|---|---|---|
| llama3.2 | 1B / 3B | Meta 出品,轻量快速 | 英文日常对话、简单问答,大小4GB |
| qwen3.5 | 0.8B/2B/4B/9B/35B/122B | 阿里出品,中文能力强,Instruct集成版性能要求低 | 中文写作、代码生成 |
| deepseek-r1 | 1.5B / 7B / 14B / 32B | 推理能力突出 | 逻辑推理、数学计算 |
| mistral | 7B | 欧洲开源,英文强 | 英文写作、翻译 |
qwen3.5:2b-q4_k_m这里是2B量化压缩版本,普通16G笔记本可以使用,磁盘空间占用1.6G;4b版本需要磁盘空间3.2G集显运行时间大约45秒一个简短思考。
这里使用最小版本下载,毕竟笔记本的性能有限,如果你的电脑配置高可以选择更好的模型下载
bash
# 1. 下载对话模型(Llama 3.1 8B,约 4.7GB)
ollama pull llama3.1:8b
# 2. 下载 Embedding 模型(用于向量化文本)
ollama pull nomic-embed-text
# 验证模型
ollama list
# 应显示:
# NAME SIZE MODIFIED
# llama3.1:8b 4.7 GB ...
# nomic-embed-text 274 MB ...
国内下载速度还是挺快的


如上图说明下载完成
查看已经安装的模型
bash
ollama list
NAME ID SIZE MODIFIED
llama3.1:8b 46e0c10c039e 4.9 GB 15 hours ago
nomic-embed-text:latest 0a109f422b47 274 MB 15 hours ago
启动模型并使用模型对话
bash
llama run llama3.1
pulling manifest
pulling 667b0c1932bc: 100% ▕███████████████████████████████████████████████████████████████████████▏ 4.9 GB
pulling 948af2743fc7: 100% ▕███████████████████████████████████████████████████████████████████████▏ 1.5 KB
pulling 0ba8f0e314b4: 100% ▕███████████████████████████████████████████████████████████████████████▏ 12 KB
pulling 56bb8bd477a5: 100% ▕███████████████████████████████████████████████████████████████████████▏ 96 B
pulling 455f34728c9b: 100% ▕███████████████████████████████████████████████████████████████████████▏ 487 B
verifying sha256 digest
writing manifest
success
>>> hello
Hello! How are you today? Is there something I can help you with or would you like to chat?
>>> 你好
You're speaking Chinese! (I think) Hello, nǐ hǎo!
API 调用
使用Ollama 的http服务接口调用
Ollama 启动后会自动在本地运行一个 API 服务,地址是 http://localhost:11434。这意味着你可以通过 HTTP 请求调用模型,就像使用 OpenAI API 一样
bash
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5:7b",
"prompt": "什么是 Transformer?用一句话解释。",
"stream": false
}'
也可以在postman中直接测试

在代码中调用
方式1:通过 Python 调用http接口
bash
import requests
url = "http://localhost:11434/api/generate"
payload = {
"model": "qwen2.5:7b",
"prompt": "用 Python 写一个计算 Fibonacci 数列的函数",
"stream": False
}
response = requests.post(url, json=payload)
print(response.json()["response"])
本地使用比较直接,无token限制
方式2:直接引入ollama Python 包(推荐)调用
bash
##下载ollma包
pip install ollama
import ollama
# 简单对话
response = ollama.chat(
model="qwen2.5:7b",
messages=[
{"role": "system", "content": "你是一个专业的程序员"},
{"role": "user", "content": "用 Python 实现一个快速排序算法"}
]
)
print(response["message"]["content"])
项目内部提供模块化服务使用,无token限制,token检查有专门的模块服务负责
方式3:自定义API调用,这里使用FastApi自定义http服务接口
bash
from fastapi import FastAPI
import ollama
app = FastAPI()
@app.post("/chat")
def chat(prompt: str):
response = ollama.chat(
model="qwen2.5:7b",
messages=[{"role": "user", "content": prompt}]
)
return {"answer": response["message"]["content"]}
一般项目服务产品,或者给第三方提供服务SAAS采用此种方式,可以在每次调用前校验用户权限,用户的token余额是否足够
python3安装环境依赖
具体安装方式参考我之前的blog
https://blog.csdn.net/zjcjava/article/details/100751958
安装完成cmd查看当前版本如下
bash
>python
Python 3.13.7 (tags/v3.13.7:bcee1c3, Aug 14 2025, 14:15:11) [MSC v.1944 64 bit (AMD64)] on win32
Type "help", "copyright", "credits" or "license" for more information.
依赖包说明如下
| 包名 | 用途 | 是否必需 |
|---|---|---|
| langchain | RAG编排框架核心 | 必需 |
| langchain-ollama | Ollama集成(LLM+Embeddings) | 必需 |
| chromadb | 本地向量数据库; | 必需 |
| pypdf | PDF文档解析 | 按需 |
| python-docx | Word 文档解析 | 按需 |
| streamlit | Web UI框架 | 可选 |
| tiktoken | Token计数(分块优化) | 推荐 |
安装命令如下(根据系统命令不同替换不同的换行符)
bash
# 创建虚拟环境(推荐)
python -m venv rag-env
rag-env\Scripts\activate # Windows
# source rag-env/bin/activate # macOS/Linux
# rag-env\Scripts\activate # Windows
# 安装依赖 windows下 powershell
pip install -U pip
pip install `
langchain>=0.3.0 `
langchain-ollama>=0.2.0 `
langchain-community>=0.3.0 `
chromadb>=0.5.0 `
sentence-transformers>=3.0.0 `
pypdf>=1.13.0 `
python-docx>=1.1.0 `
streamlit>=1.39.0 `
tiktoken>=0.8.0 `
rank-bm25>=0.2.2 `
--index-url https://pypi.tuna.tsinghua.edu.cn/simple
##pip 如果是mac,centos则`替换为\
# CMD则`替换为^