大模型-新手安装Ollama以及大模型调用

文章目录

电脑配置

配置项 最低配置 推荐配置(个人笔记本) 生产配置
💻 CPU 4 核 8 核 16 核+
🧠 RAM 8GB 16GB 32GB+
🎮 GPU ❌ 不需要 ⚡ 可选 (加速推理) 🚀 NVIDIA A100
💾 磁盘 10GB 50GB 200GB+
🕒 响应速度 5-10秒 1-3秒 < 1秒

这里我用的是个人笔记本配置

下载安装Ollama

在官网选择对应的版本下载

https://ollama.com/download

OllamaSetup.exe

Windows直接双击启动时,它默认安装C盘,无法界面选择。当我需要装到D盘时使用如下命令,在下载路径中打开CMD

bash 复制代码
 .\OllamaSetup.exe  /DIR="D:\Ollama"

可以看到它的安装日志已经显示是D盘了

直到下图说明安装完成

CMD命令行验证安装完成,版本号如下

bash 复制代码
ollama --version
ollama version is 0.32.1

更改模型存放地址

默认它会存放在

Linux/macOS系统

默认路径通常为 ~/.ollama/models (用户主目录下的隐藏文件夹)。

  • 验证方法:终端执行 ls -la ~/.ollama/models ,若存在则显示模型文件列表。

Windows系统

默认路径为 %APPDATA%\Ollama\models (如 C:\Users<用户名>.ollama\models )。

◦ 验证方法:Win+R输入 %APPDATA% ,导航至 Ollama\models 文件夹。

使用ollama 下载 LLM 和 Embedding 模型

常见大模型特点

模型 大小 特点 推荐用途
llama3.2 1B / 3B Meta 出品,轻量快速 英文日常对话、简单问答,大小4GB
qwen3.5 0.8B/2B/4B/9B/35B/122B 阿里出品,中文能力强,Instruct集成版性能要求低 中文写作、代码生成
deepseek-r1 1.5B / 7B / 14B / 32B 推理能力突出 逻辑推理、数学计算
mistral 7B 欧洲开源,英文强 英文写作、翻译

qwen3.5:2b-q4_k_m这里是2B量化压缩版本,普通16G笔记本可以使用,磁盘空间占用1.6G;4b版本需要磁盘空间3.2G集显运行时间大约45秒一个简短思考。

这里使用最小版本下载,毕竟笔记本的性能有限,如果你的电脑配置高可以选择更好的模型下载

bash 复制代码
# 1. 下载对话模型(Llama 3.1 8B,约 4.7GB)
ollama pull llama3.1:8b

# 2. 下载 Embedding 模型(用于向量化文本)
ollama pull nomic-embed-text

# 验证模型
ollama list
# 应显示:
# NAME              SIZE   MODIFIED
# llama3.1:8b      4.7 GB  ...
# nomic-embed-text  274 MB  ...

国内下载速度还是挺快的

如上图说明下载完成

查看已经安装的模型

bash 复制代码
 ollama list
NAME                       ID              SIZE      MODIFIED
llama3.1:8b                46e0c10c039e    4.9 GB    15 hours ago
nomic-embed-text:latest    0a109f422b47    274 MB    15 hours ago

启动模型并使用模型对话

bash 复制代码
llama run llama3.1
pulling manifest
pulling 667b0c1932bc: 100% ▕███████████████████████████████████████████████████████████████████████▏ 4.9 GB
pulling 948af2743fc7: 100% ▕███████████████████████████████████████████████████████████████████████▏ 1.5 KB
pulling 0ba8f0e314b4: 100% ▕███████████████████████████████████████████████████████████████████████▏  12 KB
pulling 56bb8bd477a5: 100% ▕███████████████████████████████████████████████████████████████████████▏   96 B
pulling 455f34728c9b: 100% ▕███████████████████████████████████████████████████████████████████████▏  487 B
verifying sha256 digest
writing manifest
success
>>> hello
Hello! How are you today? Is there something I can help you with or would you like to chat?

>>> 你好
You're speaking Chinese! (I think) Hello, nǐ hǎo!

API 调用

使用Ollama 的http服务接口调用

Ollama 启动后会自动在本地运行一个 API 服务,地址是 http://localhost:11434。这意味着你可以通过 HTTP 请求调用模型,就像使用 OpenAI API 一样

bash 复制代码
curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5:7b",
  "prompt": "什么是 Transformer?用一句话解释。",
  "stream": false
}'

也可以在postman中直接测试

在代码中调用

方式1:通过 Python 调用http接口
bash 复制代码
import requests

url = "http://localhost:11434/api/generate"
payload = {
    "model": "qwen2.5:7b",
    "prompt": "用 Python 写一个计算 Fibonacci 数列的函数",
    "stream": False
}

response = requests.post(url, json=payload)
print(response.json()["response"])

本地使用比较直接,无token限制

方式2:直接引入ollama Python 包(推荐)调用
bash 复制代码
##下载ollma包
pip install ollama



import ollama

# 简单对话
response = ollama.chat(
    model="qwen2.5:7b",
    messages=[
        {"role": "system", "content": "你是一个专业的程序员"},
        {"role": "user", "content": "用 Python 实现一个快速排序算法"}
    ]
)

print(response["message"]["content"])

项目内部提供模块化服务使用,无token限制,token检查有专门的模块服务负责

方式3:自定义API调用,这里使用FastApi自定义http服务接口
bash 复制代码
from fastapi import FastAPI
import ollama

app = FastAPI()

@app.post("/chat")
def chat(prompt: str):
    response = ollama.chat(
        model="qwen2.5:7b",
        messages=[{"role": "user", "content": prompt}]
    )
    return {"answer": response["message"]["content"]}

一般项目服务产品,或者给第三方提供服务SAAS采用此种方式,可以在每次调用前校验用户权限,用户的token余额是否足够

python3安装环境依赖

具体安装方式参考我之前的blog

https://blog.csdn.net/zjcjava/article/details/100751958

安装完成cmd查看当前版本如下

bash 复制代码
>python
Python 3.13.7 (tags/v3.13.7:bcee1c3, Aug 14 2025, 14:15:11) [MSC v.1944 64 bit (AMD64)] on win32
Type "help", "copyright", "credits" or "license" for more information.

依赖包说明如下

包名 用途 是否必需
langchain RAG编排框架核心 必需
langchain-ollama Ollama集成(LLM+Embeddings) 必需
chromadb 本地向量数据库; 必需
pypdf PDF文档解析 按需
python-docx Word 文档解析 按需
streamlit Web UI框架 可选
tiktoken Token计数(分块优化) 推荐

安装命令如下(根据系统命令不同替换不同的换行符)

bash 复制代码
# 创建虚拟环境(推荐)
python -m venv rag-env
rag-env\Scripts\activate  # Windows
# source rag-env/bin/activate  # macOS/Linux
# rag-env\Scripts\activate  # Windows

# 安装依赖 windows下 powershell
pip install -U pip
pip install `
  langchain>=0.3.0 `
  langchain-ollama>=0.2.0 `
  langchain-community>=0.3.0 `
  chromadb>=0.5.0 `
  sentence-transformers>=3.0.0 `
  pypdf>=1.13.0 `
  python-docx>=1.1.0 `
  streamlit>=1.39.0 `
  tiktoken>=0.8.0 `
  rank-bm25>=0.2.2 `
  --index-url https://pypi.tuna.tsinghua.edu.cn/simple

##pip 如果是mac,centos则`替换为\
# CMD则`替换为^
相关推荐
weixin_4462608513 小时前
通过恶意输入操控大语言模型行为的MCP环境搭建及应用研究
人工智能·语言模型·自然语言处理
张小泡泡1 天前
AUTO_EVAL:面向大语言模型的多层次自动化评测框架
论文阅读·人工智能·语言模型·自然语言处理·自动化·微调
zzzll11111 天前
Ollama:本地运行大型语言模型的轻量级解决方案
人工智能·语言模型·自然语言处理
如此这般英俊2 天前
手搓Claude Code-第十章 system_prompt
数据结构·人工智能·python·语言模型·自然语言处理·prompt
liyunlong-java2 天前
部署Qwen2.5-VL-3B-Instruc视觉模型的教程
语言模型
leoZ2312 天前
本地跑大模型实战(七):llama.cpp 性能调优,让推理更快更省
java·人工智能·spring·生成对抗网络·语言模型·自然语言处理·llama
硅谷秋水2 天前
EgoSteer:一种基于第一人称视角视频、实现可控灵巧操作的全栈系统
深度学习·机器学习·语言模型·机器人·音视频
AndrewHZ2 天前
【LLM技术全景】阶段总结:技术原理篇核心知识回顾
人工智能·深度学习·算法·语言模型·大模型·llm·芯片开发
WA内核拾荒者3 天前
WhatsApp 多语言 AI 对话的语言模型选择与本地化适配
人工智能·语言模型·php