25 Ollama 本地部署

Ollama 本地部署

复制代码
云端	现在
请求发送到 DeepSeek / SiliconFlow 服务器
请求发送到本机 localhost:11434
需要 API Key,按 token 收费
无需 API Key,免费无限次
速度受网络影响
速度受本机 GPU/CPU 影响

Ollama 是什么

Ollama 是一个本地 LLM 运行时------你在本机启动一个 HTTP 服务,它负责加载模型、推理、返回结果。接口格式与 OpenAI 完全兼容.

复制代码
用户 Python 代码
    ↓ HTTP POST /api/chat
Ollama 服务(localhost:11434)
    ↓ 推理
本地模型文件(~/.ollama/models/)

三个核心概念

  1. Ollama 服务:后台常驻进程,类似数据库服务,负责加载和运行模型。

  2. Model Tag:模型名+版本,格式 名称:参数量。例如 qwen2.5:1.5b 表示 Qwen2.5 的 15亿参数版本(约 1GB,CPU 可跑)。

  3. ChatOllama:LangChain 专门封装的 Ollama 客户端,用法与 ChatOpenAI 几乎一致。

安装步骤

第一步:安装 Ollama

ollama.com 下载 Windows 安装包,安装后 Ollama 自动在后台运行。

验证:

复制代码
ollama --version

第二步:拉取一个小模型

复制代码
ollama pull qwen2.5:1.5b

qwen2.5:1.5b 只有约 1GB,CPU 可以跑,适合测试。拉完后验证:

复制代码
ollama list

第三步:安装 Python 依赖

复制代码
pip install langchain-ollama

示例代码:

py 复制代码
from datetime import datetime

from langchain_core.messages import HumanMessage
from langchain_ollama import ChatOllama


def main():
    model_name = "qwen2.5:1.5b"
    time_begin = datetime.now()
    llm = ChatOllama(model=model_name, client_kwargs={"trust_env": False})
    result = llm.invoke([HumanMessage(content="你好。")])
    print(result.content)
    print(f"Model: {model_name}, 耗时: {datetime.now() - time_begin}")


if __name__ == "__main__":
    main()
相关推荐
虎虎(_ _)。゜zzZ1 天前
零基础本地部署Qwen2.5-7B:从环境准备到模型对话的完整实操
agent·ollama·本地大模型·qwen2.5·离线ai·llm部署
智嵌研习社6 天前
Ollama本地大模型部署实战指南:从环境搭建到生产级API调用全解析
ollama·本地大模型部署
每日出拳老爷子8 天前
【AI】Ollama 更新后 skipping CUDA 掉回 CPU
gpu·nvidia·cuda·ollama·本地大模型
beyond谚语11 天前
六、LangChain——StrOutputParser和JsonOutputParser
langchain·rag·ollama
大模型真好玩16 天前
大模型训练全流程实战指南实战篇(十四)——网络安全大模型数据获取
人工智能·ollama·deepseek
蜡台16 天前
本地搭建 AI 大模型完整实战指南(2026)
人工智能·ollama
lee_curry18 天前
Dify+Ollama私有化部署方案
ai大模型·dify·ollama
蛋先生DX19 天前
大模型本地部署神器的瘦身进阶原理,就这两招?
llm·llama·ollama
geminigoth20 天前
LangChain1.2学习第二章—— 调用大模型
ollama·本地部署大模型·deepseek接口·qwen接口·langchain调用大模型·阻塞大模型接口·非阻塞大模型接口