25 Ollama 本地部署

Ollama 本地部署

复制代码
云端	现在
请求发送到 DeepSeek / SiliconFlow 服务器
请求发送到本机 localhost:11434
需要 API Key,按 token 收费
无需 API Key,免费无限次
速度受网络影响
速度受本机 GPU/CPU 影响

Ollama 是什么

Ollama 是一个本地 LLM 运行时------你在本机启动一个 HTTP 服务,它负责加载模型、推理、返回结果。接口格式与 OpenAI 完全兼容.

复制代码
用户 Python 代码
    ↓ HTTP POST /api/chat
Ollama 服务(localhost:11434)
    ↓ 推理
本地模型文件(~/.ollama/models/)

三个核心概念

  1. Ollama 服务:后台常驻进程,类似数据库服务,负责加载和运行模型。

  2. Model Tag:模型名+版本,格式 名称:参数量。例如 qwen2.5:1.5b 表示 Qwen2.5 的 15亿参数版本(约 1GB,CPU 可跑)。

  3. ChatOllama:LangChain 专门封装的 Ollama 客户端,用法与 ChatOpenAI 几乎一致。

安装步骤

第一步:安装 Ollama

ollama.com 下载 Windows 安装包,安装后 Ollama 自动在后台运行。

验证:

复制代码
ollama --version

第二步:拉取一个小模型

复制代码
ollama pull qwen2.5:1.5b

qwen2.5:1.5b 只有约 1GB,CPU 可以跑,适合测试。拉完后验证:

复制代码
ollama list

第三步:安装 Python 依赖

复制代码
pip install langchain-ollama

示例代码:

py 复制代码
from datetime import datetime

from langchain_core.messages import HumanMessage
from langchain_ollama import ChatOllama


def main():
    model_name = "qwen2.5:1.5b"
    time_begin = datetime.now()
    llm = ChatOllama(model=model_name, client_kwargs={"trust_env": False})
    result = llm.invoke([HumanMessage(content="你好。")])
    print(result.content)
    print(f"Model: {model_name}, 耗时: {datetime.now() - time_begin}")


if __name__ == "__main__":
    main()
相关推荐
FriendshipT5 小时前
DeepSeek Harness 使用 Ollama 本地部署的 AI 大模型(以Qwen3.8-27B为例)
人工智能·pytorch·深度学习·ollama·deepseek
uncle_ll6 小时前
多模态大模型视听生成本地实战
llm·文生图·文生视频·多模态·ollama
Moon上有月亮1 天前
Ollama 完全指南:本地大语言模型的“开箱即用”方案
人工智能·语言模型·自然语言处理·ollama
uncle_ll1 天前
大模型落地选型GGUF 量化与 Ollama 部署指南
人工智能·大模型·llm·ollama·gguf
Flynt6 天前
本地跑大模型到底选哪个?我用llmfit把32000星的项目实测了一遍
ai编程·gpu·ollama
uncle_ll7 天前
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调
llm·nlp·llama·ollama·大模型微调
岛雨QA9 天前
Claude Code接入本地大模型指南
ai编程·claude·ollama
csdn_aspnet12 天前
Copilot能换成本地吗?VSCode接本地大模型本地化接入方案
ide·vscode·ai·ollama
k4m7v2pz21 天前
16GB Mac 本地跑大模型:ollama 局域网 OpenAI 兼容 API 实战(一:需求与配置)
llm·openai·api·mac·ollama·本地·atomcode