Ollama 本地部署
云端 现在
请求发送到 DeepSeek / SiliconFlow 服务器
请求发送到本机 localhost:11434
需要 API Key,按 token 收费
无需 API Key,免费无限次
速度受网络影响
速度受本机 GPU/CPU 影响
Ollama 是什么
Ollama 是一个本地 LLM 运行时------你在本机启动一个 HTTP 服务,它负责加载模型、推理、返回结果。接口格式与 OpenAI 完全兼容.
用户 Python 代码
↓ HTTP POST /api/chat
Ollama 服务(localhost:11434)
↓ 推理
本地模型文件(~/.ollama/models/)
三个核心概念
-
Ollama 服务:后台常驻进程,类似数据库服务,负责加载和运行模型。
-
Model Tag:模型名+版本,格式 名称:参数量。例如 qwen2.5:1.5b 表示 Qwen2.5 的 15亿参数版本(约 1GB,CPU 可跑)。
-
ChatOllama:LangChain 专门封装的 Ollama 客户端,用法与 ChatOpenAI 几乎一致。
安装步骤
第一步:安装 Ollama
去 ollama.com 下载 Windows 安装包,安装后 Ollama 自动在后台运行。
验证:
ollama --version
第二步:拉取一个小模型
ollama pull qwen2.5:1.5b
qwen2.5:1.5b 只有约 1GB,CPU 可以跑,适合测试。拉完后验证:
ollama list
第三步:安装 Python 依赖
pip install langchain-ollama
示例代码:
py
from datetime import datetime
from langchain_core.messages import HumanMessage
from langchain_ollama import ChatOllama
def main():
model_name = "qwen2.5:1.5b"
time_begin = datetime.now()
llm = ChatOllama(model=model_name, client_kwargs={"trust_env": False})
result = llm.invoke([HumanMessage(content="你好。")])
print(result.content)
print(f"Model: {model_name}, 耗时: {datetime.now() - time_begin}")
if __name__ == "__main__":
main()