
摘要 :本文深入讲解 LLM 的三种主流接入方式------API 接入、本地部署接入、SDK 接入,从环境准备到代码实战,手把手教你将大模型能力集成到自己的应用中。文章包含完整的代码示例、优缺点对比和常见问题分析,助你根据业务场景选择最合适的接入方案。
一、LLM 的接入方式
在前面的章节中,我们已经系统了解了大语言模型的基本概念、核心能力和提示词编写技巧。那么,如何将这些强大的能力真正接入到自己的项目或产品中呢?
目前业界主流的 LLM 接入方式有三种:
| 接入方式 | 技术门槛 | 成本 | 数据安全 | 适用场景 |
|---|---|---|---|---|
| API 接入 | 低 | 按量付费 | 数据上传至服务商 | 快速验证、中小规模应用 |
| 本地接入 | 高 | 硬件投入大 | 完全本地可控 | 隐私要求高、大规模应用 |
| SDK 接入 | 中 | 按需付费 | 取决于 SDK 提供商 | 移动端/桌面端应用集成 |
下面我们将逐一深入讲解每种接入方式的完整流程。
1.1 API 接入
API(Application Programming Interface)接入 是最简单、最快速的方式,适合绝大多数开发者和企业快速集成大模型能力。
1.1.1 主流 LLM API 概览
| 服务商 | API 文档 | 特点 | 计费方式 |
|---|---|---|---|
| OpenAI | platform.openai.com | 能力最强,生态最完善 | 按 token 计费 |
| Anthropic | docs.anthropic.com | 长上下文,安全性高 | 按 token 计费 |
| 阿里云(通义千问) | help.aliyun.com | 国内访问稳定,中文优化 | 按 token 计费 |
| 百度智能云(文心) | cloud.baidu.com | 中文理解强,搜索融合 | 按 token 计费 |
| DeepSeek | platform.deepseek.com | 开源模型,性价比极高 | 按 token 计费 |
| 月之暗面(Kimi) | platform.moonshot.cn | 超长上下文,文档处理强 | 按 token 计费 |
| 讯飞星火 | xinghuo.xfyun.cn | 语音能力强 | 按 token 计费 |
| 硅基流动 / OneAPI | - | 统一聚合接口,切换方便 | 各平台原价 |
1.1.2以deepseek为例接入
1.申请API Key

2.查阅API文档
了解请求的端点、参数(如模型名称、提示词、温度、最大生成长度等)和返回的数据格式。

3.构建 HTTP 请求
在你的代码中,使用 HTTP 客户端库(如 Python 的 requests)构建一个包含 API Key(通常在 Header 中)和请求体(JSON 格式,包含你的提示和参数)的请求。
1.下载apifox
下载进入
1、

2、

3、

https://api.deepseek.com/v1/chat/completions
4、

5、

6、

7、

1.2 本地接入
大模型本地部署,这种方式就是将开源的大型语言模型(如 Llama、ChatGLM、Qwen 等)部署在你自己的硬件环境(本地服务器或私有云)中。核心概念就是,将下载模型的文件(权重和配置文件),使用专门的推理框架在本地服务器或 GPU 上加载并运行模型,然后通过类似 API 的方式进行交互。
典型流程是:
- 获取模型:从 Hugging Face(国外)、魔搭社区(国内)等平台下载开源模型的权重。
- 准备环境:配置具有足够显存(如 NVIDIA GPU)的服务器,安装必要的驱动和推理框架。
- 选择推理框架 :使用专为生产环境设计的框架来部署模型,例如:
- vLLM:特别注重高吞吐量的推理服务,性能极佳。
- TGI:Hugging Face 推出的推理框架,功能全面。
- Ollama:非常用户友好,可以一键拉取和运行模型,适合快速入门和本地开发。
- LM Studio:提供图形化界面,让本地运行模型像使用软件一样简单。
- 启动服务并调用 :框架会启动一个本地 API 服务器(如
http://localhost:8000),你可以像调用云端 API 一样向这个本地地址发送请求。
以 Ollama 为例,下面我们来演示下具体过程。
1.1.1 本地部署的核心挑战
| 挑战 | 说明 |
|---|---|
| 硬件要求 | 大模型需要 GPU/TPU,显存需求大 |
| 显存计算 | 每 10 亿参数约需 2~4GB 显存(FP16) |
| 推理速度 | 本地硬件可能不如云端 API 快 |
| 运维成本 | 需要自行维护模型、框架、驱动 |
显存需求参考表:
| 模型 | 参数量 | FP16 显存 | INT8 量化 | INT4 量化 |
|---|---|---|---|---|
| Llama 3 | 8B | ~16GB | ~8GB | ~4GB |
| Llama 3 | 70B | ~140GB | ~70GB | ~35GB |
| Qwen2 | 7B | ~14GB | ~7GB | ~3.5GB |
| Qwen2 | 72B | ~144GB | ~72GB | ~36GB |
| DeepSeek | 7B | ~14GB | ~7GB | ~3.5GB |
1.1.2 使用 Ollama 快速本地部署(最简单)
Ollama 是目前最简单的本地大模型运行工具,一行命令即可启动:
1.下载并安装ollama
Ollama 官⽹: https://ollama.ai

2.验证
安装完成后,Ollama 默认会启动。

3.拉取模型
# 拉取并运行模型
ollama run llama3 # 运行 Llama 3 8B
ollama run qwen2 # 运行通义千问 2
ollama run deepseek-coder # 运行 DeepSeek Coder
# 列出已下载的模型
ollama list
# API 方式调用本地模型
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "你好,请介绍一下自己"
}'


4.运行模型
ollama run + 自己拉取的模型完整名

5.通过接口调用
curl "http://127.0.0.1:11434/api/chat" \
-d '{
"model": "deepseek-r1:1.5b",
"messages":[
{"role": "user", "content": "夸夸我"}
],
"stream": false
}'

1.3 SDK接入
这并非一种独立的接入方式,而是对第一种 API 接入的封装和简化。模型提供商通常会发布官方编程语言 SDK,为我们封装好了底层的 HTTP 请求细节,提供一个更符合编程习惯的、语言特定的函数库。
典型流程(以 Deepseek Python SDK 为例):
DeepSeek 的接口完全兼容 OpenAI 接口协议 ,无需单独安装 DeepSeek 专属 SDK,直接使用 openai 官方 SDK 即可调用:
1.3.1 安装依赖库
pip install openai
1.3.2 打开编译器建一个python文件
1.3.3 发送HTTP请求
直接复制到文件中
from openai import OpenAI
client = OpenAI(
api_key="你的DeepSeek密钥",
base_url="https://api.deepseek.com" # 对接DeepSeek接口地址
)
res = client.chat.completions.create(
model="deepseek-chat", # 模型:deepseek-chat通用对话 / deepseek-reasoner推理模型
messages=[{"role": "user", "content": "你好"}]
)
print(res.choices[0].message.content)

二、问题与思考
1. 三种接入方式如何选择?
- 看数据敏感性 如果数据极其敏感,必须留在内部,本地部署是唯一选择。
- 看技术实力和资源 如果团队没有强大的 MLops(机器学习运维)能力,也没有预算购买和维护 GPU 服务器,云端 API 是更实际的选择。
- 看成本和规模 如果应用规模很大,长期来看,本地部署的固定成本可能低于持续的 API 调用费用。反之,小规模应用用 API 更划算。
- 看定制需求 如果只是使用模型的通用能力,云端 API 足够。如果需要用自己的数据微调模型,则需要选择支持微调的 API 或直接本地部署。
2. 原生 LLM 无论哪种接入方式都存在限制,原因:
1. 输入长度限制
所有 LLM 都有固定的输入长度(如 4K、8K、128K、400K Token)。我们无法将一本几百页的 PDF 或整个公司知识库直接塞给模型。 示例:GPT-5 最大拥有 400000 上下文窗口大小。
2. 缺乏私有知识
模型的训练数据有截止日期,且不包含我们的私人数据(如公司内部文档、个人笔记等)。让它基于这些知识回答问题,非常困难。
3. 复杂任务处理能力弱
原生 API 本质是一个「一问一答」的接口。对于需要多个步骤的复杂任务(如「分析这份财报,总结要点,并生成一份 PPT 大纲」),需要自行编写复杂逻辑拆解任务、多次调用 API 并管理中间状态。
4. 输出格式不可控
虽然可以通过提示词要求模型输出 JSON 或特定格式,但模型仍可能产生格式错误或不合规内容,需要自行编写后处理代码校验和清洗。
文末补充:像 LangChain 这类框架,正是为系统性解决以上问题而诞生。