LLM 大模型三种主流接入方式详解(API / 本地部署 / SDK)

摘要 :本文深入讲解 LLM 的三种主流接入方式------API 接入本地部署接入SDK 接入,从环境准备到代码实战,手把手教你将大模型能力集成到自己的应用中。文章包含完整的代码示例、优缺点对比和常见问题分析,助你根据业务场景选择最合适的接入方案。

一、LLM 的接入方式

在前面的章节中,我们已经系统了解了大语言模型的基本概念、核心能力和提示词编写技巧。那么,如何将这些强大的能力真正接入到自己的项目或产品中呢?

目前业界主流的 LLM 接入方式有三种:

接入方式 技术门槛 成本 数据安全 适用场景
API 接入 按量付费 数据上传至服务商 快速验证、中小规模应用
本地接入 硬件投入大 完全本地可控 隐私要求高、大规模应用
SDK 接入 按需付费 取决于 SDK 提供商 移动端/桌面端应用集成

下面我们将逐一深入讲解每种接入方式的完整流程。

1.1 API 接入

API(Application Programming Interface)接入最简单最快速的方式,适合绝大多数开发者和企业快速集成大模型能力。

1.1.1 主流 LLM API 概览

服务商 API 文档 特点 计费方式
OpenAI platform.openai.com 能力最强,生态最完善 按 token 计费
Anthropic docs.anthropic.com 长上下文,安全性高 按 token 计费
阿里云(通义千问) help.aliyun.com 国内访问稳定,中文优化 按 token 计费
百度智能云(文心) cloud.baidu.com 中文理解强,搜索融合 按 token 计费
DeepSeek platform.deepseek.com 开源模型,性价比极高 按 token 计费
月之暗面(Kimi) platform.moonshot.cn 超长上下文,文档处理强 按 token 计费
讯飞星火 xinghuo.xfyun.cn 语音能力强 按 token 计费
硅基流动 / OneAPI - 统一聚合接口,切换方便 各平台原价

1.1.2以deepseek为例接入

1.申请API Key
2.查阅API文档

了解请求的端点、参数(如模型名称、提示词、温度、最大生成长度等)和返回的数据格式。

3.构建 HTTP 请求

在你的代码中,使用 HTTP 客户端库(如 Python 的 requests)构建一个包含 API Key(通常在 Header 中)和请求体(JSON 格式,包含你的提示和参数)的请求。

1.下载apifox

https://apifox.com/

下载进入

1、

2、

3、

复制代码
https://api.deepseek.com/v1/chat/completions

4、

5、

6、

7、

1.2 本地接入

大模型本地部署,这种方式就是将开源的大型语言模型(如 Llama、ChatGLM、Qwen 等)部署在你自己的硬件环境(本地服务器或私有云)中。核心概念就是,将下载模型的文件(权重和配置文件),使用专门的推理框架在本地服务器或 GPU 上加载并运行模型,然后通过类似 API 的方式进行交互。

典型流程是:

  1. 获取模型:从 Hugging Face(国外)、魔搭社区(国内)等平台下载开源模型的权重。
  2. 准备环境:配置具有足够显存(如 NVIDIA GPU)的服务器,安装必要的驱动和推理框架。
  3. 选择推理框架 :使用专为生产环境设计的框架来部署模型,例如:
    • vLLM:特别注重高吞吐量的推理服务,性能极佳。
    • TGI:Hugging Face 推出的推理框架,功能全面。
    • Ollama:非常用户友好,可以一键拉取和运行模型,适合快速入门和本地开发。
    • LM Studio:提供图形化界面,让本地运行模型像使用软件一样简单。
  4. 启动服务并调用 :框架会启动一个本地 API 服务器(如 http://localhost:8000),你可以像调用云端 API 一样向这个本地地址发送请求。

以 Ollama 为例,下面我们来演示下具体过程。

1.1.1 本地部署的核心挑战

挑战 说明
硬件要求 大模型需要 GPU/TPU,显存需求大
显存计算 每 10 亿参数约需 2~4GB 显存(FP16)
推理速度 本地硬件可能不如云端 API 快
运维成本 需要自行维护模型、框架、驱动

显存需求参考表

模型 参数量 FP16 显存 INT8 量化 INT4 量化
Llama 3 8B ~16GB ~8GB ~4GB
Llama 3 70B ~140GB ~70GB ~35GB
Qwen2 7B ~14GB ~7GB ~3.5GB
Qwen2 72B ~144GB ~72GB ~36GB
DeepSeek 7B ~14GB ~7GB ~3.5GB

1.1.2 使用 Ollama 快速本地部署(最简单)

Ollama 是目前最简单的本地大模型运行工具,一行命令即可启动:

1.下载并安装ollama

Ollama 官⽹: https://ollama.ai

2.验证

安装完成后,Ollama 默认会启动。

访问: http://127.0.0.1:11434

3.拉取模型
复制代码
# 拉取并运行模型
ollama run llama3    # 运行 Llama 3 8B
ollama run qwen2     # 运行通义千问 2
ollama run deepseek-coder  # 运行 DeepSeek Coder

# 列出已下载的模型
ollama list

# API 方式调用本地模型
curl http://localhost:11434/api/generate -d '{
  "model": "llama3",
  "prompt": "你好,请介绍一下自己"
}'
4.运行模型
复制代码
ollama run + 自己拉取的模型完整名
5.通过接口调用
复制代码
curl "http://127.0.0.1:11434/api/chat" \
-d '{
"model": "deepseek-r1:1.5b",
"messages":[
{"role": "user", "content": "夸夸我"}
],
"stream": false
}'

1.3 SDK接入

这并非一种独立的接入方式,而是对第一种 API 接入的封装和简化。模型提供商通常会发布官方编程语言 SDK,为我们封装好了底层的 HTTP 请求细节,提供一个更符合编程习惯的、语言特定的函数库。

典型流程(以 Deepseek Python SDK 为例):

DeepSeek 的接口完全兼容 OpenAI 接口协议 ,无需单独安装 DeepSeek 专属 SDK,直接使用 openai 官方 SDK 即可调用:

1.3.1 安装依赖库

复制代码
pip install openai

1.3.2 打开编译器建一个python文件

1.3.3 发送HTTP请求

直接复制到文件中

复制代码
from openai import OpenAI

client = OpenAI(
    api_key="你的DeepSeek密钥",
    base_url="https://api.deepseek.com"  # 对接DeepSeek接口地址
)

res = client.chat.completions.create(
    model="deepseek-chat",  # 模型:deepseek-chat通用对话 / deepseek-reasoner推理模型
    messages=[{"role": "user", "content": "你好"}]
)
print(res.choices[0].message.content)

二、问题与思考

1. 三种接入方式如何选择?

  1. 看数据敏感性 如果数据极其敏感,必须留在内部,本地部署是唯一选择。
  2. 看技术实力和资源 如果团队没有强大的 MLops(机器学习运维)能力,也没有预算购买和维护 GPU 服务器,云端 API 是更实际的选择。
  3. 看成本和规模 如果应用规模很大,长期来看,本地部署的固定成本可能低于持续的 API 调用费用。反之,小规模应用用 API 更划算。
  4. 看定制需求 如果只是使用模型的通用能力,云端 API 足够。如果需要用自己的数据微调模型,则需要选择支持微调的 API 或直接本地部署。

2. 原生 LLM 无论哪种接入方式都存在限制,原因:

1. 输入长度限制

所有 LLM 都有固定的输入长度(如 4K、8K、128K、400K Token)。我们无法将一本几百页的 PDF 或整个公司知识库直接塞给模型。 示例:GPT-5 最大拥有 400000 上下文窗口大小

2. 缺乏私有知识

模型的训练数据有截止日期,且不包含我们的私人数据(如公司内部文档、个人笔记等)。让它基于这些知识回答问题,非常困难。

3. 复杂任务处理能力弱

原生 API 本质是一个「一问一答」的接口。对于需要多个步骤的复杂任务(如「分析这份财报,总结要点,并生成一份 PPT 大纲」),需要自行编写复杂逻辑拆解任务、多次调用 API 并管理中间状态。

4. 输出格式不可控

虽然可以通过提示词要求模型输出 JSON 或特定格式,但模型仍可能产生格式错误或不合规内容,需要自行编写后处理代码校验和清洗。

文末补充:像 LangChain 这类框架,正是为系统性解决以上问题而诞生。

相关推荐
二进制_博客13 小时前
LangSmith 调试
langchain·langsmith
InKomorebi14 小时前
Agent 五大工程体系:Prompt、Context、Loop、Graph 与 Harness
面试·llm
Shawn_Shawn15 小时前
google ADK VS Langchain-ai
后端·llm·agent
元Y亨H15 小时前
大模型技术 LangGraph 概述
llm
愚农搬码15 小时前
AI Agent 目前最大的瓶颈是什么?
llm·agent·ai编程
Keepreal49615 小时前
《从零构建大模型》——从头实现GPT模型进行文本生成
gpt·深度学习·llm
武子康16 小时前
模型发布可以按天看,生产默认模型不能按天切:一套可回退的 30 天验收流程
人工智能·llm·agent
CodeLinghu18 小时前
LangSmith Evaluate实战评估Agent
人工智能·python·语言模型·llm
DRXB25072018 小时前
开源自由还是生态红利?LangChain 的灵活性与小艺开放平台的鸿蒙流量池,开发者该如何抉择?
langchain·开源·harmonyos