本地部署 text-generation-webui

本地部署 text-generation-webui

  • [0. 背景](#0. 背景)
  • [1. text-generation-webui 介绍](#1. text-generation-webui 介绍)
  • [2. 克隆代码](#2. 克隆代码)
  • [3. 创建虚拟环境](#3. 创建虚拟环境)
  • [4. 安装 pytorch](#4. 安装 pytorch)
  • [5. 安装 CUDA 运行时库](#5. 安装 CUDA 运行时库)
  • [6. 安装依赖库](#6. 安装依赖库)
  • [7. 启动 Web UI](#7. 启动 Web UI)
  • [8. 访问 Web UI](#8. 访问 Web UI)
  • [9. OpenAI 兼容 API](#9. OpenAI 兼容 API)

0. 背景

一直喜欢用 FastChat 本地部署大语言模型,今天试一试 text-generation-webui 这个项目。

1. text-generation-webui 介绍

text-generation-webui 适用于大型语言模型的 Gradio Web UI。支持transformers、GPTQ、AWQ、EXL2、llama.cpp (GGUF)、Llama 模型。

它的特点如下,

  • 3种界面模式:default (two columns), notebook, chat
  • 支持多个模型后端:Transformers、llama.cpp(通过 llama-cpp-python)、ExLlama、ExLlamaV2、AutoGPTQ、AutoAWQ、GPTQ-for-LLaMa、CTransformers、QuIP#。
  • 下拉菜单可在不同模型之间快速切换。
  • 大量扩展(内置和用户贡献),包括用于真实语音输出的 Coqui TTS、用于语音输入的 Whisper STT、翻译、多模式管道、向量数据库、Stable Diffusion集成等等。有关详细信息,请参阅 wiki 和扩展目录。
  • 与自定义角色聊天。
  • 适用于指令跟踪模型的精确聊天模板,包括 Llama-2-chat、Alpaca、Vicuna、Mistral。
  • LoRA:使用您自己的数据训练新的 LoRA,动态加载/卸载 LoRA 以进行生成。
  • Transformers 库集成:通过 bitsandbytes 以 4 位或 8 位精度加载模型,将 llama.cpp 与 Transformers 采样器( llamacpp_HF 加载器)结合使用,使用 PyTorch 以 32 位精度进行 CPU 推理。
  • 具有 OpenAI 兼容的 Chat 和 Completions API 服务器 - 请参阅示例。

2. 克隆代码

复制代码
git clone https://github.com/oobabooga/text-generation-webui.git; 
cd text-generation-webui

3. 创建虚拟环境

(Optional)安装 Conda,

复制代码
curl -sL "https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh" > "Miniconda3.sh"
bash Miniconda3.sh

创建虚拟环境,

复制代码
conda create -n textgen python=3.11 -y
conda activate textgen

4. 安装 pytorch

复制代码
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

确认 pytorch 是否安装成功,

复制代码
python -c "import torch;print(torch.cuda.is_available()):

--- 安装成功输出应该为 True
True

5. 安装 CUDA 运行时库

复制代码
conda install -y -c "nvidia/label/cuda-12.1.1" cuda-runtime

如果您需要 nvcc 手动编译某些库,请将上面的命令替换为,

复制代码
conda install -y -c "nvidia/label/cuda-12.1.1" cuda

6. 安装依赖库

复制代码
pip install -r requirements.txt
pip install transformers_stream_generator
pip install tiktoken

7. 启动 Web UI

复制代码
python server.py
# python server.py --trust-remote-code --listen

8. 访问 Web UI

使用浏览器打开 http://localhost:7860/?__theme=dark






9. OpenAI 兼容 API

复制代码
pip install -r extensions/openai/requirements.txt

启动,

复制代码
python server.py --trust-remote-code --api --api-port 8000 --listen

refer:https://github.com/oobabooga/text-generation-webui/wiki/12---OpenAI-API

完结!

相关推荐
n112125 天前
4G 显存老显卡怎么跑模型:llama.cpp 加 GGUF 配置
llama·llama.cpp·本地大模型·gguf
半甜柠檬8 天前
llama.cpp 部署 Qwen3.8-27B:无独显轻薄本实测
大模型·qwen·量化·本地部署·llama.cpp
智码看视界9 天前
AI推理优化:AWQ 量化原理,激活感知量化如何保住 4-bit 精度
模型压缩·awq·端侧部署·大模型量化·llm推理优化·autoawq
智码看视界12 天前
开源大模型前沿:Baichuan 5 :单卡 H100 跑国产,长上下文 + 中文 Agentic 硬刚海外同档
开源·中文·llama.cpp·百川智能·国产大模型·baichuan 5
论文复现现场20 天前
RTX 3090 如何跑 13B 级大模型推理?4-bit AWQ、vLLM 部署与并发调优实战
模型量化·vllm·大模型推理·awq·算家云·rtx3090
阆遤1 个月前
llama.cpp 0.4.0-dev 本地编译指南
ai·编译·llama.cpp
JiMoKuangXiangQu1 个月前
在 AllWinner T507 上部署 Qwen2.5-0.5B 大语言模型
人工智能·llama.cpp·推理引擎
智码看视界1 个月前
.NET 10 推理大模型TensorSharp 3.3.0 部署实测:纯.NET推理引擎反超llama.cpp 1.5倍,DFlash2提速62%
c#·.net·llama.cpp·.net 10·tensorsharp·本地大模型推理·开源推理引擎
weixin_440213291 个月前
大模型训练、微调、对齐、推理、量化、优化、数据集等
微调·数据集·sft·预训练·模型量化·gptq·kv cache
容沁风2 个月前
使用ninja编译llama.cpp
llama.cpp·2080ti·gemma4·vbr