linux部署VLLM、大模型(详细图文)

一、安装vllm

创建虚拟环境(版本确保是3.8~3.11)

复制代码
conda create -n vllm_env python=3.10 -y

激活虚拟环境

复制代码
conda activate vllm_env

安装vllm

复制代码
pip install vllm

安装torch(用于深度学习的并行计算)

复制代码
 pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

验证torch是否安装成功

复制代码
 python -c "import torch; print('PyTorch版本:', torch.__version__); print('CUDA版本:', torch.version.cuda); print('GPU可用:', torch.cuda.is_available())"

安装fast_attention(处理标准注意力在长序列场景下的内存爆炸IO 瓶颈问题)

复制代码
conda install -c conda-forge flash-attn=2.5.8

测试fast_attention是否安装成功

复制代码
nano test.py

在文件里粘贴这些代码

复制代码
# 验证 flash-attn 是否安装成功的测试脚本
import torch
from flash_attn import flash_attn_func

# 检查 GPU 是否可用
if not torch.cuda.is_available():
    print("❌ 未检测到 GPU,请确认 PyTorch CUDA 版本安装正确")
else:
    # 生成 fp16 精度的 Q/K/V 张量(适配 GPU)
    q = torch.randn(2, 1024, 16, 64, device="cuda", dtype=torch.float16)
    k = torch.randn(2, 1024, 16, 64, device="cuda", dtype=torch.float16)
    v = torch.randn(2, 1024, 16, 64, device="cuda", dtype=torch.float16)
    
    # 执行 flash-attn 计算
    try:
        out = flash_attn_func(q, k, v)
        print(f"✅ flash-attn 安装成功!输出 shape: {out.shape}")
    except Exception as e:
        print(f"❌ flash-attn 执行失败,错误信息:{e}")

执行文件

复制代码
python test.py

安装成功

删除py文件

复制代码
rm test.py

到此vllm安装完成

二、使用vllm部署大模型

先下载魔搭社区

复制代码
pip install modelscope

下载git工具

复制代码
git lfs install

git clone https://www.modelscope.cn/Qwen/Qwen1.5-1.8B.git

安装完成

如果不想要这个模型了,可以删除

复制代码
rm -rf ~/Qwen1.5-1.8B
相关推荐
零依赖极客2 小时前
Day 6·1 ARMv8.2 dotprod——vdotq_s32 一条指令做 4 个点积
c语言·开发语言·人工智能·矩阵·arm·vllm
Albart57510 小时前
大模型无限循环输出、重复生成文本:参数层面规避幻觉输出实战
大模型·llm·vllm·大模型推理·幻觉·重复输出
早睡早起身体好1231 天前
用 XGrammar 约束大模型工具调用:解决参数为空的问题
android·人工智能·神经网络·机器学习·自然语言处理·vllm
basketball6165 天前
AI Infra 推理部署技术总结:2. vLLM 内核——PagedAttention 与调度器原理
android·人工智能·vllm·ai infra
CV-杨帆7 天前
在自己的服务器上搭建VLLM 以Qwen3.5-0.8B与Qwen3.5-4B为模型基础
运维·服务器·vllm
Zguigo8 天前
Coding Agent 上下文压缩:从 Claude Code / Codex / Pi 到自研策略
深度学习·vllm
DevOps老兵9 天前
AI Infra实战05:用Helm在K8s中部署vLLM,从安装到压测全流程
人工智能·kubernetes·helm·vllm·大模型推理·ai infra
方方洛11 天前
vllm教程-02-核心原理
人工智能·算法·vllm
苏子寒12 天前
Nano-VLLM全代码解析笔记(10)-GemmaRMSNorm和MRoPE
笔记·机器学习·ai·nlp·vllm