【杂记】vLLM如何指定GPU单卡/多卡离线推理

写在前面

仅作个人学习与记录用。主要记录vLLM指定GPU单卡/多卡离线推理的方法。


vLLM官方文档中Environment Variables页面有对指定GPU方法的唯一描述:

bash 复制代码
# used to control the visible devices in the distributed setting
"CUDA_VISIBLE_DEVICES":
lambda: os.environ.get("CUDA_VISIBLE_DEVICES", None),

在vLLM离线推理(Offline Inference)时,可以通过设置tensor_parallel_size = 1/2/3...,来使用默认的单卡GPU或多卡GPU来推理。但是如果想在指定的单卡/多卡GPU中运行vLLM,那么应该如何以及在哪里设置CUDA_VISIBLE_DEVICES?

一般来说,使用下面三种方法就可以了:

shell指定:

bash 复制代码
CUDA_VISIBLE_DEVICES=3  python train.py

另一种shell指定(不推荐):

bash 复制代码
export CUDA_VISIBLE_DEVICES=3  
python train.py

代码内部指定:

python 复制代码
import os
os.environ["CUDA_VISIBLE_DEVICES"]="3"

但是在实际执行代码过程中,可能存在失效的情况。即无论怎么修改可见的GPU编号,最后程序都是按照顺序从第0块开始使用。问题出在哪里呢?

假设一共有四卡,先使用nvidia-smi -L查看可用GPU及序号:

bash 复制代码
GPU 0: GeForce RTX XXX (UUID: xxx)
GPU 1: GeForce RTX XXX (UUID: xxx)
GPU 2: GeForce RTX XXX (UUID: xxx)
GPU 3: NVIDIA XXX (UUID: xxx)

而在代码中测试,会得到:

python 复制代码
import os
os.environ["CUDA_VISIBLE_DEVICES"] = "3"
import torch
print(torch.cuda.get_device_name(0))  # 返回GPU名称,设备索引默认从0开始
print(torch.cuda.current_device())  # 返回现在使用的GPU索引

输出:
1
GeForce RTX XXX
0
python 复制代码
import os
os.environ["CUDA_VISIBLE_DEVICES"] = "0"
import torch
print(torch.cuda.get_device_name(0))  # 返回GPU名称,设备索引默认从0开始
print(torch.cuda.current_device())  # 返回现在使用的GPU索引

输出:
NVIDIA XXX
0

这是因为nvidia-smi命令中的GPU序号与代码中的GPU序号是相反的,nvidia-smi的 GPU序号默认使用PCI_BUS_ID,而py文件代码默认GPU序号遵循FASTEST_FIRST

那么可以修改上述指定方式如下:

shell指定:

bash 复制代码
CUDA_VISIBLE_DEVICES=3 export CUDA_DEVICE_ORDER="PCI_BUS_ID" python train.py

另一种shell指定(不推荐):

bash 复制代码
export CUDA_VISIBLE_DEVICES=3  
export CUDA_DEVICE_ORDER="PCI_BUS_ID"
python train.py

代码内部指定:

python 复制代码
import os
os.environ["CUDA_DEVICE_ORDER"] = "PCI_BUS_ID"
os.environ["CUDA_VISIBLE_DEVICES"] = "3"

另外需要注意,如果你在离线推理时import了pytorch等包,最好将os.environ["CUDA_VISIBLE_DEVICES"] = "3"移到import torch等代码之前,紧随import os之后,即按照如下的方式:

python 复制代码
import os
os.environ["CUDA_DEVICE_ORDER"] = "PCI_BUS_ID"
os.environ["CUDA_VISIBLE_DEVICES"]="3"
import torch
......
相关推荐
IT古董19 分钟前
【深度学习】常见模型-Transformer模型
人工智能·深度学习·transformer
沐雪架构师1 小时前
AI大模型开发原理篇-2:语言模型雏形之词袋模型
人工智能·语言模型·自然语言处理
摸鱼仙人~2 小时前
Attention Free Transformer (AFT)-2020论文笔记
论文阅读·深度学习·transformer
python算法(魔法师版)2 小时前
深度学习深度解析:从基础到前沿
人工智能·深度学习
小王子10242 小时前
设计模式Python版 组合模式
python·设计模式·组合模式
kakaZhui2 小时前
【llm对话系统】大模型源码分析之 LLaMA 位置编码 RoPE
人工智能·深度学习·chatgpt·aigc·llama
山顶夕景2 小时前
【LLM-agent】(task2)用llama-index搭建AI Agent
大模型·llm·agent·智能体·llama-index
struggle20253 小时前
一个开源 GenBI AI 本地代理(确保本地数据安全),使数据驱动型团队能够与其数据进行互动,生成文本到 SQL、图表、电子表格、报告和 BI
人工智能·深度学习·目标检测·语言模型·自然语言处理·数据挖掘·集成学习
佛州小李哥3 小时前
通过亚马逊云科技Bedrock打造自定义AI智能体Agent(上)
人工智能·科技·ai·语言模型·云计算·aws·亚马逊云科技
Mason Lin4 小时前
2025年1月22日(网络编程 udp)
网络·python·udp