概要
提示:针对深度学习推理+训练环境搭建进行总结
硬件:
对于RTX20系列、RTX30系列、RTX40系列都适用。
软件(安装顺序见下):
1、cuda_11.8.0_522.06_windows.exe
2、536.67-desktop-win10- win11 -64bit-international-nsd-dch-whql
3、cudnn-windows-x86_64-8.9.7.29_cuda11-archive
4、TensorRT-8.6.1.6.Windows10.x86_64.cuda-11.8
理解各软件功能和用途后,其它版本类似。
硬件以CUDA是否支持为基准,软件以CUDA为核心,其它软件均基于CUDA版本进行适配。
使用模块:
1、 Python
2、 Pytorch
3、OpenCL
4、YOLO
整体架构流程
1、安装CUDA
下载好cuda_11.8.0_522.06_windows.exe后,可以直接安装。
2、安装536.67-desktop-win10-win11-64bit-international-nsd-dch-whql
CUDA安装完成后,要再安装显卡驱动,这里的顺序没反,为的是优先安装CUDA的支持模块,避免重复升级或降级。
2、安装CUDNN
CUDA安装完成后,会在路径C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8 创建文件夹,将下载好的CUDNN压缩包直接解压覆盖到这个文件夹里就行。如下图:

3、安装TensorRT
安装TensorRT时,可以将下载好的压缩包解压到任意位置,注意路径中不要有中文。
解压完成后,在系统环境变量Path中添加条目,例如:C:\TensorRT-8.6.1.6\lib。
校验安装情况
cpp
#测试CUDA及显卡驱动
nvcc --version # 查看CUDA版本
nvidia-smi # 查看显卡性能是否为最高的P0,如果不是,需要去显卡控制面板里修改电源策略为最佳性能
#导航到CUDA的示例目录
cd "C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\extras\demo_suite"
#测试CUDA和cuDNN配置
bandwidthTest.exe
deviceQuery.exe
如果这两个指令最后都显示Result = PASS,则表明CUDA和cuDNN安装配置正确
至此就已经具备推理环境了,如需转换模型或进行训练,则需安装辅助模块。
辅助模块安装
这里主要以使用的AI模型来决定模块安装及版本确认,示例将使用YOLO8,Ultralytics 8.0.109
1、安装Python,这里使用python-3.9.13-amd64,具体版本也需要根据 Ultralytics 来确认。
2、如果需要转换模型,则需要安装onnx版本>=1.12.0,安装onnxsim版本>=0.4.17,安装onnxruntime版本>=1.12.1。
3、要联网安装 Torch ,使用指令:这里版本为xxxx。
cpp
pip install torch==2.1.1 torchvision==0.16.1 torchaudio==2.1.1 --index-url https://download.pytorch.org/whl/cu118
如果要安装本地的的Torch,可以使用指令:
cpp
pip install torch-2.1.1+cu118-cp39-cp39-win_amd64.whl
在用指令安装其它:
cpp
pip install torchvision==0.16.1 torchaudio==2.1.1
4、安装yolo8
cpp
pip install ultralytics==8.0.109
安装numpy
cpp
pip uninstall numpy -y #先卸载旧版本
pip install numpy==1.23.5
再次检查并安装其它辅助包:
cpp
# 1. 安装 onnx
pip install onnx==1.12.0
# 2. 安装 onnxsim
pip install onnxsim==0.4.17
# 3. 安装 onnxruntime
# CPU版本
pip install onnxruntime==1.12.1
# 或者 GPU版本(如果已安装CUDA)
pip install onnxruntime-gpu==1.12.1
至此,已经搭建好模型转换或训练环境。