模型部署踩坑(持续更新ing)

莫余2023-10-16 15:39

文章目录

模型部署踩坑
踩坑1
踩坑2
踩坑3
踩坑4
踩坑5

模型部署踩坑

踩坑1

FLOPs不能衡量模型性能，因为FLOPs只是模型计算大小的单位

还需要考虑

访存量
跟计算无关的DNN部分(reshape, shortcut, nchw2nhwc等等)
DNN以外的部分(前处理、后处理这些)

踩坑2

不能够完全依靠TensorRT

TensorRT可以对模型做适当的优化，但是有上限

计算密度低的1x1 conv， depthwise conv不会重构
GPU无法优化的地方会到CPU执行(可以手动修改代码实现部分，让部分cpu执行转到gpu执行)
有些冗长的计算，TensorRT可能不能优化（直接修改代码实现部分）
存在TensorRT尚未支持的算子（可以自己写plugin）
TensorRT不一定会分配Tensor Core（因为TensorRT kernel auto tuning会选择最合适的kernel）

踩坑3

CUDA Core和Tensor Core的使用

有的时候TensorRT并不会分配Tensor Core

kernel auto tuning自动选择最优解
所以有时会出现类似于INT8的速度比FP16反而慢了
使用Tensor Core需要让tensor size为8或者16的倍数

踩坑4

不能忽视前处理/后处理的overhead

对于一些轻量的模型，相比于DNN推理部分，前处理/后处理可能会更耗时间
因为有些前处理/后处理的复杂逻辑不适合GPU并行

解决办法：

可以把前处理/后处理中可并行的地方拿出来让GPU并行（比如RGB2BGR, Normalization, resize,crop, NCHW2NHWC）
可以在cpu上使用一些针对图像处理的优化库
比如Halide（使用Halide进行blur, resize, crop, DBSCAN, sobel这些会比CPU快）

踩坑5

对使用TensorRT得到的推理引擎做benchmark和profiling

使用TensorRT得到推理引擎并实现infer只是优化的第一步
需要使用NVIDIA提供的benchmark tools进行profiling

分析模型瓶颈在哪里

分析模型可进一步优化的地方在哪里

分析模型中多余的memory access在哪里

可以使用nsys, nvprof, dlprof, Nsight这些工具

上一篇：iOS- flutter flavor 多环境Configurations配置

下一篇：Chat GPT 4 画图相比百度如何

热门推荐

01UV安装并设置国内源 02KGG转MP3工具|非KGM文件|解密音频 03【2025.08.06最新版】Android Studio下载、安装及配置记录（自动下载sdk）04Qwen3-Coder 快速上手教程 | Qwen Code + Claude Code 05蜘蛛磁力搜索引擎大全，如何使用蜘蛛磁力查找磁力链接 062025最新国内服务器可用docker源仓库地址大全（2025年8月更新）07TRAE 规则（Rules）配置指南：个人习惯、团队规范与最佳实践 08NVIDIA显卡驱动、CUDA、cuDNN 和 TensorRT 版本匹配指南 09全球最强模型Grok4，国内已可免费使用！（附教程）10TRAE Rules 实践：为项目配置 6A 工作流