cuda核函数编程小结

文章目录

一、环境配置

几个注意事项先写在前面:

  1. 环境问题:一定要VS2019以上的!!!切记注意,目前VS2019以下已经不更新了,这里我就是用的2019,然后下面参考文档还是2015,反正过程没错,把VS版本改成2019即可;
  2. GPU及CUDA版本:我这边是NV RTX 3050Laptop 和 CUDA 11.8版本,建议CUDA版本别太低;
  3. 按照以下步骤在添加文件的时候没有NVIDIA的选项也没关系,创建后缀为".cu"的文件即可,其实是".c",核函数的格式是c语言的格式,而非C++,所以不能写在.cpp的文件中,不然会报错:error C2059: 语法错误:"<" 问题;

二、核函数代码书写格式

关于核函数的书写格式,看这篇比较易懂:https://www.cxyzjd.com/article/sinat_33718563/79156147

浅显的说,就是在cu文件中extern "C"声明C语言函数,然后在这个函数里面调用核函数,且核函数也放在cu文件中。第二步是在cpp文件中也用extern "C"声明cu中的C语言函数,然后用的时候直接用即可。

三、小结

cuda核函数编程环境配置和写法,其实不是很难,第一次接触可能觉得麻烦点,在核函数里面的多grid和多线程编程还是有点麻烦的,这个写的时候要特别注意,也可以啥都不用直接1,1在调用核函数的时候,然后可以参考下以下链接:

https://blog.csdn.net/zhanghaijun2013/article/details/107018029

https://blog.51cto.com/u_15316847/5949054

https://blog.csdn.net/weixin_41449637/article/details/120200121

https://cloud.tencent.com/developer/article/2065713

相关推荐
论文复现现场13 小时前
LAMMPS 用 RTX 5090 能跑多大?32GB 显存、CUDA 编译与规模验证
cuda·分子动力学·lammps·rtx5090
EatFan14 小时前
从 CUDA 到昇腾:一张对照表拆解 DeepSeek 最新开源组件(TileLang / DeepGEMM / DeepEP / TileKernels)
开源·cuda·deepseek·deepgemm·tilelang·华为昇腾
kakakahahahaha2 天前
LoadLibrary failed with error 87 排查:ERROR_INVALID_PARAMETER、DLL路径、架构与显卡驱动
windows·电脑·笔记本电脑·nvidia·软件需求
论文复现现场3 天前
RTX 3090 24GB 适合科研吗?单卡论文复现、PyTorch 显存检查与 OOM 排错
人工智能·pytorch·python·深度学习·cuda·rtx3090
论文复现现场5 天前
RTX 5090 32GB 适合科研计算吗?单卡训练、推理、论文复现与 OOM 判断方法
pytorch·深度学习·cuda·rtx5090
论文复现现场5 天前
论文复现看到“RTX 3090 or higher”:显存、CUDA、batch size 与 OOM 怎么判断?
开发语言·pytorch·batch·cuda·rtx3090
_nibel5 天前
第二章:Details 重点数据细读 ⭐教你读懂 Nsight Compute 报告 系列合集⭐
cuda·ncu·nsight compute
智码看视界6 天前
AI 推理优化 | Triton Inference Server 架构解析:单机多模型并发推理的工业级方案
nvidia·模型部署·mlops·triton·gpu推理·推理服务化·动态批处理
论文复现现场15 天前
MiniCPM-o 4.5 需要多少显存?RTX 3090 24GB 的 BF16、AWQ、GGUF 部署边界与验收方法
cuda·多模态大模型·显存优化·rtx3090·minicpm-o
qq_1998868715 天前
第8板块·第2节:统一内存的高级特性与性能调优
c++·人工智能·gpu算力·cuda