CUDA补充笔记

文章目录

一、不同核函数前缀

二、指定kernel要执行的线程数量

总共需要线程数是:

复制代码
1 * N = N个线程

三、线程需要两个内置坐标变量来唯一标识线程

①都是dim3类型变量

blockIdx指明线程在grid中的位置,threadIdx指明线程所在block中的位置

  • 若使用的向量大小为1<<20,假设block大小为256,而grid的大小就是4096

③而线程的ID值为:

二维:对于2-dim的block(Dx,Dy),线程(x,y)的ID值为(x+ yDx)
三维:如果是3-dim的block(Dx,Dy,Dz),线程(x,y,z)的ID值为(x+ y
Dx +zDxDy)

④矩阵加法

四、不是blocksize越大越好,上限一般是1024个blocksize

相关推荐
71-316 分钟前
MySQL的安装和卸载组件
笔记·学习·mysql
夏星印3 小时前
argparse解析器参数详解
经验分享·笔记·python·学习·argparse
我是大猴子5 小时前
零代码应用笔记
笔记
胡图图不糊涂^_^5 小时前
MySQL学习笔记——增删改查操作
数据库·笔记·增删改查
成长的小牛2335 小时前
MCP 学习笔记
笔记·学习·ai
困死,根本不会6 小时前
蓝桥杯python备赛笔记之(十)数论基础 & 日期问题
笔记·python·蓝桥杯
深蓝轨迹6 小时前
乐观锁 vs 悲观锁 含面试模板
java·spring boot·笔记·后端·学习·mysql·面试
宵时待雨6 小时前
C++笔记归纳10:继承
开发语言·数据结构·c++·笔记·算法
Xudde.7 小时前
班级作业笔记报告0x02
笔记
Hello_Embed7 小时前
LVGL 入门(一):环境搭建与源码获取
笔记·stm32·单片机·嵌入式·lvgl