cuda

June`3 天前
c++·人工智能·算法·cuda
warp shuffle指令目录abstract背景线程束洗牌指令的不同形式线程束内的共享内存数据线程束值的广播线程束上偏移线程束下偏移
June`5 天前
c++·人工智能·算法·cuda
常量内存和只读缓存目录摘要常量内存常量缓存特性分配方式使用常量内存实现一维模板只读缓存分配方式实验总结本文将介绍常量内存和只读缓存,然后对比其差异
胖大和尚6 天前
c++·cuda
在C++的类中,是否可以把函数声明成__device__可以,在C++类中完全可以将成员函数声明为 __device__ 函数。这允许该类的成员函数在GPU上被调用和执行。以下是具体的使用方法和一些关键点:
(initial)8 天前
cuda
B-09. 数据布局(AoS/SoA/Transpose):一次布局调整带来的事务变化B-08 证明:TMA 再强,也只是「怎么搬」。 若从第一天就把字段交错成 AoS、或把该合并的写拆成跨步,引擎只能更高效地搬废字节。 本章回到 数据布局:AoS↔SoA、以及 Transpose 这种「布局变换算子」——一次调整如何改变 sector 事务与有效带宽。
一个小猴子`21 天前
矩阵·cuda·triton
Triton实现矩阵乘法
攻城狮Soar1 个月前
cuda
CUDA编程之KernalKernel(内核)是在GPU上并行执行的函数。与CPU上只执行一次的传统C/C++函数不同,GPU kernel会被成千上万个线程同时执行,每个线程执行相同的代码但处理不同的数据。
xin_yao_xin1 个月前
开发语言·python·conda·cuda
Conda 环境的 CUDA PATH 配置指南conda 环境里装了 CUDA Toolkit,但 `nvcc`、cuBLAS 头文件或运行时库仍然指向系统的旧版本(通常是 `/usr/local/cuda/`),导致编译或运行时版本不匹配。
basketball6162 个月前
人工智能·microsoft·nvidia·cuda
AI Infra 硬件体系与编程模型:17. CUDA编程基础:底层驱动 API 调用在CUDA开发的入门阶段,我们接触的几乎都是Runtime API(运行时API):cudaMalloc、cudaMemcpy、<<<>>>核函数启动……这些接口简单易用,几行代码就能跑起一个GPU程序。但很多人不知道,Runtime API 只是一层封装,它的底层是更基础、更灵活的 Driver API(驱动API)。
fpcc2 个月前
c++·cuda
并行编程实战——CUDA编程的pipelines对于学计算机的人来说,pipelines是一个经常听到的名词。在CPU的指令处理中,流水线处理机制是典型的应用代表。所谓流水线就是把任务拆成多个部分,让任务可以并行操作。 这里的重点就在于并行,提高并行,其中隐含着同步机制的处理。比如流水打乱后,如何进行新的任务流水的处理。
basketball6162 个月前
人工智能·nvidia·cuda
AI Infra 硬件体系与编程模型:14. CUDA编程基础:事件与精确性能测量在之前的系列文章中,我们学习了CUDA的核函数、内存模型、共享内存优化和CUDA流技术。但所有这些优化都建立在一个前提之上:我们能够精确地测量程序的性能。
kyle~2 个月前
人工智能·nvidia·cuda
推理部署---CUDA 执行模型(SM、Block、Warp 与 SIMT)CUDA(Compute Unified Device Architecture)是NVIDIA推出的通用并行计算平台和编程模型,其核心设计哲学是单指令多线程(Single-Instruction Multiple-Thread, SIMT),通过将计算任务分解为大量轻量级线程,利用GPU的大规模并行计算能力加速应用程序。
June`2 个月前
开发语言·cuda
如何组织一个并行程序目录背景:块+线程建立索引二维矩阵加法不同模式的对比如何查询硬件信息通过前面的学习,我们知道一个线程是通过一堆的坐标进行定位的,本期就详细的介绍每一个线程是怎么确定唯一的索引,然后建立并行计算,并且不同的线程组织形式是怎样影响性能的
basketball6162 个月前
人工智能·nvidia·cuda
AI Infra 硬件体系与编程模型:15. CUDA编程基础:混合精度计算在CUDA性能优化的进阶路径上,混合精度计算是一道必须跨过的门槛。从AI大模型训练到高性能科学计算,混合精度已经成为工业界的标准配置——它能在几乎不损失最终精度的前提下,将矩阵运算性能提升数倍,同时显存占用减半。
June`2 个月前
c++·人工智能·cuda
CUDA执行模型深入刨析目录概述架构发展图SM线程束SIMD与SIMTCUDA编程的组件与逻辑Fermi 架构Kepler 架构
June`2 个月前
算法·cuda
CUDA程序效率如何计算以及工具如何使用目录背景:c语言CUDA程序如何测效率想获得最高的效率,需要反复的优化,以及对硬件和编程细节的详细了解,怎么评估效率,时间是个很直观的测量方式。
插件开发2 个月前
c++·gpu·cuda
CUDA11-VS2015安装-工具链测试-Helloworld程序下载cuda_11.0.2_451.48_win10,如下图所示:按默认指引安装。这是一个标准的CUDA向量加法示例代码。我来详细分析其结构和关键点:
虎妞05002 个月前
pytorch·深度学习·ai·模型部署·cuda
PyTorch 2.0 生产级部署与性能优化指南torch.compile 通过图捕获和算子融合将训练速度提升 30-200%。三种模式:default(平衡)、reduce-overhead(小 batch 优化)、max-autotune(极致推理性能)。
CV-deeplearning2 个月前
opencv·计算机视觉·pip·nvidia·cuda·gpu加速·cv-cuda
NVIDIA CV-CUDA:GPU 全流程加速计算机视觉,pip 一键安装替代 OpenCV,微软/腾讯/百度/字节全在用,云级图像处理吞吐量飙升 10 倍💡 还在用 CPU 版 OpenCV 做图像预处理?你的 GPU 在推理前白白闲置 80% 的时间!NVIDIA 联合字节跳动开源的 CV-CUDA,把图像解码、缩放、色彩转换、数据增强等全流程搬到 GPU,吞吐量飙升 10 倍+,延迟降低 90%。微软 Bing 视觉搜索、腾讯云音视频 PaaS、百度 AI 都在用。pip 一行安装,C++ 和 Python 双语言支持,Apache 2.0 开源,v0.16.0 最新版已支持 CUDA 13 和 Blackwell 架构。
王小义笔记2 个月前
llm·transformer·cuda
CUDA 版本下 Transformers 报错排查与解决办法最近在学习和训练多模态大模型时,执行训练脚本:程序启动后立即报错:随后引发:很多同学第一反应会认为是 CUDA 版本不兼容,实际上问题往往出在 PyTorch 与 Transformers 版本不匹配。
努力的章鱼bro2 个月前
c++·cuda
CUDA编程模型CUDA 编程模型是一种用于对大规模并行处理器进行编程的编程模型。根据《NVIDIA CUDA C++ 编程指南》,CUDA 编程模型中有三个关键抽象: