cuda

Zhu7582 天前
nvidia·cuda
GPU驱动与CUDA安装指南服务器部署深度学习 / 推理等 GPU 业务前,需要先安装 NVIDIA 驱动与 CUDA 工具包。本文覆盖:
喜壹LittlePrince3 天前
cuda·hpc
CUDA 入门第一课:从线程索引到向量加法与朴素矩阵乘法这是我的 NVIDIA CUDA Training Series 第一节课学习笔记与 Homework 1 实践记录。
xier_ran5 天前
人工智能·深度学习·cuda
【infra之路】GPU 执行与存储层次全景关系图Warp ≠ Block Block 是资源分配单位(SMEM、barrier),Warp 是执行单位。一个 Block 可能有 8 个 Warp,但同一时刻只有部分 Warp 在发射指令。
椒颜皮皮虾྅9 天前
android·开发语言·人工智能·深度学习·c#·cuda
【TensorRTtSharp v4.0】在 C# 中使用 TensorRT CSharp API v4.0 动态编译并运行 CUDA KernelCUDA Runtime Compilation 适合在运行时生成或组合 Kernel,而不是为每一种参数组合预先构建本机二进制。完整流程不只是把一段 CUDA C 字符串交给 NVRTC:程序还要发现编译器能力、传入虚拟头文件和选项、保存编译日志、复制 PTX/CUBIN/LTO IR、加载 Module、按 ABI 组织 Kernel 参数、提交到 Stream,并把 GPU 结果读回验证。
Albart5759 天前
cuda·nccl·vllm·大模型部署·多卡推理·大模型踩坑
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案本文为生产级 vLLM 多卡分布式部署踩坑复盘,聚焦全网高频疑难问题:CUDA error: worker 进程异常退出。
帅气的小峰12 天前
c++·python·cuda·推理引擎
pybind11与nanobind可以共存吗?如何迁移?可以共存,但不建议在同一个 Python 扩展模块(.so/.pyd)中混合使用。不过,在同一个项目中以“分模块”或“渐进迁移”的方式共存是完全可行且常见的实践。
(initial)14 天前
c语言·开发语言·cuda
C-05. Kernel Fusion 代价边界:少写回 vs 寄存器压力与 occupancyC-04 钉死:少同步点不等于该 fuse。 本章回答垂直融合何时省 GMEM 真赚、何时寄存器/occupancy 把收益吃掉。 本机:瘦融合随链长 3.9×→9.8×;fat 把 occupancy 6→1,相对瘦融合慢 8×。
June`18 天前
c++·人工智能·算法·cuda
并发内核执行目录abstract非空流的中的并发内核nsys步骤:(一定要详细学习)实验分析:openMP简单介绍openMP
Olafur_zbj18 天前
人工智能·cuda·tile
【AI】CUDA的新编程模型:tile编程模型Tile Programming 是 CUDA 13.3 新增的 CUDA Tile 编程模型,不是传统 SIMT 代码里用 shared memory 手工做 tiling,也不是 cooperative_groups::tiled_partition。
(initial)21 天前
cuda
C-02. Cooperative Groups:安全分组、tile 集体与 coalesced 聚合C-01 钉死了 __shfl_*_sync 与 mask 纪律。 手写 mask 能跑,但分组一变复杂就难组合。 本章把分组收成句柄:thread_block_tile / coalesced_group,并用本机曲线钉死「抽象税≈0」与「tile>32 悬崖」。
June`24 天前
c++·人工智能·算法·cuda
warp shuffle指令目录abstract背景线程束洗牌指令的不同形式线程束内的共享内存数据线程束值的广播线程束上偏移线程束下偏移
June`25 天前
c++·人工智能·算法·cuda
常量内存和只读缓存目录摘要常量内存常量缓存特性分配方式使用常量内存实现一维模板只读缓存分配方式实验总结本文将介绍常量内存和只读缓存,然后对比其差异
胖大和尚1 个月前
c++·cuda
在C++的类中,是否可以把函数声明成__device__可以,在C++类中完全可以将成员函数声明为 __device__ 函数。这允许该类的成员函数在GPU上被调用和执行。以下是具体的使用方法和一些关键点:
(initial)1 个月前
cuda
B-09. 数据布局(AoS/SoA/Transpose):一次布局调整带来的事务变化B-08 证明:TMA 再强,也只是「怎么搬」。 若从第一天就把字段交错成 AoS、或把该合并的写拆成跨步,引擎只能更高效地搬废字节。 本章回到 数据布局:AoS↔SoA、以及 Transpose 这种「布局变换算子」——一次调整如何改变 sector 事务与有效带宽。
一个小猴子`1 个月前
矩阵·cuda·triton
Triton实现矩阵乘法
攻城狮Soar2 个月前
cuda
CUDA编程之KernalKernel(内核)是在GPU上并行执行的函数。与CPU上只执行一次的传统C/C++函数不同,GPU kernel会被成千上万个线程同时执行,每个线程执行相同的代码但处理不同的数据。
xin_yao_xin2 个月前
开发语言·python·conda·cuda
Conda 环境的 CUDA PATH 配置指南conda 环境里装了 CUDA Toolkit,但 `nvcc`、cuBLAS 头文件或运行时库仍然指向系统的旧版本(通常是 `/usr/local/cuda/`),导致编译或运行时版本不匹配。
basketball6162 个月前
人工智能·microsoft·nvidia·cuda
AI Infra 硬件体系与编程模型:17. CUDA编程基础:底层驱动 API 调用在CUDA开发的入门阶段,我们接触的几乎都是Runtime API(运行时API):cudaMalloc、cudaMemcpy、<<<>>>核函数启动……这些接口简单易用,几行代码就能跑起一个GPU程序。但很多人不知道,Runtime API 只是一层封装,它的底层是更基础、更灵活的 Driver API(驱动API)。
fpcc2 个月前
c++·cuda
并行编程实战——CUDA编程的pipelines对于学计算机的人来说,pipelines是一个经常听到的名词。在CPU的指令处理中,流水线处理机制是典型的应用代表。所谓流水线就是把任务拆成多个部分,让任务可以并行操作。 这里的重点就在于并行,提高并行,其中隐含着同步机制的处理。比如流水打乱后,如何进行新的任务流水的处理。
basketball6163 个月前
人工智能·nvidia·cuda
AI Infra 硬件体系与编程模型:14. CUDA编程基础:事件与精确性能测量在之前的系列文章中,我们学习了CUDA的核函数、内存模型、共享内存优化和CUDA流技术。但所有这些优化都建立在一个前提之上:我们能够精确地测量程序的性能。