cuda

论文复现现场18 小时前
人工智能·pytorch·深度学习·云计算·gpu·cuda
课程作业要跑 PyTorch 训练,学校机房不够用去哪租?云 GPU 选型、环境迁移与防丢数据指南课程截止日期临近、学校 GPU 又排不上时,可以临时租云 GPU。先按显存、训练时长、PyTorch/CUDA 环境和数据保存方式筛选,再用一小批数据试跑;不要只看显卡型号或小时单价。
论文复现现场8 天前
人工智能·pytorch·python·深度学习·cuda
本地 PyTorch 训练 OOM,第一次租 RTX 4090 云 GPU 怎么迁移项目?从环境检查到 100 Step 跑通很多小型 AI 团队都会遇到类似问题:项目在本地已经能运行,但 12GB 或 16GB 显卡频繁 OOM;想临时租一张 RTX 4090,又担心 CUDA、PyTorch、数据路径和依赖全部需要重配。第一次使用云 GPU,应该从哪里开始?
2601_962387829 天前
python·numpy·cuda·jit编译器·numba
Python CUDA 编程 - 2 - Numba 简介Numba是个为特定对象的开源JIT编译器, 它由公司带头开展开发工作, 能够针对原生代码实施CPU以及GPU加速, Numba对于NumPy数组跟函数特别友善。
每日出拳老爷子13 天前
gpu·nvidia·cuda·ollama·本地大模型
【AI】Ollama 更新后 skipping CUDA 掉回 CPU我这次看到的是 Ollama GitHub issue 里的一组对照日志,不是我在自己 3060 上复现出来的结果。 麻烦的地方在于,Ollama 升到 0.32.14 以后,三十系 / sm_86 显卡不是直接报“CUDA 不可用”,而是日志里跳过 CUDA 设备,最后静默掉回 CPU。 这篇文章只处理这一件事:看到 skipping CUDA device - compute capability not in compiled architectures 时,先判断是不是 0.32.14 的后端库选
CODER030416 天前
人工智能·pytorch·深度学习·自然语言处理·cuda·ubuntu24.04·降内核
ubuntu24.04:降内核+显卡驱动+cuda+cudnn+pytorch+anaconda+pycharmhttps://blog.csdn.net/sinat_30065705/article/details/164096032?fromshare=blogdetail&sharetype=blogdetail&sharerId=164096032&sharerefer=PC&sharesource=sinat_30065705&sharefrom=from_link
Zhu75822 天前
nvidia·cuda
GPU驱动与CUDA安装指南服务器部署深度学习 / 推理等 GPU 业务前,需要先安装 NVIDIA 驱动与 CUDA 工具包。本文覆盖:
喜壹LittlePrince23 天前
cuda·hpc
CUDA 入门第一课:从线程索引到向量加法与朴素矩阵乘法这是我的 NVIDIA CUDA Training Series 第一节课学习笔记与 Homework 1 实践记录。
xier_ran25 天前
人工智能·深度学习·cuda
【infra之路】GPU 执行与存储层次全景关系图Warp ≠ Block Block 是资源分配单位(SMEM、barrier),Warp 是执行单位。一个 Block 可能有 8 个 Warp,但同一时刻只有部分 Warp 在发射指令。
椒颜皮皮虾྅1 个月前
android·开发语言·人工智能·深度学习·c#·cuda
【TensorRTtSharp v4.0】在 C# 中使用 TensorRT CSharp API v4.0 动态编译并运行 CUDA KernelCUDA Runtime Compilation 适合在运行时生成或组合 Kernel,而不是为每一种参数组合预先构建本机二进制。完整流程不只是把一段 CUDA C 字符串交给 NVRTC:程序还要发现编译器能力、传入虚拟头文件和选项、保存编译日志、复制 PTX/CUBIN/LTO IR、加载 Module、按 ABI 组织 Kernel 参数、提交到 Stream,并把 GPU 结果读回验证。
Albart5751 个月前
cuda·nccl·vllm·大模型部署·多卡推理·大模型踩坑
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案本文为生产级 vLLM 多卡分布式部署踩坑复盘,聚焦全网高频疑难问题:CUDA error: worker 进程异常退出。
帅气的小峰1 个月前
c++·python·cuda·推理引擎
pybind11与nanobind可以共存吗?如何迁移?可以共存,但不建议在同一个 Python 扩展模块(.so/.pyd)中混合使用。不过,在同一个项目中以“分模块”或“渐进迁移”的方式共存是完全可行且常见的实践。
(initial)1 个月前
c语言·开发语言·cuda
C-05. Kernel Fusion 代价边界:少写回 vs 寄存器压力与 occupancyC-04 钉死:少同步点不等于该 fuse。 本章回答垂直融合何时省 GMEM 真赚、何时寄存器/occupancy 把收益吃掉。 本机:瘦融合随链长 3.9×→9.8×;fat 把 occupancy 6→1,相对瘦融合慢 8×。
June`1 个月前
c++·人工智能·算法·cuda
并发内核执行目录abstract非空流的中的并发内核nsys步骤:(一定要详细学习)实验分析:openMP简单介绍openMP
Olafur_zbj1 个月前
人工智能·cuda·tile
【AI】CUDA的新编程模型:tile编程模型Tile Programming 是 CUDA 13.3 新增的 CUDA Tile 编程模型,不是传统 SIMT 代码里用 shared memory 手工做 tiling,也不是 cooperative_groups::tiled_partition。
(initial)1 个月前
cuda
C-02. Cooperative Groups:安全分组、tile 集体与 coalesced 聚合C-01 钉死了 __shfl_*_sync 与 mask 纪律。 手写 mask 能跑,但分组一变复杂就难组合。 本章把分组收成句柄:thread_block_tile / coalesced_group,并用本机曲线钉死「抽象税≈0」与「tile>32 悬崖」。
June`1 个月前
c++·人工智能·算法·cuda
warp shuffle指令目录abstract背景线程束洗牌指令的不同形式线程束内的共享内存数据线程束值的广播线程束上偏移线程束下偏移
June`1 个月前
c++·人工智能·算法·cuda
常量内存和只读缓存目录摘要常量内存常量缓存特性分配方式使用常量内存实现一维模板只读缓存分配方式实验总结本文将介绍常量内存和只读缓存,然后对比其差异
胖大和尚2 个月前
c++·cuda
在C++的类中,是否可以把函数声明成__device__可以,在C++类中完全可以将成员函数声明为 __device__ 函数。这允许该类的成员函数在GPU上被调用和执行。以下是具体的使用方法和一些关键点:
(initial)2 个月前
cuda
B-09. 数据布局(AoS/SoA/Transpose):一次布局调整带来的事务变化B-08 证明:TMA 再强,也只是「怎么搬」。 若从第一天就把字段交错成 AoS、或把该合并的写拆成跨步,引擎只能更高效地搬废字节。 本章回到 数据布局:AoS↔SoA、以及 Transpose 这种「布局变换算子」——一次调整如何改变 sector 事务与有效带宽。
一个小猴子`2 个月前
矩阵·cuda·triton
Triton实现矩阵乘法