cuda

论文复现现场2 天前
cuda·分子动力学·lammps·rtx5090
LAMMPS 用 RTX 5090 能跑多大?32GB 显存、CUDA 编译与规模验证RTX 5090 可以作为 LAMMPS 单卡模拟的候选,但需要势函数支持 GPU 加速、编译环境匹配,并通过精度验证。32GB 显存不能直接换算成固定原子数,实际容量应通过同一模型的规模递增测试确定。
EatFan2 天前
开源·cuda·deepseek·deepgemm·tilelang·华为昇腾
从 CUDA 到昇腾:一张对照表拆解 DeepSeek 最新开源组件(TileLang / DeepGEMM / DeepEP / TileKernels)2026 年 9 月 30 日,DeepSeek 公布了一组面向华为昇腾平台的开源组件;相关解读随后于 10 月 4 日在掘金发布,给出了四组明确的对应关系:TileLang Ascend 后端对应 TileLang CUDA 后端、DeepGEMM-Ascend 对应 DeepGEMM CUDA 版本、DeepEP-Ascend 对应 DeepEP CUDA 版本、TileKernels Ascend 后端对应 TileKernels NVIDIA 后端 [1]。这组发布真正值得注意的地方,不是"又多了
论文复现现场4 天前
人工智能·pytorch·python·深度学习·cuda·rtx3090
RTX 3090 24GB 适合科研吗?单卡论文复现、PyTorch 显存检查与 OOM 排错RTX 3090 24GB 适合不少单卡深度学习科研实验,包括图像分类、二维分割、小模型微调和部分量化大模型实验。是否够用,要看训练方式、输入尺寸和批大小;能启动程序,也不等于能复现论文指标。
论文复现现场7 天前
pytorch·深度学习·cuda·rtx5090
RTX 5090 32GB 适合科研计算吗?单卡训练、推理、论文复现与 OOM 判断方法RTX 5090 的 32GB 显存可作为许多单卡论文复现、7B/8B 推理与 QLoRA、常见视觉训练的候选;全参数大模型训练、FP64 密集计算和超大样本不应只看显存下结论。
论文复现现场7 天前
开发语言·pytorch·batch·cuda·rtx3090
论文复现看到“RTX 3090 or higher”:显存、CUDA、batch size 与 OOM 怎么判断?“RTX 3090 or higher”通常表示作者至少在24GB显存、Ampere级CUDA环境中验证过,不代表显卡型号越新就一定能运行。应先看显存峰值,再检查CUDA兼容性,最后用最小输入实跑。
_nibel7 天前
cuda·ncu·nsight compute
第二章:Details 重点数据细读 ⭐教你读懂 Nsight Compute 报告 系列合集⭐本章正式进入 Details 页,这可是全部指标的大合集,被切成 14 个 section,从上往下排开,信息量比 Summary 大一个量级,本章着重讲透其中最值得细读的三个重点 section,剩下的 section 留到下一章按页面顺序补齐。
论文复现现场16 天前
cuda·多模态大模型·显存优化·rtx3090·minicpm-o
MiniCPM-o 4.5 需要多少显存?RTX 3090 24GB 的 BF16、AWQ、GGUF 部署边界与验收方法先给结论:RTX 3090 的 24GB 显存不能按官方口径稳定承载 MiniCPM-o 4.5 完整 PyTorch 全双工 Web Demo;它更适合 AWQ、GGUF,或关闭部分模态后的单轮验证。若目标是原精度、完整音视频全双工服务,应按官方“至少 28GB 显存”要求选卡。
qq_1998868717 天前
c++·人工智能·gpu算力·cuda
第8板块·第2节:统一内存的高级特性与性能调优学完本节你将能够:统一内存的核心机制是按需迁移:当主机或设备访问某个统一内存地址时,如果数据不在访问方,硬件会触发页错误,然后自动将数据从另一端迁移过来。
qq_1998868717 天前
c++·人工智能·gpu算力·cuda
第8板块·第3节:设备间拷贝与点对点(P2P)传输学完本节你将能够:当数据需要在两个 GPU 之间移动时,有两种基本方式:使用两次 cudaMemcpy 完成:
qq_1998868717 天前
c++·人工智能·gpu算力·cuda
第8板块·第1节:主机与设备内存管理基础与统一内存学完本节你将能够:在 CUDA 编程模型中,CPU 和 GPU 拥有各自独立的内存空间:两者之间通过 PCIe 总线连接,数据传输需要显式调用 cudaMemcpy。
qq_1998868718 天前
c++·人工智能·gpu算力·cuda
第7板块·第1节:通用算子分类与设计模式学完本节你将能够:在深度学习和科学计算中,GPU 算子种类繁多,但可以根据计算模式归纳为几大类:最简单直观的模式,每个线程处理一个输出元素。
qq_1998868719 天前
c++·人工智能·gpu算力·cuda
第7板块·第3节:CUTLASS 的 GEMM 实现与优化策略学完本节你将能够:CUTLASS 的 GEMM 实现遵循全局内存 → 共享内存 → 寄存器 → Tensor Core → 全局内存的数据流。其核心思想是通过多级缓存和流水线,最大化数据复用,最小化全局内存访问。
Luchang-Li19 天前
stream·cuda·并行
CUDA stream创建和依赖,多流并行cuda不同的stream是独立执行的,如何建立多个steam的分叉和合并依赖?CUDA 不同 stream 默认是彼此独立调度的,要建立多个 stream 之间的“分叉 / 合并”依赖,最常用的机制就是:
论文复现现场21 天前
人工智能·pytorch·深度学习·云计算·gpu·cuda
课程作业要跑 PyTorch 训练,学校机房不够用去哪租?云 GPU 选型、环境迁移与防丢数据指南课程截止日期临近、学校 GPU 又排不上时,可以临时租云 GPU。先按显存、训练时长、PyTorch/CUDA 环境和数据保存方式筛选,再用一小批数据试跑;不要只看显卡型号或小时单价。
论文复现现场1 个月前
人工智能·pytorch·python·深度学习·cuda
本地 PyTorch 训练 OOM,第一次租 RTX 4090 云 GPU 怎么迁移项目?从环境检查到 100 Step 跑通很多小型 AI 团队都会遇到类似问题:项目在本地已经能运行,但 12GB 或 16GB 显卡频繁 OOM;想临时租一张 RTX 4090,又担心 CUDA、PyTorch、数据路径和依赖全部需要重配。第一次使用云 GPU,应该从哪里开始?
2601_962387821 个月前
python·numpy·cuda·jit编译器·numba
Python CUDA 编程 - 2 - Numba 简介Numba是个为特定对象的开源JIT编译器, 它由公司带头开展开发工作, 能够针对原生代码实施CPU以及GPU加速, Numba对于NumPy数组跟函数特别友善。
每日出拳老爷子1 个月前
gpu·nvidia·cuda·ollama·本地大模型
【AI】Ollama 更新后 skipping CUDA 掉回 CPU我这次看到的是 Ollama GitHub issue 里的一组对照日志,不是我在自己 3060 上复现出来的结果。 麻烦的地方在于,Ollama 升到 0.32.14 以后,三十系 / sm_86 显卡不是直接报“CUDA 不可用”,而是日志里跳过 CUDA 设备,最后静默掉回 CPU。 这篇文章只处理这一件事:看到 skipping CUDA device - compute capability not in compiled architectures 时,先判断是不是 0.32.14 的后端库选
CODER03041 个月前
人工智能·pytorch·深度学习·自然语言处理·cuda·ubuntu24.04·降内核
ubuntu24.04:降内核+显卡驱动+cuda+cudnn+pytorch+anaconda+pycharmhttps://blog.csdn.net/sinat_30065705/article/details/164096032?fromshare=blogdetail&sharetype=blogdetail&sharerId=164096032&sharerefer=PC&sharesource=sinat_30065705&sharefrom=from_link
Zhu7581 个月前
nvidia·cuda
GPU驱动与CUDA安装指南服务器部署深度学习 / 推理等 GPU 业务前,需要先安装 NVIDIA 驱动与 CUDA 工具包。本文覆盖:
喜壹LittlePrince1 个月前
cuda·hpc
CUDA 入门第一课:从线程索引到向量加法与朴素矩阵乘法这是我的 NVIDIA CUDA Training Series 第一节课学习笔记与 Homework 1 实践记录。