gpu

Eloudy1 小时前
gpu
全文 - DOCA GPUNetIO Open Source 仓库 README原文:DOCA GPUNetIO Open Source 仓库 README(github.com/NVIDIA-DOCA/gpunetio)
guwentian3 小时前
web·gpu·transport
WebGPU 和 WebTransport 2026 真的能上生产了吗?📖 摘要:2026 年浏览器平台迎来一波"能力基线"落地:WebGPU 在年初进入 Baseline,WebTransport 在 3 月进入 Baseline,WebCodecs 接近 Baseline。但它们真能上生产吗?本文逐一给出版本状态、真实可落地的场景与"现在用 / 再等等"的判断,并附 WebGPU 计算与 WebTransport 客户端的运行示例。读完你能快速决定哪些 API 该进明年路线图,哪些还要兜底。
论文复现现场1 天前
人工智能·pytorch·深度学习·云计算·gpu·cuda
课程作业要跑 PyTorch 训练,学校机房不够用去哪租?云 GPU 选型、环境迁移与防丢数据指南课程截止日期临近、学校 GPU 又排不上时,可以临时租云 GPU。先按显存、训练时长、PyTorch/CUDA 环境和数据保存方式筛选,再用一小批数据试跑;不要只看显卡型号或小时单价。
赋创小助手6 天前
运维·服务器·人工智能·ai·部署·gpu·p2p
多GPU服务器交付验收:GPU健康、P2P、NCCL与稳定性测试思路高端GPU服务器的验收不能只停留在 nvidia-smi。对于4卡、8卡等多GPU平台,比较完整的验证链路通常是:
Eloudy8 天前
gpu
全文 - 05 part - NVIDIA 集合通信库(NCCL)文档NCCL 官方语言绑定的 API 规范。NCCL 核心 API 使用 C/C++ 实现(参见 NCCL API)。语言绑定在该实现之上提供封装,使其他编程语言也能使用 NCCL 的功能。
探索云原生9 天前
docker·ai·云原生·kubernetes·gpu
Kueue + HAMi vGPU 实战:显存与算力配额管理上一篇我们用 Kueue + NVIDIA 原生 DRA 跑通了 GPU 整卡配额:Job 先进入队列,Kueue 判断配额够不够,够了再放行给调度器。
cubestudio9 天前
人工智能·机器学习·gpu
海光 DCU 怎么接入 Kubernetes 和 AI 平台?CubeStudio 海光 DCU 适配实操(整卡 / 共享 / 两种 vDCU 虚拟化 + DeepSeek 部署)CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / O
阿里云大数据AI技术10 天前
人工智能·spark·gpu
EMR Serverless Spark:CPU + GPU 异构计算使用指南想做 AI 推理、模型训练、或者 GPU 加速的数据处理?阿里云 EMR Serverless Spark 支持 CPU 和 GPU 异构计算,开箱即用,不用自己花费时间搭集群。本文手把手教你怎么在EMR Serverless Spark产品中买到 GPU 资源,买到之后怎么跑起来。
Eloudy12 天前
gpu
NVTx 主旨介绍NVIDIA NVTX(NVIDIA Tools Extension SDK)的核心主旨是:为应用程序提供一套轻量级、跨平台的代码注释 API,让开发者工具(如 Nsight Systems、Nsight Compute 等)能够获取程序运行时的上下文信息,从而在性能分析和调试时呈现更具语义的时间线视图。
Eloudy12 天前
gpu
NVLS 简介核心要义NVLS:< 1.> 每个参与集合通信贡献一块物理显存,登记进本地,也登记进交换机(nvswitch); < 2.> 实际上发起集合通信的主角,是交换机(nvswitch)。 当要做 sum 集合通信时,实际上是某一个 gpu 发出了一条特别的 gpu 指令,发送到 交换机; 交换机解析这个信息报后就知道要把众 gpu 的登记进来的显存的对应位置的数据一并 ld 到交换机本地(通过交换结构); 然后使用本地的cpu中的算力 sum 起来。最后将 sum 结果广播送回各个 GPU。
Felven12 天前
cpu·gpu·intel·性能对比·amd
Intel Core Ultra X9 388H全面性能对比分析报告GPU 对比 AMD Radeon E8860 | CPU 对比 Intel Xeon D-2183IT
Eloudy13 天前
gpu
全文 - 03 part - NVIDIA 集合通信库(NCCL)文档以下各节描述 NCCL 的方法与操作。以下函数是 NCCL 公开的用于创建和管理集合通信操作的公共 API。
每日出拳老爷子13 天前
gpu·nvidia·cuda·ollama·本地大模型
【AI】Ollama 更新后 skipping CUDA 掉回 CPU我这次看到的是 Ollama GitHub issue 里的一组对照日志,不是我在自己 3060 上复现出来的结果。 麻烦的地方在于,Ollama 升到 0.32.14 以后,三十系 / sm_86 显卡不是直接报“CUDA 不可用”,而是日志里跳过 CUDA 设备,最后静默掉回 CPU。 这篇文章只处理这一件事:看到 skipping CUDA device - compute capability not in compiled architectures 时,先判断是不是 0.32.14 的后端库选
晨欣13 天前
笔记·学习·gpu·显卡·nvidia·英伟达
NVIDIA GPU 架构演进学习笔记(GPT-5.6 Terra 生成)更新:2026-09-04 范围:以 NVIDIA 近代独立 GPU 的架构演进为主,重点解释 GeForce RTX 4090、RTX 50 系列,以及专业卡中容易混淆的 “RTX 6000” 命名。
Eloudy13 天前
gpu
GXF 构建依赖清单setup_env.sh 负责搭建 GXF 构建环境:下载/编译全部第三方依赖并导出环境变量。 本文档罗列其全部依赖的下载方式、构建方法、安装路径。
蒸鱼Yuzheng14 天前
gpu·游戏测试·shader测试·材质测试·图形兼容
游戏 Shader 与材质怎么测:丢失、变粉、编译卡顿与平台差异摘要:Shader问题常表现为粉色材质、闪烁、透明错误或首次使用卡顿,需要结合资源版本和GPU环境定位。
众人皆醒我独醉14 天前
面试·kubernetes·gpu
Kubernetes GPU 调度与管理的完整机制——从节点上架到 Pod 拿到 GPUGPU 云平台系列 · 第 2 篇第 1 篇讲了 GPU 云平台的六大挑战。这一篇聚焦其中的调度层——一个 Pod 从 kubectl apply 到拿到 GPU 并开始计算,中间经过多少层机制?每层在做什么、配置在哪里、出了问题怎么排查。
SDWAN_Cheap15 天前
cpu·gpu
CPU与GPU的区别及应用场景详解CPU(Central Processing Unit,中央处理器)和GPU(Graphics Processing Unit,图形处理器)是当前计算设备中最核心的两种处理器芯片。两者设计目标不同,决定了它们在架构、性能和适用场景上的根本性差异。
Eloudy15 天前
gpu·fabric·超节点
全文 - 第1部分 - NVIDIA Fabric Manager User Guide原文随着深度学习神经网络变得越来越复杂,其规模和复杂度持续膨胀,导致在合理时间内训练这些网络所需的算力呈指数级增长。为应对这一挑战,应用已转向多 GPU 实现。
Eloudy15 天前
gpu·eda·超节点
全文 - Scale-up fabrics随着 AI 工作负载扩展到数千个加速器,机架级系统的互连结构(也称 scale-up 互连结构)正受到高度关注。2025 年,多项重大进展正在重塑 scale-up 互连的格局。