gpu

Smoothcloud润云3 天前
人工智能·算法·ai·aigc·gpu算力·gpu
GPU租赁数据安全怎么做?算力租赁模式下,多租户共享GPU集群环境,数据安全是企业选型时最为关注的问题之一。训练数据集、模型权重、业务日志都包含大量敏感信息,一旦出现跨租户数据泄露,可能造成严重的业务损失。一套完善的算力租赁数据安全体系,应当覆盖从硬件到数据的全方位防护。
对象存储与RustFS3 天前
开源·ai编程·gpu
别再只怪 GPU 了:2026 年 AI 训练/推理的存储瓶颈,以及 7 个被忽视的真相过去一年,我跟踪了不下二十个团队的 AI 训练 / 推理数据管线搭建,反复看到一个反直觉的场景:GPU 集群堆满了,利用率却只有 30%–40%。
Eloudy5 天前
docker·gpu·rdma
国内加速 docker pull 下载 docker images,特别是 nvidia 的cuda image添加如下文件内容 $ cat /etc/docker/daemon.json重启生效:一次性快捷方式:
这是谁的博客?9 天前
人工智能·ai·云原生·kubernetes·gpu·多租户·ai安全
【中阶·融合】如何隔离多租户 AI 推理平台的 GPU 资源:从 Namespace 到 MIG/Kata 的五层纵深防御
Eloudy9 天前
gpu·rdma
全文笔记 - GPU-Initiated Networking for NCCL现代 AI 工作负载——尤其是混合专家(Mixture-of-Experts,MoE)架构——日益需要低延迟、细粒度且由设备端控制的 GPU 到 GPU 通信。传统 GPU 通信遵循主机发起(host-initiated)模型,由 CPU 编排所有通信操作——这是 CUDA 运行时模型的固有特征。尽管该模型对集合通信操作而言足够稳健,但对于需要计算与通信紧密集成的应用,采用设备发起(device-initiated)的通信以消除 CPU 协调开销将带来显著收益。
Eloudy10 天前
gpu·fpga·rdma
Holoscan Sensor Bridge 入门指南(Getting Started)Holoscan Sensor Bridge 提供了一个基于 FPGA 的接口,用于利用 GPU 进行低延迟的传感器数据处理。外设数据由 Holoscan Sensor Bridge 设备的 FPGA 采集,并通过以太网以 UDP 方式发送至主机系统。在 IGX Devkit 或 DGX Spark 等系统中,ConnectX SmartNIC 接口可以将 UDP 数据直接写入 GPU 显存,从而大幅降低延迟。Holoscan Sensor Bridge 的主机端软件支持将接收到的传感器数据集成到 Hol
小孔龙10 天前
android·性能优化·gpu
Android GPU 渲染管线:一帧画面如何走上屏幕本文以传统 View 系统和 Android 11 为背景,沿默认的硬件加速路径,完整追一帧画面从产生到上屏的过程:从 VSync 出发,经过主线程、RenderThread、GPU、BufferQueue 和 SurfaceFlinger,直到显示在屏幕上。前五章按管线顺序推进,第六章集中处理几个绕不过去的概念问题。
吴佳浩13 天前
人工智能·ai编程·gpu
一文讲透AI算力单位:TFLOPS、PFLOPS、TOPS、稀疏算力,到底怎么算、怎么比?作 者:吴佳浩Alben撰稿时间:2026.7.18更新时间:2026.7.23很多人在统计 GPU 算力时都会遇到一个问题:
VNDR13 天前
gpu
vLLM 在 RTX 4060 上的推理性能调优全记录一份从 “跑不起来” 到 “31.4 req/s” 的完整实战笔记前段时间我在学习大模型推理部署时,遇到了一个很尴尬的局面:网上教程大多基于 A100 / H100,但作为个人开发者,我手头只有一台 RTX 4060 Laptop(8GB 显存) 的笔记本。vLLM 官方文档看起来很美好,但真要自己玩起来,网络问题、CUDA 版本不兼容、flashinfer 编译失败一个都没少硬吃。
纪伊路上盛名在14 天前
linux·数据库·gpu·驱动
NVML ERROR_ RM has detected an NVML_RM version mismatch近期登入服务器,用nvidia-smi和nvitop查看,发现报了一个错:我们以nvidia-smi的输出log为例,
GPUStack15 天前
ai·大模型·llm·gpu·vllm·gpu集群·gpustack
怎么优雅地在GPUStack上使用minerU?如果你搞过 AI 知识库,那你一定听过 MinerU 的大名。这家伙专治各种不服——哦不,专治各种复杂的 PDF 文档,甭管是密密麻麻的公式还是乱七八糟的表格,它都能精准地转成 Markdown 格式。在 AI 知识库里,海量的 PDF 嗷嗷待哺,等着被转成 MD 喂进去呢。
Smoothcloud润云17 天前
人工智能·ai·云计算·gpu算力·gpu
国内GPU算力租赁平台横向测评:资源、成本、稳定性三维对比2026年国内GPU租赁市场规模持续增长,越来越多企业选择租用GPU服务器替代自有采购。但市场上平台数量众多,隐性消费、性能虚标、运维缺失等问题频发。
GPUStack19 天前
ai·大模型·llm·gpu·vllm·gpu集群·sglang·gpustack
Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。
Smoothcloud润云23 天前
人工智能·机器人·gpu算力·gpu
具身智能数据集有哪些?机器人训练常用数据集整理具身智能数据集是机器人实现感知、交互、自主决策的核心训练资源,直接决定模型精度与落地效果。目前行业主流数据集分为真机实操、仿真合成、场景导航三大类,不同数据集的训练算力、存储要求差异较大,不少研发团队常面临算力不足、仿真效率低、硬件成本高昂等问题。本文整理机器人训练常用具身智能数据集,并结合润云平台算力优势,讲解适配的高效训练方案,助力模型快速迭代落地。
GPUer24 天前
gpu
同一个灵魂,两副躯体——GPU 内存管理为何是 CPU MM 的“平行宇宙”在深入分析drm gpuvm的设计和实现前,我想先给出理解这个领域的一个视角,视角对了,一切设计就是水到渠成。视角如下: Linux 内核 GPU 内存管理子系统(TTM、GEM、GPUVM)与经典 CPU 内存管理(MM)子系统之间的结构和功能具有高度相似性。我们认为,GPU 内存栈不仅仅是受 CPU MM 启发——它是在不同硬件约束下对相同基本原则的重新推导。这种类比并非偶然,而是架构上的必然,它通过共享的术语、相同的算法模式以及趋同的设计轨迹深深嵌入内核的 DRM 子系统中。
算力百科小星24 天前
gpu算力·gpu
企业AI训练算力成本结构分析:自建机房与云算力的经济性比较基于全生命周期成本模型的算力策略决策框架分类:技术经济分析 | 阅读对象:CTO、技术负责人、采购决策者
武子康1 个月前
人工智能·llm·gpu
🔥 vLLM / SGLang / TGI / TensorRT-LLM / Triton 真实分工:分层定位 + 5 步决策路径LLM Serving 方案选择不能只问"哪个最快"。这个问题本身就容易误导。不同框架解决的问题并不一样。vLLM 更像开放模型在线服务的通用默认选项;SGLang 更强调复杂生成程序、Agent、多分支和共享 prefix 复用;TGI 贴近 Hugging Face 生态与既有生产接口;TensorRT-LLM 是 NVIDIA GPU 上的深度性能工程路线;Triton Inference Server 则是通用推理服务平台,不只服务 LLM。
武子康1 个月前
人工智能·llm·gpu
调查研究-223 一个请求在 vLLM 里的一生:从 HTTP 到 token streaming备注:版本矩阵全部基于 vLLM 官方文档、Anatomy of vLLM 博客(2025-09-05)、vllm-project/vllm GitHub 主分支(commit 42172ad 之后)核查;未单独标注「⚠️」的条目均为多源印证后的稳定事实。
武子康1 个月前
人工智能·ai·架构·llm·gpu·vllm·sglang
调查研究-224 Prefill 与 Decode 分离:高并发 LLM Serving 的下一层架构备注:版本矩阵全部基于 vLLM 官方文档、Anatomy of vLLM 博客(2025-09-05)、DistServe / Mooncake / Sarathi-Serve / EPD 等公开论文(arXiv + OSDI 2024 + FAST 2025)、vllm-project/vllm GitHub PR、SegmentFault / CSDN 公开拆解文章核查;⚠️ 条目为已披露的安全/版本相关问题,需要运维侧主动升级或缓解。