gpu

Eloudy3 天前
gpu
全文 - 第 03 章 - Principles and Practices of Interconnection Networks网络拓扑指互连网络中通道和节点的静态安排——分组行驶其上的道路。选择网络拓扑是设计网络的第一步,因为路由策略和流量控制方法都严重依赖拓扑。必须先有道路地图,才能选择路线并安排其通行。正如第 2 章的例子所示,拓扑不仅规定网络的类型(例如蝶形),还规定细节,如交换机的基数、级数以及每条通道的宽度和比特率。
Eloudy3 天前
gpu·chiplet
全文 - 第 01 章 - Principles and Practices of Interconnection Networks原著:William J. Dally, Brian Towles,《Principles and Practices of Interconnection Networks》,Morgan Kaufmann,2004。
Eloudy3 天前
gpu
全文 - 第 08 章 - Principles and Practices of Interconnection Networks路由(routing)是在给定拓扑中,为分组选择从源节点到目的节点路径的过程。有了拓扑——网络的道路地图——之后,路由是顺理成章的下一步:在地图上选一条能到达目的地的路线。拓扑决定网络的理想性能,而路由是决定这一潜力有多少能实现的两个关键因素之一。另一个关键因素是流量控制,在第 12、13 章讨论。
Eloudy3 天前
gpu
全文 - 第 02 章 - Principles and Practices of Interconnection Networks本章考察一个简单互连网络的体系结构与设计,以提供一个全局视图。我们将考察尽可能简单的网络:一个采用丢弃式流量控制的蝶形网络。尽管得到的网络代价不菲,但它凸显了互连网络设计的许多关键方面。在后面的章节中,我们将学习如何构建更高效、更实用的网络。
Eloudy3 天前
gpu
全文 - 第 06 章 - Principles and Practices of Interconnection Networks到目前为止,我们一直关注分组交换网络;本章把注意力转向电路交换(circuit-switched)网络。在电路交换网络中,特定源和目的地之间的连接先被建立,然后在数据持续流过连接期间保持,最后被拆除。¹ 历史上,无阻塞电路交换网络最早与电话系统联系在一起:一个人打给另一个人的呼叫代表一次连接请求。要让呼叫接通,必须在网络中找到一条空闲路径并分配给这次呼叫。如果电话系统是无阻塞的,那么只要接听方的电话不在使用中,呼叫就总能成功。更精确地说:如果一个网络能处理构成输入输出置换的所有电路请求,就称它是无阻塞(n
Eloudy3 天前
gpu
BookSim (1.0) 用户手册Brian Towles 和 William J. Dally2004 年 9 月 10 日本文档描述 BookSim 互连网络模拟器的使用。该模拟器设计为 Morgan Kaufmann 出版的教科书《互连网络原理与实践》(PPIN)(ISBN: 0122007514)的配套工具,并假定读者熟悉该教材所涵盖的内容。
论文复现现场5 天前
pytorch·深度学习·云计算·gpu
AutoDL、算家云与公有云 GPU 怎么选?环境复现、计费与断点恢复对比个人开发者先看环境搭建和完整成本,科研用户先看版本复现与任务恢复,企业团队先看网络、权限和运维接入。选择 GPU 平台,应先明确任务约束,再用同一套验收流程筛选。
Eloudy5 天前
gpu·chiplet
全文 - Dissecting How Die Scaling Breaks GPU Fine-grained Scheduling原文现代 GPU 在物理上已不再对称。芯片扩展导致了 制造-驱动 的 floorsweeping(缺陷屏蔽)【见文末注释1】以及缓存和内存分区。前者产生了芯片特定的计算拓扑结构,而后者导致了非均匀内存访问(NUMA)。这些不对称性是显著的:忽略拓扑的计算单元分配可导致高达 1.33× 的性能波动,而远程访问使 HBM 延迟增加高达 67%、L2 延迟几乎翻倍。然而,这些不对称性被隐藏在 GPU 的逻辑资源抽象背后,并且可能因芯片而异。我们开发了轻量化的特征化方法,以揭示每块芯片的计算拓扑和内存亲和性。然后
Eloudy6 天前
gpu·chiplet
BlackWell 双 计算 die 的 L2 一致性 casesNvidia’s B200: Keeping the CUDA Juggernaut Rolling ft. Verda (formerly DataCrunch)
Eloudy6 天前
java·开发语言·数据库·gpu·chiplet
全文 - version.A - AMBA CHI Chip-to-Chip(C2C)翻译说明:本文档为 Arm IHI0098 A《AMBA® CHI Chip-to-Chip (C2C) Architecture Specification》(2024 年 2 月发布)的完整中文翻译。如中英文版本之间存在任何冲突,以英文原版为准。
Eloudy7 天前
gpu·chiplet
全文 - 第0章 前言,第 1 章 简介 - UCIe v3.0 Specification本文档为 UCIe 规范 Revision 3.0, Version 1.0(2025 年 8 月 5 日)前言部分的中文翻译。 Universal Chiplet Interconnect Express (UCIe) © 2022–2025 版权所有。
Eloudy9 天前
网络·缓存·gpu
NVSwitch 和 UALink 的数据(缓存)一致性UALink 1.0 在加速器之间(跨 GPU、跨 System Node)明确采用软件一致性,而非硬件 snoop。
Eloudy16 天前
gpu·fpga·rdma·roce·doca
开源 gpunetio examples 01 解析 gpunetio_verbs_put_bw针对 https://github.com/NVIDIA-DOCA/gpunetio/tree/main/examples/gpunetio_verbs_put_bw/ 把服务器端和客户端,两端的核心逻辑分别提炼如下。
Eloudy17 天前
gpu·fpga·rdma·roce·doca
GPUNetIO开源实现与FPGA的 RoCEv2 通信延迟实验对象:arXiv:2510.25213《Platform Architecture for Tight Coupling of High-Performance Computing with Quantum Processors》第 2.4 节 “Network proof of concept”。 本文先回答"这个实验在物理上和工程上证明了什么、为什么这样设计", 再把每条原理映射到本项目(nvqlink_echo_poc/)的具体实现。
Eloudy18 天前
gpu·rdma·roce·doca
cpu rdma 与 gpunetio 的关系gpunetio, 是类似cpu app doca sender,receiver 过程的 gpu化,现在探究两者的联系。
Eloudy19 天前
gpu·fpga
基于 PTP 的 FPGA→RoCE→CPU 单向延迟测量实验方案针对论文 arXiv:2510.25213v2 §2.4 “Network proof of concept” 的一个关键细节: 该方案没有使用主机 PTP 同步。本文结合 holoscan-sensor-bridge/fpga/nv_hsb_ip/(HSB IP)与 holoscan-sensor-bridge/fpga/pynq/rfsoc-pynq/(论文所用 RFSoC-PYNQ 参考设计) 的 RTL 代码,回答一个问题:
Eloudy19 天前
gpu
gpunetio_verbs_write_lat 延迟测试使用了哪些 GPUNetIO 能力分析对象:NVIDIA-DOCA/gpunetio 开源仓库中的 examples/gpunetio_verbs_write_lat 结论先行:该测试使用了六项能力中的 3 项——Verbs CPU 控制路径、GPUNetIO CPU 控制路径、RDMA Verbs 单边(one-sided)GPU 数据路径。
Eloudy20 天前
gpu
全文 - DOCA GPUNetIO 闭源实现的 Doc本文档提供 DOCA GPUNetIO API 的概述与配置说明。原文:https://networking-docs.nvidia.com/doca/archive/3-5-0/doca-gpunetio(DOCA 3.5.0 归档版本,页面最后更新:2026 年 9 月 1 日)
Eloudy20 天前
gpu
全文 - DOCA GPUNetIO Open Source 仓库 README原文:DOCA GPUNetIO Open Source 仓库 README(github.com/NVIDIA-DOCA/gpunetio)
guwentian20 天前
web·gpu·transport
WebGPU 和 WebTransport 2026 真的能上生产了吗?📖 摘要:2026 年浏览器平台迎来一波"能力基线"落地:WebGPU 在年初进入 Baseline,WebTransport 在 3 月进入 Baseline,WebCodecs 接近 Baseline。但它们真能上生产吗?本文逐一给出版本状态、真实可落地的场景与"现在用 / 再等等"的判断,并附 WebGPU 计算与 WebTransport 客户端的运行示例。读完你能快速决定哪些 API 该进明年路线图,哪些还要兜底。