ai infra

basketball6161 天前
python·fastapi·vllm·ai infra
Python FastAPI 介绍以及常用方法FastAPI 是一个高性能、工程化的 Python Web API 框架,基于标准 Python 类型提示开发,底层依赖 Starlette(ASGI 异步底层) 和 Pydantic(自动数据校验),原生支持自动生成交互式 API 文档,性能接近 Go/Node.js,是当前 Python 后端 RESTful API 开发的主流方案。
天涯明月19934 天前
人工智能·大模型·推理框架·ai infra
SGLang 设计与实现——RadixAttention 与前后端协同,让 KV 缓存不再用完即弃工程视角拆 SGLang:动机、前后端协同、RadixAttention、约束解码、零开销调度、投机解码、分布式与实测。 版本基线:SGLang v0.5.x(2026 年中),论文 NeurIPS 2024。
百度智能云技术站4 天前
模型训练·模型推理·ai infra·超节点·agent infra
《百度天池超节点系统架构设计规范》正式开放下载从机柜结构到供电散热,从高速互联到智能管理,《百度天池超节点系统架构设计规范》完整记录了百度天池超节点经过大规模实践验证的设计细节与系统取舍,以标准化、可复用的方式,为超节点走向普及提供设计依据。
爱笑的k119 天前
分布式·ai infra
分布式通信原语在分布式系统和并行计算中,多个节点(进程、线程、GPU)协同完成任务时,必然涉及"一对多"“多对一”"多对多"的数据交换。这些操作被抽象为集合通信原语(Collective Communication Primitives),是 MPI、NCCL、Gloo、Horovod 等通信库的基石,也是分布式机器学习与科学计算的核心。
basketball61614 天前
android·人工智能·vllm·ai infra
AI Infra 推理部署技术总结:2. vLLM 内核——PagedAttention 与调度器原理系列第二篇。上一篇(第一部分)介绍了 vLLM 的定位、特点、用法与常见类;本篇深入引擎内部,拆解让 vLLM 快起来的两个核心机制: PagedAttention(KV Cache 的分页内存管理) 与 调度器(Scheduler,连续批处理的决策中枢)。 读完你会理解:显存是怎么被"榨干"的,以及"GPU 每一步算谁"这件事是怎么被决定的。
爱笑的k1116 天前
大模型·ai infra
深度学习常见层输入输出维度对照参考一、前言 在深度学习模型搭建与调试过程中,张量维度的匹配是确保模型正确运行的基础。维度不匹配(Shape Mismatch)是开发者最常遇到的错误之一。本文档旨在提供一份全面、准确且结构清晰的维度对照参考表,帮助开发者在构建网络时快速查阅各层的输入输出维度关系、权重形状及尺寸计算公式,从而有效避免维度报错,提升模型开发效率。
DevOps老兵19 天前
人工智能·kubernetes·helm·vllm·大模型推理·ai infra
AI Infra实战05:用Helm在K8s中部署vLLM,从安装到压测全流程本篇配套的全部脚本、YAML、Helm Chart、预检工具和 Terraform 配置已开源在 GitHub:https://github.com/Jich1123/gpu-k8s-lab 。clone 下来按 00-lab/execution-checklist.md 的顺序执行即可复现全部实验(仓库不含任何真实 IP、密钥或账号信息)。
minhuan20 天前
人工智能·架构·ai infra·ai基础设施·ai任务调度
AI Infra全栈拆解:大模型应用背后的基础设施,算力集群、网络、存储与服务治理体系26.0最近大家都在聊大模型、Agent、RAG,很多人把注意力放在Prompt、智能体逻辑、检索算法上。但在实际落地的时候会发现,再好的模型权重、再精巧的业务逻辑,如果底层基础设施扛不住,一切都是空中楼阁。这就是AI Infra,AI基础设施。
DevOps老兵20 天前
人工智能·grafana·prometheus·ai infra·gpu监控·dcgm
AI Infra实战02:GPU监控实战,用DCGM+Prometheus+Grafana看清每一张卡本篇配套的全部脚本、YAML、Helm Chart、预检工具和 Terraform 配置已开源在 GitHub:https://github.com/Jich1123/gpu-k8s-lab 。clone 下来按 00-lab/execution-checklist.md 的顺序执行即可复现全部实验(仓库不含任何真实 IP、密钥或账号信息)。
寒霜雨刃22 天前
深度学习·神经网络·amd·rocm·ai infra·海光z100·gfx906
【原创】海光Z100 DCU适配vLLM实录(二):W4A16大M Prefill结构重写、GDN融合与长上下文HIP Attention上一篇结束时,海光Z100上的Qwen3.6-27B-AWQ-INT4已经把最影响使用的Decode问题基本处理到可以稳定运行的程度。AWQ是激活感知权重量化(Activation-aware Weight Quantization),它根据模型真实激活分布选择量化尺度,让权重能够以较低比特保存,同时尽量减少精度损失;INT4表示模型权重以4比特整数存储;W4A16表示4比特权重、16比特激活(Weight 4-bit,Activation 16-bit),也就是权重长期保持INT4压缩格式,模型运行时产
ylj_dev1 个月前
docker·容器·kubernetes·分布式系统·ai工作流·容器安全·ai infra
从 0 构建 AI Workload Platform(八):受限执行环境与 Kubernetes本文继续记录 AI Workload Platform 的实际开发。这个项目要构建的是一个可靠运行时和调度平台:用户提交由普通程序或 Agent 组成的多步骤工作流,平台负责依赖调度、状态持久化、重试、取消、恢复、分布式执行和审计。
styshoo1 个月前
kubernetes·gpu·ai infra·nvsentinel
[NVSentinel] metadata-collector模块调研基于 NVSentinel 文档与 metadata-collector/ 代码的实现分析。文档引用指向 NVIDIA/NVSentinel main 分支。
爱笑的k111 个月前
ai infra
矩阵转置算子优化-利用padding 解决 bank conflictsm: 硬件层面的计算核心,SM 是调度的基本单位。GPU 的硬件调度器会把你的 Block “分发”给空闲的 SM 去执行 grid: 是 CUDA 编程模型中最高层级的线程组织结构,它代表了一次 Kernel 启动所创建的所有线程的集合。你可以把它理解为整个并行计算任务的“总指挥部”或“任务总表”。 block: 软件层面的任务分组,它是线程协作的基本单位。同一个 Block 里的线程可以互相通信(通过共享内存 SMEM),也可以通过 __syncthreads() 进行同步。 **warp:**GP
OpenAnolis小助手2 个月前
开源·龙蜥社区·ai infra·t-head sail
龙蜥 AI Infra 新力量:T-Head SAIL 软件栈正式开源7月18日,平头哥自研软件栈 T-Head SAIL® 正式开源,向全球开发者开放高效、开放的 AI 算力基础设施核心能力。
颜笑晏晏3 个月前
缓存·推理优化·sglang·ai infra·pd分离
长输入短输出场景下的 SGLang 推理性能实测前缀缓存、PD 分离配比与参数调优我们产线上的推理请求,几乎是清一色的"长输入、短输出":几万 token 的资料或上下文喂进去,模型只吐回几百 token 的答案。RAG、长文档问答、代码库分析,本质上都是这个形状。
程序喵大人4 个月前
c++·人工智能·学习·ai infra
C++ 程序员转型 AI Infra 学习路线博主介绍:程序喵大人小喵是个五年经验的 C++ 工程师,最近面了某大厂的 AI Infra 岗位。他以为自己熟练完成的是“会写 CUDA”,于是买了一堆 GPU 架构、算子优化的书,结果面试官问了三个问题,他全答不上来:
ifenxi爱分析4 个月前
saas·智能体·ai infra
Know-how很快被AI追平,真正的壁垒没多少了在大模型、智能体与AI Coding驱动的企业软件新世界里,旧的竞争壁垒正在迅速消融。专业知识与Knowhow正在被AI重新定义,智能体应用被分钟级生成,传统企业服务厂商的核心价值正面临大考。
百度智能云技术站4 个月前
ai infra
Agent 时代下大模型推理系统的架构优化和工程实践本文整理自 2026 年 5 月 14 日 Create2026 百度 AI 开发者大会 - AI Infra 专题论坛,百度智能云主任架构师黎世勇的同名主题演讲。
百度智能云技术站4 个月前
具身智能·百度百舸·ai infra
百度百舸全栈 AI Infra 助力具身模型加速迭代本文整理自 2026 年 5 月 14 日 Create2026 百度 AI 开发者大会 - 具身智能专场,百度智能云主任架构师应茹的同名主题演讲。