gpu

众人皆醒我独醉1 天前
面试·kubernetes·gpu
InferenceGraph:把多个推理服务编排成 DAGKServe 源码拆解系列 · 第 9 篇前 8 篇你一直在看"一个服务":一个 InferenceService 怎么声明、调和、扩缩容,第 8 篇还讲了单服务内多模型。但真实推理往往是多个服务接力:预处理模型 → 主模型 → 后处理模型。谁决定请求在服务之间怎么流转?KServe 的答案是 InferenceGraph——把编排本身声明成一个 CRD。本篇拆它的 API、调和和两套实现,下一篇看面向 LLM 的 LLMService。
众人皆醒我独醉1 天前
面试·kubernetes·gpu
LLMService:KServe 面向 LLM 的下一步KServe 源码拆解系列 · 第 10 篇第 9 篇拆了 InferenceGraph——把多个推理服务编排成 DAG。可那套世界观是 2019 年定下的:三组件、Istio 分流、按请求数扩缩容。当你部署的不是 sklearn 模型,而是一个 70B 的 vLLM 时,这套抽象哪里漏水?社区的答案是新 CRD LLMInferenceService(口语叫 LLMService)。收官篇拆它,也沉淀这 10 篇的读法。
众人皆醒我独醉4 天前
面试·kubernetes·gpu
模型加载:storage-initializer 与节点级缓存KServe 源码拆解系列 · 第 5 篇第 4 篇建好了 Deployment、挂好了 volume——但 /mnt/models 是空的。140GB 权重谁搬进去的?Pod 重启、扩缩容要重搬吗?
进哥AI研习社4 天前
性能优化·webgl·gpu·canvas·shader·帧率·视频背景
WebGL 与视频背景——首屏视觉层的性能博弈在物质世界做减法,在精神家园做加法。 摆脱对物品、浮华和过度消费的执着,追求简约、清爽与自由,避免被物所役。不断丰富知识、智慧、情感、体验与创造力,让内心世界日益广阔、深邃和坚韧。身外之物越简,心内宇宙越丰。
众人皆醒我独醉5 天前
面试·llm·gpu
调和循环:kubectl apply 之后发生了什么KServe 源码拆解系列 · 第 3 篇第 2 篇里,predictor、transformer、explainer 安静地躺在一个 YAML 里。可你 kubectl apply 一按回车,这几百行配置就要在几秒内变成 Deployment、Service、VirtualService——谁在动手?顺序是什么?中途失败怎么办?本篇跟一次完整的调和循环:起点是 pkg/controller/v1beta1/inferenceservice/controller.go 的 Reconcile(),spec
众人皆醒我独醉5 天前
面试·llm·gpu
从 Spec 到资源:Predictor/Transformer/Explainer 如何变成 DeploymentKServe 源码拆解系列 · 第 4 篇第 3 篇走完了调和循环主流程:事件进来,控制器按 spec 组装 reconciler 链,逐个组件调和。但"调和一个组件"这一步里发生了什么?你的 YAML 只有几行 predictor:、transformer:,集群里却长出了 Deployment、Service、探针、资源配额。意图声明(Spec)和集群现实(资源)之间的这段距离,就是本篇要拆的:组件构建器。结尾留下线头——模型怎么进 Pod——交给第 5 篇。
众人皆醒我独醉9 天前
面试·云计算·gpu
源码导读:一张地图看懂 KServe 仓库KServe 源码拆解系列 · 第 1 篇概述文讲的是 KServe"能干什么":一个 InferenceService YAML apply 下去,Deployment、Service、流量、扩缩容全自动搞定。但 apply 之后那几秒:谁读到了你的 YAML?谁决定建几个 Pod?谁把 vLLM 参数填进容器启动命令?——本系列拆"内部怎么干",共 10 篇:
众人皆醒我独醉10 天前
面试·llm·gpu
MLOps 流水线:从训练到推理的 CI/CDAI 加速器系列 · 第 8 篇软件部署错了回滚一个二进制就行。模型部署错了——精度下降 3%,错误率翻倍——你不知道问题出在数据、训练代码、还是模型本身。MLOps 管的不是一个 artifact,是三个。
Flynt10 天前
ai编程·gpu·ollama
本地跑大模型到底选哪个?我用llmfit把32000星的项目实测了一遍上周五晚上心血来潮想跑一下Qwen3.8-27B。Ollama装好,模型拉下来,选了Q5_K_M量化——加载到62%终端直接甩了个CUDA OOM。 当时是真的烦。文件下了快20分钟,结果加载一半炸了。 冷静下来算了一下:27B参数Q5量化,光模型权重就16GB多,加上KV cache预分配,24GB的3090确实不够用。降到Q4_K_M能塞进去,但速度只有7-8 token/s,打一行字的时间它能给你想出半分钟。
styshoo11 天前
kubernetes·gpu·ai infra·nvsentinel
[NVSentinel] metadata-collector模块调研基于 NVSentinel 文档与 metadata-collector/ 代码的实现分析。文档引用指向 NVIDIA/NVSentinel main 分支。
众人皆醒我独醉12 天前
面试·llm·gpu
AI 工作负载可观测性:DCGM + Prometheus + GrafanaAI 加速器系列 · 第 7 篇GPU 利用率 100%!一切看起来很好。直到你发现 Tensor Core 使用率只有 15%,80% 的时间 GPU 在等 CPU 喂数据和 AllReduce 通信。"GPU 利用率"是 AI 基础设施里最大的谎言。
众人皆醒我独醉12 天前
面试·ansible·gpu
GPU 集群 IaC:Terraform + Ansible 部署自动化AI 加速器系列 · 第 6 篇100 台 GPU 服务器到货。每台要装驱动、CUDA、Container Runtime、GPU Operator、配置 NCCL 环境变量。手动来?一台 30 分钟,100 台 = 一周。核心思想:正确的事情做一次,用代码重复 100 遍。
Smoothcloud_润云12 天前
llm·agent·gpu
从“模型服务”到“Agent 调度”:AI 推理基础设施为什么正在重构?2026 年,AI 应用正在从“问一句、答一句”,快速进入 Agent 时代。过去,大模型推理服务的目标很明确:
Eloudy14 天前
前端·javascript·人工智能·react.js·agent·gpu
ReAct 原理简介Reasoning + Acting:让大模型会思考、会行动ReAct = Reasoning(推理) + Acting(行动)
程序员老陆15 天前
音视频·gpu·opengl
OpenGL 在视频渲染里的角色:它到底加速了什么?目录一、OpenGL 是什么二、OpenGL 核心能干哪些事三、为什么 OpenGL 能“加速”视频渲染
众人皆醒我独醉15 天前
后端·面试·gpu
训练加速实战:Flash Attention、Gradient Checkpointing 与数据流水线AI 加速器系列 · 第 3 篇前面两篇解决了"显存不够"和"多卡通信"的问题。但这还不够快——真正的性能杀手藏在 Attention 计算和 I/O 里。
简单同学16 天前
系统架构·gpu
深入 NVIDIA GPU:CSDN 专栏发布索引## 第一篇:GPU 的诞生与发展01 GPU 是如何诞生的02 从固定功能流水线到可编程着色器03 统一着色器架构的诞生
众人皆醒我独醉16 天前
后端·面试·gpu
大模型训练优化:FSDP、DeepSpeed ZeRO 与混合精度AI 加速器系列 · 第 2 篇7B 模型用 Adam 训练,光优化器状态就要 112GB 显存。A100 80GB?对不起,连门都进不去。
Eloudy17 天前
gpu
nvCOMP 从开源到闭源的分水岭 2.2.0与基本原理概述准确来说,nvCOMP 曾经开源,但从 2.3 版本开始,它已经转为闭源库了。 2.2.0 还是开源的。
小林ixn18 天前
javascript·llm·gpu
WebGPU + Transformers.js:把 DeepSeek-R1 塞进浏览器,真香!谁说前端只能写页面?当浏览器遇上 GPU 加速,1.5B 参数的大模型也能在你电脑上流畅推理,而且全程数据不出设备。这篇实战笔记带你从零搭建一个纯浏览器端的 DeepSeek-R1 对话应用。