vllm

缘友一世3 小时前
vllm·模型推理部署·a800·glm5.3 flash
GLM-5.3-Flash 在 8×A800 (sm_80) 上跑通(一):项目介绍与方案选型首发CSDN · 技术连载第 1 篇(共 3 篇) 配套开源项目:GLM-5.3-Flash on 8×A800 (sm_80) 部署套件
auto_go4 小时前
vllm·sglang
大模型实战指南(11)——推理框架选型实战:vLLM × SGLang × TensorRT-LLM 深度对比与部署指南这是《大模型实战指南》系列第十一篇。前十篇我们从 Token、上下文窗口、温度采样、Embedding、Harness、微调、推理优化、RAG、Agent 一路拆到多模态,把大模型从“会打字的魔法盒子”拆成了一套可操控的工程系统。这一篇解决所有工程师都会遇到的那道坎:模型选好了、甚至微调好了,怎么把它部署成高并发、低延迟、能扛住真实流量的线上服务?
wen_zhufeng1 天前
android·vllm
用 vLLM 加速 TTS 推理:通用改造指南面向工程师的方法论文档:假设一个 LLM-based TTS 项目目前只有原生 HuggingFace 推理,如何一步步改造出 vLLM 加速版。 全文以 Confucius4-TTS 仓库为参照样本(原生版 confuciustts/cli/inference.py,加速版 confuciustts/cli/inference_vllm.py),但方法与任意「LLM 自回归生成离散 token」的 TTS 项目通用(CosyVoice、VoxCPM、Qwen3-TTS、IndexTTS 等同构项目均可套
一休哥※1 天前
vllm
# 接入 vLLM 的 qwen3.8 模型:WorkBuddy 自定义模型配置教程、踩坑记录与心路历程适用场景:把自建 / 第三方 OpenAI 兼容推理服务(vLLM、Ollama、LM Studio、云端推理 API 等)接入 WorkBuddy 作为「自定义模型」使用。 本文所有服务器地址、端口、密钥、容器名、路径均为占位符,请按实际环境替换;不涉密。
thesky1234561 天前
大模型·vllm·flashattention·推理引擎·pagedattention·连续批处理·显存管理
27届大模型面试准备(五十九):大模型推理引擎内核深度剖析——PagedAttention、调度器与显存管理前面(二十五)讲推理服务化与投机解码、(五十三)讲多模态服务化、(五十四)讲成本与吞吐调优,都偏「架构与成本」。本篇往内核里再钻一层:一个推理引擎(vLLM、TensorRT-LLM、SGLang 之类)到底怎么把一次请求变成显存里的 KV Cache、怎么调度 token、怎么不浪费显存。这是面试「部署优化」这条线的硬核题,也是华为多模态 LLM 岗现场写代码/画架构高频考点。
谢白羽1 天前
笔记·llm·论文·agent·vllm·大模型部署·sglang
SGLang模型加载过程笔记1.如果dp_size大于1 PP = 2 TP = 2 DP = 1因此会创建:2.如果dp_size大于1 DP Controller 根据轮询、当前请求数或 Token 数,把每个请求交给负载较低的模型副本。
zhangfeng11332 天前
人工智能·docker·ai编程·qwen·算子开发·vllm·mi50
AMD Instinct MI50(gfx906)上为 Qwen 系列模型优化并可用的 vLLM 相关仓库、Docker 镜像与实践指南。直接结论关键资源(推荐先看)ROCm / PyTorch / 兼容性要点性能与注意事项快速示例命令(用于验证与启动)
缘友一世2 天前
开源项目·vllm·大模型部署·项目复盘·a800·minimax-m3
MiniMax-M3 on A800:部署、Bug 修复与压测完整复盘参考链接:环境变量:系列文章:
缘友一世3 天前
vllm·大模型部署·a800·glm5.2 nvfp4
GLM-5.2-NVFP4 在 8×A800 上部署实战(下)上篇讲了为什么 A800 跑不了 GLM-5.2,以及如何打补丁、修 API 漂移。本篇进入实操:构建镜像、启动、验证、踩坑和性能数据。 配套开源仓库:glm52-nvfp4-a800-vllm-deploy(Gitee)。
缘友一世3 天前
vllm·大模型部署·a800·glm5.2 nvfp4
GLM-5.2-NVFP4 在 8×A800 上部署实战(上)背景:把官方主打 Blackwell(B200/B300)的 GLM-5.2-NVFP4 模型,硬塞到 8 张中国特供版 A800(sm80)上,实测单流 74–85 tok/s,4 并发 × 32k 上下文可跑通。
苏子寒3 天前
人工智能·笔记·python·机器学习·nlp·vllm
Nano-VLLM全代码解析笔记(2)-block_manager[1]Nano-VLLM全代码解析笔记(1)-sequence[2]Nano-VLLM全代码解析笔记(2)-block_manager
苏子寒4 天前
笔记·python·深度学习·ai·性能优化·vllm
Nano-VLLM全代码解析笔记(8)-qwen3与qwen3_moe相较于之前的模型实现,Qwen3-30B-A3B在模型架构上的主要变化是对MLP层进行了修改,增加了专家路由。MOE修改参考了GitHub - gogongxt/nano-vllm: Nano vLLM · GitHub
Albart5754 天前
大模型·vllm·张量并行·分布式推理·多卡部署·显存oom
多卡张量并行显存分配不均终极解决:单卡跑满、其余显卡闲置彻底根治📌 置顶导语:做过大模型多卡分布式部署的开发者,几乎都遇到过张量并行(TP)负载倾斜问题:开启多卡TP推理/训练后,GPU0显存、算力直接拉满100%,其余显卡长期低负载闲置,多卡并行不仅无法提速,反而出现吞吐下降、延迟升高、随机OOM等问题。本文深度拆解TP显存分配不均的底层核心原理,梳理全套可直接复制落地的排查命令、主流框架优化方案、实战避坑指南,一站式根治多卡负载倾斜问题,完美适配vLLM、DeepSpeed、Transformers、Accelerate等主流大模型部署框架,可直接落地生产环境。
谢白羽5 天前
llm·agent·tts·vllm·大模型部署
vLLM-Omni 部署 IndexTTS 2.51.第一阶段:autoregressive talker(自回归 Talker 模块) 输入文本,不直接生成音频,输出语义编码(semantic codes)。 语义编码是中间抽象表示:包含说话内容、韵律、停顿、音色信息,是离散 token 序列。
weixin_440213295 天前
vllm·大模型推理·decode·kv cache·prefill·llm 部署
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子在大模型落地部署、推理优化中,KV Cache、Prefill/Decode、TTFT/TPOT、GPU算子、vLLM 是一套高度关联的核心体系。本文将系统性地讲解大模型自回归推理的核心原理、推理阶段特性、性能瓶颈与工程优化方案,梳理完整的底层落地逻辑。
苏子寒5 天前
pytorch·笔记·python·机器学习·ai·nlp·vllm
Nano-VLLM全代码解析笔记(6)-embed_head和linear一些问题:[系列(1) 开篇](https://blog.csdn.net/xxx/article/details/xxxxxx) [系列(2) 核心原理](https://blog.csdn.net/xxx/article/details/xxxxxx) 🔗上一篇:[系列(1)开篇](https://blog.csdn.net/xxx/article/details/xxxxxx) 🔗下一篇:[系列(3)实战演练](https://blog.csdn.net/xxx/article/details/
Web3&Basketball6 天前
人工智能·深度学习·大模型·ai技术·vllm
vLLM部署开源大模型实战:显存、命令与成本核算摘要:Kimi K3(2.8万亿参数)、千问3.8MAX(2.4万亿参数)密集开源,企业私有化部署的窗口正式打开。本文不讲概念,只讲落地:显存怎么算、vLLM怎么部署、API怎么无缝切换、成本怎么比。全文代码可直接复用。
ん贤7 天前
vllm
从一个 Token 到 vLLM:推理、量化、适配的理解学大模型量化时,很容易一上来就研究 AWQ、GPTQ,或者直接复制一段量化脚本。但真正开始做推理部署以后,会发现很多问题绕不过去:
随便做点啥7 天前
服务器·经验分享·docker·vllm
32卡×4090 24GB,Qwen3.8-27B-FP8 集群部署报告基于 4 台 8 卡 RTX 4090 服务器的 vLLM 推理集群(打开文档后,右键目录选择"更新域"可刷新页码)
进军的码农9 天前
vllm·deepseek·ai推理·大模型本地部署·联想工作站·thinkstation p4
DeepSeek-V4-Pro 正式版本地部署:联想 ThinkStation P4 硬件架构拆解与推理链路全验证一台 96GB 显存的工作站,能不能扛住 DeepSeek-V4-Pro 的本地推理?这篇文章从硬件架构到部署链路逐层拆解,把"参数能不能跑"和"跑起来好不好用"两件事分开讲清楚。