vllm

wen_zhufeng21 小时前
vllm
vLLM-Omni TTS 推理加速实战手册写给「懂 TTS 部署、听过 vLLM、但没用过 vLLM-Omni」的你。本文全程围绕语音合成(TTS)推理加速展开,视觉/图像/视频等能力只在必要时一笔带过。
Yunzenn2 天前
人工智能·笔记·深度学习·机器学习·transformer·集成学习·vllm
强化学习1-Liu2026_GFlowRL_精读笔记一句话:微软研究院把GFlowNet中那个"学不会又爱捣乱"的配分函数网络直接砍掉,用批次内蒙特卡洛估计替代,让分布匹配RL首次在235B MoE上稳定训练,顺便在14B规模就追平了o3-mini的做题水平。
寒冰碧海2 天前
docker·容器·vllm
大模型部署从0到1(三):单机多卡 vLLM 部署Qwen3.6实战|Docker Compose 一键启动系列回顾:前两篇我们完成了底层 GPU 环境搭建与模型文件下载。本篇进入核心部署环节,手把手带你用 vLLM + Docker Compose 实现单机多卡大模型推理服务,兼容 OpenAI 接口规范,自带健康检查与故障自愈,生产可用。
执笔论英雄3 天前
学习·vllm
【大模型推理 】 vllm kvconnet 学习这是一个非常深刻且专业的问题!既然前面吹了 @dataclass 那么多好处,为什么在这两个类(BlockIDsLoadStoreSpec 和 GPULoadStoreSpec)中,vLLM 的作者偏偏不用 @dataclass,而是大费周章地手写 __init__ 和 __repr__ 呢?
Briwisdom4 天前
模型部署·vllm·eagle·llama.cpp·prefill·speculative·decoding
Speculative Decoding:用小模型给大模型“打草稿“,推理加速 2-3×副标题: 大模型每生成一个 token 都要搬一次 KV Cache——瓶颈在搬数据,不在算。投机解码做的事就是:用更快的方式"猜"出几个 token 凑成一批,大模型一次验证,用"批处理"省掉重复搬运。
古城小栈4 天前
vllm
vLLM 从入门到精通:企业级线上部署设置全讲解如果你正在做大模型相关的开发或运维工作,vLLM 是一个绕不开的名字。简单来说,vLLM 是一个专为大语言模型推理优化的 高性能引擎,它的核心价值可以用一句话概括:让 GPU 干更多的活,花更少的钱。
Briwisdom5 天前
架构·vllm·sglang·pagedattention·radixattention
LLM 推理引擎架构:vLLM / SGLang 的核心设计副标题: PagedAttention 借用 OS 虚拟内存思想管理 KV Cache,Continuous Batching 让 GPU 不再等人,RadixAttention 进一步用前缀树实现"相同前缀不重算"——三层递进,拆解推理引擎的底层逻辑
陈 洪 伟6 天前
fabric·vllm
大模型推理引擎 vLLM(28):custom_all_reduce 单机/跨节点原理(IPC、Fabric、HSA)目录1 为什么有custom_all_reduce2 节点内的Custom AllReduce2.1 节点内的Custom AllReduce大体原理
一颗小树x8 天前
人工智能·llm·jetson·vllm
NVIDIA Jetson Thor 运行 LLM / VLM:模型全整理与 vLLM 实践🚀 核心问题: 120B 大模型能不能放到边缘端本地跑?VLM 能不能直接接入机器人、摄像头和现场设备?
一个王同学9 天前
人工智能·深度学习·算法·机器学习·计算机视觉·vllm
从零到一 | CV转多模态大模型 | week17 | LLM 推理优化 & vLLM 详解本周初识 vllm 框架,理解 vllm 的作用和基本原理,能够使用 vllm 部署语言模型服务,并通过代码实战,体会纯 transformer 推理和 vllm 推理的吞吐量区别。
换个昵称29 天前
笔记·学习·vllm
大模型学习8下-高性能推理引擎vLLM学习笔记1.1.1 LLM推理的挑战 LLM正加速从云端走向边缘与本地部署,背后的驱动力主要来自更低的推理延迟、更强的隐私保护,以及更可控的部署成本。与此同时,随着模型参数规模和上下文长度不断增长,传统推理方案的瓶颈也越来越明显:显存利用率低、GPU算力利用率低、并发能力不足,并且请求量一旦增加,响应延迟就会迅速恶化。
Token炼金师9 天前
人工智能·llm·llama·vllm·tensorrt-llm·sglang
引擎四强:vLLM、SGLang、TensorRT-LLM 与 llama.cpp —— 推理引擎选型对决推理引擎是大模型落地的核心基础设施。本文从 vLLM、SGLang、TensorRT-LLM、llama.cpp 四大主流引擎的架构原理、核心优化、性能对比、选型决策四个切口,给出源码级实现与企业级推理服务决策框架。
武子康10 天前
人工智能·ai·架构·llm·gpu·vllm·sglang
调查研究-224 Prefill 与 Decode 分离:高并发 LLM Serving 的下一层架构备注:版本矩阵全部基于 vLLM 官方文档、Anatomy of vLLM 博客(2025-09-05)、DistServe / Mooncake / Sarathi-Serve / EPD 等公开论文(arXiv + OSDI 2024 + FAST 2025)、vllm-project/vllm GitHub PR、SegmentFault / CSDN 公开拆解文章核查;⚠️ 条目为已披露的安全/版本相关问题,需要运维侧主动升级或缓解。
zhanghaofaowhrql11 天前
架构·vllm·sglang
vLLM 与 SGLang 推理框架性能横评:架构、吞吐与延迟的深度解析随着大语言模型(LLM)应用从探索走向落地,推理服务的性能、成本与易用性成为核心考量。vLLM 凭借其创新的 PagedAttention 技术,已成为高性能推理的事实标准之一。而 SGLang 作为后起之秀,提出了基于 RadixAttention 的运行时与编程语言一体化方案,旨在优化复杂提示词场景。本文将对这两个框架进行系统性横评,从架构设计、性能指标到适用场景,为开发者选型提供参考。
高级打杂工程师-伍六六12 天前
昇腾·npu·vllm·claude code
【昇腾】本地 27B 编程模型接入 Claude Code 实战:Qwopus3.6-27B-Coder 在 vLLM-Ascend 上的部署与踩坑四张 910B4 跑 27B 模型,接入 Claude Code,效果比预期要好——虽然慢Qwopus 是一个由社区开发者 Jack Rong 自费训练的开源模型系列,名字是 Qwen + Opus 的组合——用高质量推理轨迹对 Qwen 基座模型做微调,目标是在本地硬件上达到接近 Claude Opus 的推理和编程能力。
聪明的一休丶12 天前
python·架构·vllm
VLLM v0.24.0 版本深度解析:新引擎、新架构与大规模服务全家桶升级本次 v0.24.0 版本于 6 月 28 日发布,距 v0.23.0 仅隔 16 天。作为史上最大规模的单版本更新之一(包含 571 个提交、256 位贡献者),本次更新集齐了新模型、新引擎、新架构与新硬件,全面优化了跨硬件推理性能与大规模部署能力。
happyprince14 天前
vllm
21-vLLM 可观测性分析:Metrics & Monitoring定位:本文档是 vLLM 源码分析系列的收官之作,从设计模式与架构视角对前 20 个分模块文档进行归纳提升。旨在揭示 vLLM 代码库中蕴含的工程智慧,为理解其架构决策、扩展机制和性能优化策略提供系统性总结。
happyprince15 天前
vllm
15-vLLM 服务接口层(API Layer)源码分析定位:本文档分析 vLLM 的服务接口层(Service/API Layer),涵盖从 HTTP/gRPC 服务器入口、多协议 API 路由、CLI 命令到高级编程接口的完整链路。该层位于 Engine 层之上,负责将外部请求转化为引擎可处理的内部调用。
happyprince15 天前
vllm
13-vLLM 分布式计算分析定位:本文档深入分析 vLLM 分布式计算架构,涵盖并行策略、状态管理、通信原语、数据传输机制及高级弹性特性。
大模型推理15 天前
vllm
《Nano-vLLM 源码解读》第 24 篇 · 张量并行(四)多进程架构nano-vllm 用千行代码拆解 vLLM 核心,是读懂大模型推理最快的捷径。上一篇把张量并行的三种切法(weight、vocab、head)讲完了。但 TP 这几篇的代码都在单进程里模拟两卡——把 tp_size、tp_rank 当参数手动传进去。