vllm

一个王同学2 天前
人工智能·深度学习·计算机视觉·ocr·vllm
从零到一 | CV转多模态大模型 | week21 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(一)最后四周,我们一起实战一个基于 OCR 与 Qwen-VL 的文档多模态问答系统。给这个系统起个名字叫 DocuMind-VL。
初级炼丹师(爱说实话版)2 天前
docker·容器·vllm
Ubuntu24.04 Docker+vLLM+qianwen2.5-coder-32B部署文档硬件配置硬件前置提醒:标准 RTX 4090 单卡 24GB,双卡总显存 48GB,无法运行 FP16 全精度 32B 模型(权重约 64GB),必须使用 AWQ 4bit 量化版;如果你的显卡是单卡 48GB 专业卡(总 96GB),可使用 FP16 完整版。下面两套方案分别给出。
江畔柳前堤2 天前
人工智能·yolo·目标检测·计算机视觉·unity·面试·vllm
YOLO 目标检测全流程深度剖析核心信条:在目标检测工程中,数据集决定了性能的理论天花板,模型架构与训练策略决定了你能逼近这个天花板的程度。本文不讲"怎么跑通代码",而是从信息流、误差源、决策逻辑三个维度,深挖从数据到部署每个环节中真正决定成败的隐性知识。
circuitsosk2 天前
python·云原生·agent·vllm·推理加速·大模型部署·ensorrt-llm
不止于API调用:大模型推理加速与云原生服务化部署指南训练一个效果好、能力强的模型,在今天已经不再是最大的门槛。真正考验工程能力的,是把这个动辄几十GB、甚至上百GB的“巨兽”,在保障生成质量的前提下,用尽可能低的延迟和成本,稳定地服务成千上万的用户。
华科大胡子3 天前
vllm
vLLM 与 SGLang 推理框架性能横评:架构、吞吐与延迟的深度剖析随着大语言模型(LLM)应用规模的爆发,推理服务的性能、成本与易用性成为核心瓶颈。vLLM 与 SGLang 作为当前备受瞩目的两款开源推理框架,分别从吞吐优化与延迟优化切入,代表了两种不同的技术路线。本文将深入对比两者的架构设计、核心特性、性能表现及适用场景,为开发者选型提供决策依据。
撞强3 天前
diffusers·vllm·llama.cpp·amm·6000d
AMM:一套支持 llama.cpp / vLLM / Diffusers 的 AI 模型统一调度平台背景:中小企业内部,20万以内成本,搭建全套算力业务平台。 测试:Unraid+NV RTX 6000D+AMD 7543*2+256G DDR4 AI:积算MaaS平台
谢白羽3 天前
分布式·架构·llm·vllm·sglang
SGLang源码剖析-2-sglang双层体系架构全景SGLang 与 vLLM、TensorRT-LLM 等推理框架的核心差异在于:SGLang 不只提供高性能 serving engine,还提供面向 LLM 应用编排的前端语言层。它既能作为后端推理引擎使用,也能通过前端语言表达多轮、多分支、结构化的 LLM 交互程序。
19H3 天前
vllm
【vLLM 源码解析】BeamSearchBeam Search(束搜索)是一种在序列生成任务中常用的搜索算法,用于在每一步生成时平衡计算效率和结果质量文字。
circuitsosk3 天前
python·机器学习·搜索引擎·ab测试·vllm·rag检索
平台整体能力与功能特性设计:分群、联运、ABTest与运营位系统在互联网产品进入存量竞争的时代,平台的整体能力决定了产品能否快速响应业务需求、能否精细化运营用户、能否持续迭代增长。一个功能完备的平台底座,不仅需要支撑核心业务流程,更需要提供用户分群、跨平台联运、A/B测试、运营位管理等横向能力。
shxjnpl5 天前
人工智能·pytorch·vllm
Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录在 Qwen3-ASR 接入会议系统的早期阶段,熙瑾会悟采用的是相对直接的 PyTorch 路径:通过 Qwen3ASRModel.from_pretrained() 加载模型,收到音频文件后调用 model.transcribe(),再把识别结果返回给上层业务。
SLD_Allen5 天前
架构·vllm·sglang
大模型推理引擎架构深度解析:vLLM、SGLang与TensorRT-LLM的技术路线对决标签:AI-INFRA / 推理优化 日期:2026-08-03 阅读约 12 分钟2026年,大模型从"能用"迈入"好用"的阶段,推理引擎的竞争格局已趋于清晰。vLLM、SGLang和TensorRT-LLM三足鼎立,各自占据了不同的生态位。对AI工程师而言,选择哪个推理框架直接决定了服务的延迟、吞吐量和运营成本。本文将从底层架构原理出发,深度拆解三大框架的技术路线差异,并结合实际部署场景给出选型指南。
SunnyRivers7 天前
vllm·内存调优
vllm内存优化技巧大型模型可能会导致服务器内存不足 (OOM)。以下是一些有助于缓解此问题的配置参数。张量并行 (tensor_parallel_size 选项) 可用于将模型拆分到多个 GPU 上。
奔跑中的小象9 天前
grafana·prometheus·uos·vllm·沐曦
UOS V2500 沐曦mx-exporter监控加速卡(非K8S)请参考:UOS V2500 沐曦驱动安装手册mx-exporter 参数说明(wheel包安装)执行以下命令启动mx-exporter,监听端口为8002,收集指标间隔为5s:
陈 洪 伟9 天前
bug·mlp·vllm
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题目录1 bug 背景2 SwiGLU解释3 原来的MLP流程3.1 输入3.2 第 1 步:gate_up_proj
花无缺pize9 天前
服务器·人工智能·vllm
vLLM框架:LLM推理的高效机制
Briwisdom10 天前
gemm·vllm·moe·decode·prefill
MoE 推理优化实战——从“瓶颈罗列“到“性能调优“副标题: #20 篇拆解了 MoE 部署的五大瓶颈,这篇给出对应的解法——Expert Parallelism 怎么配、Grouped GEMM 为什么比 for-loop 快 10 倍、路由怎么调丝滑、推测解码如何掩盖 MoE decode 的劣势。从理论到实践的完整拼图。
Briwisdom11 天前
tensorrt·vllm·推理引擎·sglang
LLM 推理引擎三强争霸——vLLM vs SGLang vs TensorRT-LLM副标题: 2026 年的 LLM 推理引擎格局已经清晰——vLLM 是生产部署的事实标准,SGLang 在 Agent 和结构化输出场景独占鳌头,TensorRT-LLM 是 NVIDIA 硬件上的性能天花板。本文从架构哲学、调度策略、KV Cache 管理、编译优化到实测性能,做一次三强全面对比。
西柚小萌新11 天前
vllm
【大模型:部署】--使用VLLM架构部署本地大模型在本地或私有云部署大语言模型(LLM)时,我们常面临一个痛点:显存占用高、推理吞吐低。传统的 HuggingFace Transformers 推理速度较慢,而 TensorRT-LLM 等方案虽然快但环境配置极其复杂。
白驹_过隙12 天前
人工智能·ocr·vllm
【大模型OCR落地终极排坑:OvisOCR2+vLLM从报错到批量稳定部署全过程】最近在服务器部署OvisOCR2超强图文OCR模型,原本以为是简单的模型推理部署,结果接连踩遍 vLLM 新版本引擎、FlashInfer编译、多模态解析、Python多进程兼容等全套坑点。
一个王同学14 天前
人工智能·深度学习·计算机视觉·fastapi·改行学it·vllm
从零到一 | CV转多模态大模型 | week19 | 基于 FastAPI 和 vLLM 的多模态大模型部署第十九周了,这周在第 18 周 week18_minillava_hf_vllm 的 vLLM OpenAI-compatible 服务之上,封装一个端到端多模态 HTTP 服务。