技术栈
vllm
一个王同学
2 天前
人工智能
·
深度学习
·
计算机视觉
·
ocr
·
vllm
从零到一 | CV转多模态大模型 | week21 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(一)
最后四周,我们一起实战一个基于 OCR 与 Qwen-VL 的文档多模态问答系统。给这个系统起个名字叫 DocuMind-VL。
初级炼丹师(爱说实话版)
2 天前
docker
·
容器
·
vllm
Ubuntu24.04 Docker+vLLM+qianwen2.5-coder-32B部署文档
硬件配置硬件前置提醒:标准 RTX 4090 单卡 24GB,双卡总显存 48GB,无法运行 FP16 全精度 32B 模型(权重约 64GB),必须使用 AWQ 4bit 量化版;如果你的显卡是单卡 48GB 专业卡(总 96GB),可使用 FP16 完整版。下面两套方案分别给出。
江畔柳前堤
2 天前
人工智能
·
yolo
·
目标检测
·
计算机视觉
·
unity
·
面试
·
vllm
YOLO 目标检测全流程深度剖析
核心信条:在目标检测工程中,数据集决定了性能的理论天花板,模型架构与训练策略决定了你能逼近这个天花板的程度。本文不讲"怎么跑通代码",而是从信息流、误差源、决策逻辑三个维度,深挖从数据到部署每个环节中真正决定成败的隐性知识。
circuitsosk
2 天前
python
·
云原生
·
agent
·
vllm
·
推理加速
·
大模型部署
·
ensorrt-llm
不止于API调用:大模型推理加速与云原生服务化部署指南
训练一个效果好、能力强的模型,在今天已经不再是最大的门槛。真正考验工程能力的,是把这个动辄几十GB、甚至上百GB的“巨兽”,在保障生成质量的前提下,用尽可能低的延迟和成本,稳定地服务成千上万的用户。
华科大胡子
3 天前
vllm
vLLM 与 SGLang 推理框架性能横评:架构、吞吐与延迟的深度剖析
随着大语言模型(LLM)应用规模的爆发,推理服务的性能、成本与易用性成为核心瓶颈。vLLM 与 SGLang 作为当前备受瞩目的两款开源推理框架,分别从吞吐优化与延迟优化切入,代表了两种不同的技术路线。本文将深入对比两者的架构设计、核心特性、性能表现及适用场景,为开发者选型提供决策依据。
撞强
3 天前
diffusers
·
vllm
·
llama.cpp
·
amm
·
6000d
AMM:一套支持 llama.cpp / vLLM / Diffusers 的 AI 模型统一调度平台
背景:中小企业内部,20万以内成本,搭建全套算力业务平台。 测试:Unraid+NV RTX 6000D+AMD 7543*2+256G DDR4 AI:积算MaaS平台
谢白羽
3 天前
分布式
·
架构
·
llm
·
vllm
·
sglang
SGLang源码剖析-2-sglang双层体系架构全景
SGLang 与 vLLM、TensorRT-LLM 等推理框架的核心差异在于:SGLang 不只提供高性能 serving engine,还提供面向 LLM 应用编排的前端语言层。它既能作为后端推理引擎使用,也能通过前端语言表达多轮、多分支、结构化的 LLM 交互程序。
19H
3 天前
vllm
【vLLM 源码解析】BeamSearch
Beam Search(束搜索)是一种在序列生成任务中常用的搜索算法,用于在每一步生成时平衡计算效率和结果质量文字。
circuitsosk
3 天前
python
·
机器学习
·
搜索引擎
·
ab测试
·
vllm
·
rag检索
平台整体能力与功能特性设计:分群、联运、ABTest与运营位系统
在互联网产品进入存量竞争的时代,平台的整体能力决定了产品能否快速响应业务需求、能否精细化运营用户、能否持续迭代增长。一个功能完备的平台底座,不仅需要支撑核心业务流程,更需要提供用户分群、跨平台联运、A/B测试、运营位管理等横向能力。
shxjnpl
5 天前
人工智能
·
pytorch
·
vllm
Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录
在 Qwen3-ASR 接入会议系统的早期阶段,熙瑾会悟采用的是相对直接的 PyTorch 路径:通过 Qwen3ASRModel.from_pretrained() 加载模型,收到音频文件后调用 model.transcribe(),再把识别结果返回给上层业务。
SLD_Allen
5 天前
架构
·
vllm
·
sglang
大模型推理引擎架构深度解析:vLLM、SGLang与TensorRT-LLM的技术路线对决
标签:AI-INFRA / 推理优化 日期:2026-08-03 阅读约 12 分钟2026年,大模型从"能用"迈入"好用"的阶段,推理引擎的竞争格局已趋于清晰。vLLM、SGLang和TensorRT-LLM三足鼎立,各自占据了不同的生态位。对AI工程师而言,选择哪个推理框架直接决定了服务的延迟、吞吐量和运营成本。本文将从底层架构原理出发,深度拆解三大框架的技术路线差异,并结合实际部署场景给出选型指南。
SunnyRivers
7 天前
vllm
·
内存调优
vllm内存优化技巧
大型模型可能会导致服务器内存不足 (OOM)。以下是一些有助于缓解此问题的配置参数。张量并行 (tensor_parallel_size 选项) 可用于将模型拆分到多个 GPU 上。
奔跑中的小象
9 天前
grafana
·
prometheus
·
uos
·
vllm
·
沐曦
UOS V2500 沐曦mx-exporter监控加速卡(非K8S)
请参考:UOS V2500 沐曦驱动安装手册mx-exporter 参数说明(wheel包安装)执行以下命令启动mx-exporter,监听端口为8002,收集指标间隔为5s:
陈 洪 伟
9 天前
bug
·
mlp
·
vllm
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
目录1 bug 背景2 SwiGLU解释3 原来的MLP流程3.1 输入3.2 第 1 步:gate_up_proj
花无缺pize
9 天前
服务器
·
人工智能
·
vllm
vLLM框架:LLM推理的高效机制
Briwisdom
10 天前
gemm
·
vllm
·
moe
·
decode
·
prefill
MoE 推理优化实战——从“瓶颈罗列“到“性能调优“
副标题: #20 篇拆解了 MoE 部署的五大瓶颈,这篇给出对应的解法——Expert Parallelism 怎么配、Grouped GEMM 为什么比 for-loop 快 10 倍、路由怎么调丝滑、推测解码如何掩盖 MoE decode 的劣势。从理论到实践的完整拼图。
Briwisdom
11 天前
tensorrt
·
vllm
·
推理引擎
·
sglang
LLM 推理引擎三强争霸——vLLM vs SGLang vs TensorRT-LLM
副标题: 2026 年的 LLM 推理引擎格局已经清晰——vLLM 是生产部署的事实标准,SGLang 在 Agent 和结构化输出场景独占鳌头,TensorRT-LLM 是 NVIDIA 硬件上的性能天花板。本文从架构哲学、调度策略、KV Cache 管理、编译优化到实测性能,做一次三强全面对比。
西柚小萌新
11 天前
vllm
【大模型:部署】--使用VLLM架构部署本地大模型
在本地或私有云部署大语言模型(LLM)时,我们常面临一个痛点:显存占用高、推理吞吐低。传统的 HuggingFace Transformers 推理速度较慢,而 TensorRT-LLM 等方案虽然快但环境配置极其复杂。
白驹_过隙
12 天前
人工智能
·
ocr
·
vllm
【大模型OCR落地终极排坑:OvisOCR2+vLLM从报错到批量稳定部署全过程】
最近在服务器部署OvisOCR2超强图文OCR模型,原本以为是简单的模型推理部署,结果接连踩遍 vLLM 新版本引擎、FlashInfer编译、多模态解析、Python多进程兼容等全套坑点。
一个王同学
14 天前
人工智能
·
深度学习
·
计算机视觉
·
fastapi
·
改行学it
·
vllm
从零到一 | CV转多模态大模型 | week19 | 基于 FastAPI 和 vLLM 的多模态大模型部署
第十九周了,这周在第 18 周 week18_minillava_hf_vllm 的 vLLM OpenAI-compatible 服务之上,封装一个端到端多模态 HTTP 服务。