vllm

缘友一世12 小时前
vllm·glm5.3 flash
GLM5.3 flash cybersec本地部署[0]:环境准备与首次启动由 nvidia-smi topo -m 确定的互联结构GPU0 ═══ GPU1(NVLink,NV8) GPU2 ═══ GPU3(NVLink,NV8)
DongQiShanRen2 天前
人工智能·深度学习·自然语言处理·集成学习·vllm
裁决台账双向互校(中):五向一致性链——②向解读与③向实现系列:《宪法即代码》第 31 篇(中)| 标签建议:AI编程、Rust、架构治理、CI、可追溯性接(上)篇:先解读上篇那段 map-root 代码——"任一断链即红"是怎么成立的;再补②向的"机器可读区"细节(台账怎么被人和机器共读);最后进入③向:五文件组 B2 判定的实现原文。
智码看视界2 天前
agent·vllm·moe·全模态·小米大模型·mimo-v2.6
开源大模型每日追踪:小米 MiMo-V2.6-Pro,登顶开放权重第一(超过 GLM-5.3 、Kimi K3)项目信息发布方小米大模型团队(Xiaomi MiMo Team)发布时间2026-09-21 HuggingFace 上权重;09-22 正式公告
零基础1233 天前
经验分享·python·语言模型·vllm
DeepSeek V4.1 Flash (Batch) 的性能测试与应用在开发过程中,我们常常面临一个两难选择:是追求极致的响应速度,还是等待更高质量的模型输出?特别是在构建实时交互应用、智能客服系统或需要高频调用的数据分析工具时,延迟往往直接决定了用户体验的上限。很多时候,业务场景并不需要模型具备深奥的推理能力去解复杂的数学题,而是要求它在毫秒级内给出准确、流畅的自然语言反馈。这种对“快”与“准”平衡点的渴求,推动了轻量级高性能模型的快速迭代。
梦帮科技4 天前
数据结构·人工智能·分布式·python·深度学习·算法·vllm
vLLM / TensorRT-LLM 极限推理:PagedAttention 细粒度物理页表管理与连续批处理(Continuous Batching)实战专栏名称:《QNL-36:从量子张量网络到端侧异构认知大模型全栈实战》 分卷归属:卷六·端侧编译器、极限推理加速与可证伪性测评(Volume VI: Edge Compilation, Extreme Inference & Falsifiable QC) 文档编号:QNL-36-VOL06-ART22 主笔专家:QNL-021 VLLM-PAGED(极限推理专家)· QNL-031 VRAM-GUARD(显存守卫架构师) 联署质检:QNL-008 DYNAMIC-GRAPH(动态计算图专家)· QNL-
可乐ea5 天前
ai智能体·vllm·kv缓存·大模型推理优化·分离式推理
vLLM 分离式推理实战指南:把 prefill 和 decode 拆开跑原文:vLLM Blog - 《Taking vLLM Apart: A Practical Guide to Disaggregated Serving》(https://vllm.ai/blog/2026-09-29-disaggregated-serving-guide)
小马9266 天前
vllm
【无标题】如果评选过去两年开发者最"分裂"的时刻,大概是在 AI 编程浪潮里:你敲着代码,旁边的同事用 RTX 4090 跑本地大模型,而你手里只有一台性能不俗的 M 系列 MacBook。不是说 Apple Silicon 不能跑模型,而是生态割裂——MLX 推理快但生态封闭,vLLM 功能全却只认 NVIDIA GPU。直到 vllm-metal 的出现,这条"Mac 与大模型高并发推理"之间的鸿沟,才第一次被真正填平。
智码看视界8 天前
开源·vllm·开源大模型·apache2.0·fp8量化·腾讯混元hy4·agent推理
开源大模型追踪:腾讯混元Hy4preview,FP8 770GB 落地企业私有化,Apache 2.0 无字段限制腾讯混元(Tencent Hy)在 2026 年 8 月 28 日正式发布并开源 Hy4 preview,这是从 Hy3(295B 总参 / 21B 激活 / 256K 上下文)迭代而来的新一代 MoE 旗舰模型预览版。
仙人掌_lz10 天前
人工智能·llm·llama·vllm·判别模型·jev
3090 上的部署两种基于Qwen3.5-4B 判别模型open jev:llama.cpp和 vLLM ,谁更快、谁更准2026 年 9 月,我把同一个 4B 模型用两种方式放到 RTX 3090 24GB 上,对外都走 OpenAI 兼容接口,做同一件事:读完一篇舆情,只回答一个字母。A 表示文中能看出具体毕业生和他的毕业院校,B 表示看不出来。
Είναι η κοπέλα10 天前
开源·vllm·sglang
开源推理引擎怎么选:vLLM、SGLang、Ollama、llama.cpp 的机制与部署部署大模型,第一个要做的选择不是"用哪个模型",是"用哪个推理引擎"。同一张卡、同一个模型,换个引擎,能扛的并发可能差好几倍——因为引擎决定了 KV Cache 怎么管、请求怎么排队。
程序员清风10 天前
开源·github·vllm
vLLM 实战:用 OpenAI 兼容接口部署本地大模型推理服务在企业内部部署大模型时,难点不只是把模型权重加载到 GPU,还包括吞吐、显存、并发、接口兼容、模型版本、安全暴露和故障恢复。vLLM 提供高性能大模型推理运行时,并可以通过 OpenAI 兼容接口对外提供聊天补全、文本补全和模型查询能力。
程序猿编码10 天前
开发语言·c++·深度学习·神经网络·推理·vllm
C++/CUDA 手写 LLM 推理引擎:拆解 vLLM 核心 PagedAttention 与连续批处理本工程是一套C++ + CUDA从零实现的轻量化大模型推理服务,对标vLLM核心设计思想,剥离工业级框架复杂封装,专门用于学习现代LLM推理底层原理。 整套工程由两大部分构成:完整推理服务源码 + 配套学习教程。模型选用Llama 3.2 1B Instruct,权重采用Safetensors格式存储,全部计算逻辑由手写CUDA Kernel结合cuBLAS完成。
谢白羽10 天前
llm·vllm·大模型部署·sglang
对比DP8+EP与TP8在DS MoE部署性能MoE的Transformer层执行路径如下: 上图是以DP8+EP部署模型的执行流程。一个token进入本地Attention层(完整att)计算后通过路由发送给激活专家所在卡(注意,未必在本地了)做GEMM,最后专家模块返回结果合并输出进入下一层。
可乐ea11 天前
vllm·llm应用开发·采样策略·llm水印·gumbelmax
vLLM 支持无失真文本水印了:Gumbel-max 是怎么混进采样管线的原文:vLLM Blog - Watermarking in vLLM(https://vllm.ai/blog/2026-09-24-watermarking-in-vllm)
陈 洪 伟17 天前
vllm
大模型推理引擎vLLM(39):CUDAGraph模式以及CUDAGraphWrapper和BreakableCUDAGraphWrapper问题整理目录1 PIECEWISE、FULL、FULL_AND_PIECEWISE、FULL_DECODE_ONLY区别
论文复现现场17 天前
模型量化·vllm·a100·大模型部署·int8·fp8·qwen3.8
A100 跑 Qwen3.8-27B,FP8 还是 INT8?显存、速度、精度与微调兼容性怎么选直接结论:在算家云 A100 SXM4 80GB 环境验证 Qwen3.8-27B 时,建议先用 BF16 建立基线,再重点测试 INT8 W8A8。FP8 在 A100 上通常只能走权重-only 兼容路径,不能直接套用 H100 的 FP8 性能结论。
Zhu75817 天前
docker·qwen·vllm
docker环境,vLLM 部署 Qwen3.8-27B内网测试环境,无法承诺在生产环境使用,仅供学习参考。全程操作无互联网。本仓库用于通过 Docker Compose 在 GPU 服务器上部署 Qwen3.8-27B(OpenAI 兼容接口),并对接 newapi 统一对外提供服务。
basketball61617 天前
python·fastapi·vllm·ai infra
Python FastAPI 介绍以及常用方法FastAPI 是一个高性能、工程化的 Python Web API 框架,基于标准 Python 类型提示开发,底层依赖 Starlette(ASGI 异步底层) 和 Pydantic(自动数据校验),原生支持自动生成交互式 API 文档,性能接近 Go/Node.js,是当前 Python 后端 RESTful API 开发的主流方案。
论文复现现场18 天前
模型量化·vllm·大模型推理·awq·算家云·rtx3090
RTX 3090 如何跑 13B 级大模型推理?4-bit AWQ、vLLM 部署与并发调优实战更新时间:2026 年 9 月 20 日 适用环境:Linux、NVIDIA RTX 3090 24GB、Docker、CUDA 驱动
一颗小树x19 天前
jetson·vllm·vlm·gpu内存清理
vLLM大模型推理:Jetson AGX Thor 的 GPU 共享内存清理实战适用设备:NVIDIA Jetson AGX Thor(T5000)实测通过,思路同样适用于 AGX Orin 等采用统一内存架构的 Jetson 设备。