vllm

政企项目老覃2 小时前
人工智能·程序人生·算法·性能优化·vllm
边缘 AI 推理部署:安防零售场景下的模型裁剪与端侧落地实践2025 年初,我们团队接手了某连锁零售集团(全国 3800 家门店)的智能安防升级项目。业务方提出两个硬指标:门店内人员聚集、跌倒、烟火等异常事件,从发生到云端告警的端到端延迟必须小于 3 秒;同时,单店边缘设备的硬件采购成本要控制在 2500 元以内。
赋创小助手7 小时前
服务器·人工智能·大模型·qwen·vllm·sglang·context长度
Qwen3.8-27B 本地推理 Benchmark 解析:llama.cpp、vLLM、SGLang 与长 Context 的性能差异本文基于一组 Qwen3.8-27B 多平台公开基准测试,重点讨论 Benchmark 方法、推理引擎、Context、MTP、TTFT / Prefill / Decode 的技术关系。不同平台的量化和运行配方并不完全一致,因此本文不把结果当作严格的硬件排名。
论文复现现场10 小时前
llama·qwen·vllm·大模型推理·大模型部署·rtx4090
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型直接答案:70B/72B 模型用 2 张 RTX 4090 只能主打 4-bit、低并发推理;4 张是量化部署的均衡配置;8 张可以考虑 BF16 或双副本吞吐,但性能不会随卡数线性增长。
鬓戈3 天前
人工智能·性能优化·vllm
Qwen3.8-27B + vLLM 性能优化单卡 RTX PRO 6000 Blackwell(96GB)部署 Qwen3.8-27B 编程助手服务,262K 上下文、不牺牲推理效果的前提下,把稳态生成吞吐从 ~27 tok/s 提升到 80~105 tok/s(约 3~4 倍) 的完整记录。
昇腾知识体系3 天前
人工智能·华为·知识图谱·vllm
vLLM-Ascend 支持矩阵:supported_models 模型列表、BF16/ACLGraph 支持项核对方法一句话让Agent变成昇腾专家,不必再找人问了。评测入口: (To Agent)请按这个开源仓接入昇腾图谱 https://gitcode.com/agent0/kg-tools
Είναι η κοπέλα4 天前
macos·llama·vllm
本地大模型部署完全指南:Ollama / vLLM / llama.cpp / MLX 四大引擎横评与选型实战数据说明:本文的安装命令、特性、硬件支持全部来自各项目官方 README(2026 年 9 月版本),关键论断标注了出处。不写没验证过的性能数字。 适合谁:想在自己机器或公司服务器上跑开源模型,但被 Ollama、llama.cpp、vLLM、MLX 这些名词绕晕的人。
零依赖极客5 天前
c语言·开发语言·人工智能·矩阵·arm·vllm
Day 6·1 ARMv8.2 dotprod——vdotq_s32 一条指令做 4 个点积一句话导读:ARMv8.2 dotprod(vdotq_s32)单指令四点积:对照标量 C 与拓宽 mla 的板端微基准,讲清微基准会骗人——vdot 的收益要在 8x8/4x4 大内核的寄存器压力下兑现。
Albart5755 天前
大模型·llm·vllm·大模型推理·幻觉·重复输出
大模型无限循环输出、重复生成文本:参数层面规避幻觉输出实战摘要:面向大模型应用开发者的排障实战指南。全文以"现象 → 根因 → 参数 → 实战 → 方法论"为主线,系统讲解 12 个采样参数的作用机制、典型取值与风险,给出"复读机、无限死循环、幻觉编造"三大高频问题的可落地处方,并附 OpenAI、HuggingFace、vLLM 三套可直接复用的代码与 6 大平台的参数命名对照表。
早睡早起身体好1236 天前
android·人工智能·神经网络·机器学习·自然语言处理·vllm
用 XGrammar 约束大模型工具调用:解决参数为空的问题工具调用成功了,为什么 arguments 仍然可能是空对象?这篇文章记录一个多智能体系统中的真实问题,以及如何使用 tool_choice、严格 JSON Schema 和 XGrammar 提高工具调用的可靠性。
basketball6169 天前
android·人工智能·vllm·ai infra
AI Infra 推理部署技术总结:2. vLLM 内核——PagedAttention 与调度器原理系列第二篇。上一篇(第一部分)介绍了 vLLM 的定位、特点、用法与常见类;本篇深入引擎内部,拆解让 vLLM 快起来的两个核心机制: PagedAttention(KV Cache 的分页内存管理) 与 调度器(Scheduler,连续批处理的决策中枢)。 读完你会理解:显存是怎么被"榨干"的,以及"GPU 每一步算谁"这件事是怎么被决定的。
CV-杨帆11 天前
运维·服务器·vllm
在自己的服务器上搭建VLLM 以Qwen3.5-0.8B与Qwen3.5-4B为模型基础总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894
Zguigo12 天前
深度学习·vllm
Coding Agent 上下文压缩:从 Claude Code / Codex / Pi 到自研策略关于上下文压缩,它已经是 Coding Agent 最核心的技术之一 。你如果以后想自己实现一个类似 Claude Code / Codex 的 Agent, 上下文压缩(Context Compaction)基本是必须掌握的机制 。今天我来讲解一下如何进行上下文压缩。实现我们看看现在主流的agent是怎么压缩上下文的。
DevOps老兵14 天前
人工智能·kubernetes·helm·vllm·大模型推理·ai infra
AI Infra实战05:用Helm在K8s中部署vLLM,从安装到压测全流程本篇配套的全部脚本、YAML、Helm Chart、预检工具和 Terraform 配置已开源在 GitHub:https://github.com/Jich1123/gpu-k8s-lab 。clone 下来按 00-lab/execution-checklist.md 的顺序执行即可复现全部实验(仓库不含任何真实 IP、密钥或账号信息)。
方方洛15 天前
人工智能·算法·vllm
vllm教程-02-核心原理仓库地址:https://github.com/hhk-png/cycle-agent本章目标:深入拆解 vLLM 高性能背后的每一个关键机制。每个概念都按 为什么(motivation)→ 怎么做(mechanism)→ 具体例子 展开。
苏子寒17 天前
笔记·机器学习·ai·nlp·vllm
Nano-VLLM全代码解析笔记(10)-GemmaRMSNorm和MRoPE本节参考资料:VLLM源码Transformers源码(49 封私信) Qwen3.5 架构最全拆解:Linear Attention 源码配图解析、Gated DeltaRule 公式源码逻辑介绍、Full Attention与 MoE 模块算子流程解析 - 知乎
缘友一世18 天前
vllm·glm5.3 nvfp4·sm80
GLM-5.3-NVFP4 部署实战系列[八]启动加速:编译缓存挂载与 CUDA 图捕获裁剪,首启 8 分钟 → 3 分钟先看启动耗时的构成(页缓存热,87 分片加载仅 ~9s):两个细节:排查编译崩溃期间我们用过 mode=none + cudagraph_mode=FULL,最终配置是默认编译 + piecewise 图。两者值得辨析: