技术栈
vllm
政企项目老覃
2 小时前
人工智能
·
程序人生
·
算法
·
性能优化
·
vllm
边缘 AI 推理部署:安防零售场景下的模型裁剪与端侧落地实践
2025 年初,我们团队接手了某连锁零售集团(全国 3800 家门店)的智能安防升级项目。业务方提出两个硬指标:门店内人员聚集、跌倒、烟火等异常事件,从发生到云端告警的端到端延迟必须小于 3 秒;同时,单店边缘设备的硬件采购成本要控制在 2500 元以内。
赋创小助手
7 小时前
服务器
·
人工智能
·
大模型
·
qwen
·
vllm
·
sglang
·
context长度
Qwen3.8-27B 本地推理 Benchmark 解析:llama.cpp、vLLM、SGLang 与长 Context 的性能差异
本文基于一组 Qwen3.8-27B 多平台公开基准测试,重点讨论 Benchmark 方法、推理引擎、Context、MTP、TTFT / Prefill / Decode 的技术关系。不同平台的量化和运行配方并不完全一致,因此本文不把结果当作严格的硬件排名。
论文复现现场
10 小时前
llama
·
qwen
·
vllm
·
大模型推理
·
大模型部署
·
rtx4090
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型
直接答案:70B/72B 模型用 2 张 RTX 4090 只能主打 4-bit、低并发推理;4 张是量化部署的均衡配置;8 张可以考虑 BF16 或双副本吞吐,但性能不会随卡数线性增长。
鬓戈
3 天前
人工智能
·
性能优化
·
vllm
Qwen3.8-27B + vLLM 性能优化
单卡 RTX PRO 6000 Blackwell(96GB)部署 Qwen3.8-27B 编程助手服务,262K 上下文、不牺牲推理效果的前提下,把稳态生成吞吐从 ~27 tok/s 提升到 80~105 tok/s(约 3~4 倍) 的完整记录。
昇腾知识体系
3 天前
人工智能
·
华为
·
知识图谱
·
vllm
vLLM-Ascend 支持矩阵:supported_models 模型列表、BF16/ACLGraph 支持项核对方法
一句话让Agent变成昇腾专家,不必再找人问了。评测入口: (To Agent)请按这个开源仓接入昇腾图谱 https://gitcode.com/agent0/kg-tools
Είναι η κοπέλα
4 天前
macos
·
llama
·
vllm
本地大模型部署完全指南:Ollama / vLLM / llama.cpp / MLX 四大引擎横评与选型实战
数据说明:本文的安装命令、特性、硬件支持全部来自各项目官方 README(2026 年 9 月版本),关键论断标注了出处。不写没验证过的性能数字。 适合谁:想在自己机器或公司服务器上跑开源模型,但被 Ollama、llama.cpp、vLLM、MLX 这些名词绕晕的人。
零依赖极客
5 天前
c语言
·
开发语言
·
人工智能
·
矩阵
·
arm
·
vllm
Day 6·1 ARMv8.2 dotprod——vdotq_s32 一条指令做 4 个点积
一句话导读:ARMv8.2 dotprod(vdotq_s32)单指令四点积:对照标量 C 与拓宽 mla 的板端微基准,讲清微基准会骗人——vdot 的收益要在 8x8/4x4 大内核的寄存器压力下兑现。
Albart575
5 天前
大模型
·
llm
·
vllm
·
大模型推理
·
幻觉
·
重复输出
大模型无限循环输出、重复生成文本:参数层面规避幻觉输出实战
摘要:面向大模型应用开发者的排障实战指南。全文以"现象 → 根因 → 参数 → 实战 → 方法论"为主线,系统讲解 12 个采样参数的作用机制、典型取值与风险,给出"复读机、无限死循环、幻觉编造"三大高频问题的可落地处方,并附 OpenAI、HuggingFace、vLLM 三套可直接复用的代码与 6 大平台的参数命名对照表。
早睡早起身体好123
6 天前
android
·
人工智能
·
神经网络
·
机器学习
·
自然语言处理
·
vllm
用 XGrammar 约束大模型工具调用:解决参数为空的问题
工具调用成功了,为什么 arguments 仍然可能是空对象?这篇文章记录一个多智能体系统中的真实问题,以及如何使用 tool_choice、严格 JSON Schema 和 XGrammar 提高工具调用的可靠性。
basketball616
9 天前
android
·
人工智能
·
vllm
·
ai infra
AI Infra 推理部署技术总结:2. vLLM 内核——PagedAttention 与调度器原理
系列第二篇。上一篇(第一部分)介绍了 vLLM 的定位、特点、用法与常见类;本篇深入引擎内部,拆解让 vLLM 快起来的两个核心机制: PagedAttention(KV Cache 的分页内存管理) 与 调度器(Scheduler,连续批处理的决策中枢)。 读完你会理解:显存是怎么被"榨干"的,以及"GPU 每一步算谁"这件事是怎么被决定的。
CV-杨帆
11 天前
运维
·
服务器
·
vllm
在自己的服务器上搭建VLLM 以Qwen3.5-0.8B与Qwen3.5-4B为模型基础
总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894
Zguigo
12 天前
深度学习
·
vllm
Coding Agent 上下文压缩:从 Claude Code / Codex / Pi 到自研策略
关于上下文压缩,它已经是 Coding Agent 最核心的技术之一 。你如果以后想自己实现一个类似 Claude Code / Codex 的 Agent, 上下文压缩(Context Compaction)基本是必须掌握的机制 。今天我来讲解一下如何进行上下文压缩。实现我们看看现在主流的agent是怎么压缩上下文的。
DevOps老兵
14 天前
人工智能
·
kubernetes
·
helm
·
vllm
·
大模型推理
·
ai infra
AI Infra实战05:用Helm在K8s中部署vLLM,从安装到压测全流程
本篇配套的全部脚本、YAML、Helm Chart、预检工具和 Terraform 配置已开源在 GitHub:https://github.com/Jich1123/gpu-k8s-lab 。clone 下来按 00-lab/execution-checklist.md 的顺序执行即可复现全部实验(仓库不含任何真实 IP、密钥或账号信息)。
方方洛
15 天前
人工智能
·
算法
·
vllm
vllm教程-02-核心原理
仓库地址:https://github.com/hhk-png/cycle-agent本章目标:深入拆解 vLLM 高性能背后的每一个关键机制。每个概念都按 为什么(motivation)→ 怎么做(mechanism)→ 具体例子 展开。
苏子寒
17 天前
笔记
·
机器学习
·
ai
·
nlp
·
vllm
Nano-VLLM全代码解析笔记(10)-GemmaRMSNorm和MRoPE
本节参考资料:VLLM源码Transformers源码(49 封私信) Qwen3.5 架构最全拆解:Linear Attention 源码配图解析、Gated DeltaRule 公式源码逻辑介绍、Full Attention与 MoE 模块算子流程解析 - 知乎
缘友一世
18 天前
vllm
·
glm5.3 nvfp4
·
sm80
GLM-5.3-NVFP4 部署实战系列[八]启动加速:编译缓存挂载与 CUDA 图捕获裁剪,首启 8 分钟 → 3 分钟
先看启动耗时的构成(页缓存热,87 分片加载仅 ~9s):两个细节:排查编译崩溃期间我们用过 mode=none + cudagraph_mode=FULL,最终配置是默认编译 + piecewise 图。两者值得辨析: