sglang

GPUStack4 小时前
ai·大模型·llm·gpu·vllm·gpu集群·sglang·gpustack
Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。
Jay Kay1 天前
gateway·sglang
SGLang Model Gateway 特性详解(Cache-Aware 之外)随机选 2 个健康 Worker,比较负载(优先 token 级负载,降级为请求计数),发给负载更轻的那个。O(1) 决策,无需全局状态。
Briwisdom6 天前
架构·vllm·sglang·pagedattention·radixattention
LLM 推理引擎架构:vLLM / SGLang 的核心设计副标题: PagedAttention 借用 OS 虚拟内存思想管理 KV Cache,Continuous Batching 让 GPU 不再等人,RadixAttention 进一步用前缀树实现"相同前缀不重算"——三层递进,拆解推理引擎的底层逻辑
Token炼金师10 天前
人工智能·llm·llama·vllm·tensorrt-llm·sglang
引擎四强:vLLM、SGLang、TensorRT-LLM 与 llama.cpp —— 推理引擎选型对决推理引擎是大模型落地的核心基础设施。本文从 vLLM、SGLang、TensorRT-LLM、llama.cpp 四大主流引擎的架构原理、核心优化、性能对比、选型决策四个切口,给出源码级实现与企业级推理服务决策框架。
武子康11 天前
人工智能·ai·架构·llm·gpu·vllm·sglang
调查研究-224 Prefill 与 Decode 分离:高并发 LLM Serving 的下一层架构备注:版本矩阵全部基于 vLLM 官方文档、Anatomy of vLLM 博客(2025-09-05)、DistServe / Mooncake / Sarathi-Serve / EPD 等公开论文(arXiv + OSDI 2024 + FAST 2025)、vllm-project/vllm GitHub PR、SegmentFault / CSDN 公开拆解文章核查;⚠️ 条目为已披露的安全/版本相关问题,需要运维侧主动升级或缓解。
zhanghaofaowhrql12 天前
架构·vllm·sglang
vLLM 与 SGLang 推理框架性能横评:架构、吞吐与延迟的深度解析随着大语言模型(LLM)应用从探索走向落地,推理服务的性能、成本与易用性成为核心考量。vLLM 凭借其创新的 PagedAttention 技术,已成为高性能推理的事实标准之一。而 SGLang 作为后起之秀,提出了基于 RadixAttention 的运行时与编程语言一体化方案,旨在优化复杂提示词场景。本文将对这两个框架进行系统性横评,从架构设计、性能指标到适用场景,为开发者选型提供参考。
云卷云舒___________13 天前
openai·sglang·ai日报·dspark·gptrealtime·蚂蚁集团·lingbotdepth
OpenAI发布GPT-Realtime-2.1-mini, 支持推理、SGLang支持DSpark、蚂蚁LingBot-Depth 2.0攻克透明物体感知💡 今日趋势速览:OpenAI实时语音引入推理能力,SGLang以置信度推测解码提升吞吐,蚂蚁LingBot-Depth 2.0将透明物体深度误差降低一半。
像风一样自由20201 个月前
人工智能·大模型·vllm·sglang
17.推理框架横评:vLLM / TGI / TensorRT-LLM / SGLang 全面对比《大模型知识与部署》系列 · No.17 / 35 适合人群:AI 工程师、后端开发、技术决策者 阅读时间:约 28 分钟
颜笑晏晏1 个月前
缓存·推理优化·sglang·ai infra·pd分离
长输入短输出场景下的 SGLang 推理性能实测前缀缓存、PD 分离配比与参数调优我们产线上的推理请求,几乎是清一色的"长输入、短输出":几万 token 的资料或上下文喂进去,模型只吐回几百 token 的答案。RAG、长文档问答、代码库分析,本质上都是这个形状。
沐曦股份MetaX1 个月前
人工智能·开源·sglang
沐曦芯生,开源共创 | 沐曦股份 × SGLang联合举办技术交流Meetup,共同探索AI推理落地新路径6月6日,由沐曦股份联合SGLang开源社区、阿里云、龙蜥社区、腾讯云及融科资讯中心举办的“沐曦芯生,开源共创——SGLang技术交流Meetup”,在北京圆满举办。
xier_ran1 个月前
缓存·sglang
【infra之路】SGLang推理框架_KV缓存复用与Radix_Attention大语言模型推理时,每一轮生成都会产生 Key-Value 缓存(KV Cache),用于避免重复计算历史 token的注意力。但在多轮对话、少样本学习等场景中,不同请求之间往往存在大量相同的前缀,这些前缀对应的 KV缓存如果各自独立计算,就是纯粹的浪费。SGLang 是一个面向 LLM 的程序化推理框架,它用基数树(RadixTree)统一管理所有请求的 KV 缓存,并配合缓存感知调度策略最大化复用率,从而显著提升推理吞吐。 本文基于 SGLang 的相关技术资料,围绕以下三个问题展开:语言模型程序的定义
一只努力的微服务1 个月前
vllm·sglang
vLLM vs SGLang 深度技术对比这是两个框架最根本的技术差异,决定了各自的适用场景上限。问题背景:传统 LLM 推理需要为每个序列预分配连续的 KV Cache 显存空间,由于序列长度在推理前未知,通常按最大长度预留,导致严重的显存浪费(内部碎片),也限制了同时服务的并发数。
香菜烤面包2 个月前
sglang
SGLang HiCache 原理与部署配置在大语言模型(LLM)推理中,预填充(Prefill)阶段往往是性能瓶颈:输入序列需先转换为 KV Cache,才能进行后续解码。当多个请求共享相同前缀时,对应的 KV Cache 完全一致,存在大量重复计算。
海天一色y2 个月前
python·sglang
SGLang 本地部署 Qwen3-8B 大模型实战指南随着大语言模型(LLM)技术的快速发展,如何高效地在本地或私有服务器上部署和推理这些模型,已成为 AI 工程实践中的核心议题。相较于传统的 Transformers 推理方案,SGLang 作为一个专为 LLM 和视觉语言模型(VLM)设计的高性能推理框架,凭借其卓越的吞吐量和低延迟特性,正在获得越来越多开发者的青睐。
大模型推理2 个月前
python·深度学习·sglang
《从 0 实现 SGLang》第 5 篇 · 实现 KV Cache千行代码,一步步搭出一个现代 LLM 推理引擎,掌握大模型推理的每一项关键技术。上一篇引出无 KV cache 的代价: 每步从头跑整段 forward, 前面位置的 K/V 在下一步又被重算一遍, 带来大量重复计算。
大模型推理2 个月前
sglang
《从 0 实现 SGLang》第 4 篇 · prefill 和 decode 原理千行代码, 一步步搭出一个现代 LLM 推理引擎, 掌握大模型推理的每一项关键技术。第 3 篇第 8 章用 ~15 行代码跑通了"问 Qwen3 你是谁": tokenize → prefill → decode 循环 → detokenize。流程跑通了, 但代码里有 4 个容易产生疑惑的地方。
日光明媚2 个月前
人工智能·计算机视觉·aigc·音视频·sglang
深度解析 SGLang 框架 Wan2.1 视频生成加速技术:从 49 分钟到 1 分钟的极致优化Wan2.1 作为当前开源视频生成模型的标杆,其 14B 参数版本在生成质量上已经达到了商业级水准,但原生推理速度却令人望而却步:单卡 A800 生成一段 5 秒 720P 视频需要近 50 分钟。
是Yu欸3 个月前
android·数据库·大模型·github·昇腾·sglang·qwen3
SGLang 推理服务基础性能评测版权声明:本文为原创,遵循 CC 4.0 BY-SA 协议。转载请注明出处。SGLang 推理服务基础性能评测