sglang

Luchang-Li3 天前
sglang
SGLang Qwen3/kimi-k3 Hybrid Linear Mamba KV cache管理Kimi K3 Tech Blog: Open Frontier Intelligence当 Prefix Cache 遇见 KDA:Mooncake 如何 Day-0 支持 Kimi K3
谢白羽4 天前
分布式·架构·llm·vllm·sglang
SGLang源码剖析-2-sglang双层体系架构全景SGLang 与 vLLM、TensorRT-LLM 等推理框架的核心差异在于:SGLang 不只提供高性能 serving engine,还提供面向 LLM 应用编排的前端语言层。它既能作为后端推理引擎使用,也能通过前端语言表达多轮、多分支、结构化的 LLM 交互程序。
奔跑中的小象6 天前
人工智能·uos·sglang·天数智芯
统信UOS + 天数AI卡部署SGLang服务手册请参考:统信 UOS 天数智芯驱动安装手册📷 服务启动成功截图:📷 预期返回: JSON 格式的模型回复,示例如下:
SLD_Allen6 天前
架构·vllm·sglang
大模型推理引擎架构深度解析:vLLM、SGLang与TensorRT-LLM的技术路线对决标签:AI-INFRA / 推理优化 日期:2026-08-03 阅读约 12 分钟2026年,大模型从"能用"迈入"好用"的阶段,推理引擎的竞争格局已趋于清晰。vLLM、SGLang和TensorRT-LLM三足鼎立,各自占据了不同的生态位。对AI工程师而言,选择哪个推理框架直接决定了服务的延迟、吞吐量和运营成本。本文将从底层架构原理出发,深度拆解三大框架的技术路线差异,并结合实际部署场景给出选型指南。
love530love9 天前
windows·缓存·sglang
Windows 原生编译 SGLang(4/8):环境关——VS 版本、venv 顺序、CUDA 多版本、生成器缓存这是攻关系列的第一篇实战。很多人以为编译的难点全在源码,其实最容易被低估、却最容易让人卡在第一步的,是环境。本篇要讲的四个坑,没有一个跟 sglang 本身有关——它们是所有人在 Windows 上编译 CUDA 扩展都可能撞上的共性问题。把这一关过了,才谈得上碰源码。
love530love9 天前
windows·sglang
Windows 原生编译 SGLang(2/8):三铁证判定可行 + --no-deps 外科手术式安装上一篇(第 0 篇)我们用 EPGF 架构把 Unlimited-OCR 部署到了能跑通推理的状态,并停在了一个岔路口:高性能后端 sglang 在 Windows 上"装不了",主流建议是退回 Transformers 或转投 WSL2 / Docker。
执笔论英雄9 天前
服务发现·sglang
【大模型推理】sglang PD 分离 : 6473 服务发现最近在浏览 SGLang 项目的 GitHub 动态时,我注意到了 PR #6473 中的一些变更。这个 PR 涉及对项目代码的修改,而在变更描述或相关讨论中,一个名为 “Bootstrap Server” 的组件被提及。这立刻引起了我的好奇:在一个专注于大语言模型(LLM)高效推理的框架中,一个通常与分布式系统服务发现相关的“引导服务器”会扮演怎样的角色?它是否与 SGLang 核心的 Prefill-Decode(PD)分离 架构有直接关联?
久久学姐11 天前
实现原理·sglang·customallreduce·nvlinkp2p·ipc交换
SGLang Custom AllReduce v1 与 v2 实现原理详解0x0. 前言在TP并行的情况下, 每一个层, 至少会有两次all-, 一次是在之后, 另一次是在MLP/MoE之后, 那些有着几十上百层的模型中一步就会出现几百次all-的情况, 并且每次传输的数据量都很小, 比如bs为1, 8192的bf16模型的数据量是16KB。此负载特征将瓶颈判定为延时而非带宽, NCCL这类针对大消息以及任意拓扑予以设计的通用库在此区间的开销颇为偏大, 因而其中存在两代自定义all - 实现, 从vLLM移植而来的(以下简称为v1, 在 =0时启用)以及当下默认的v2。
Briwisdom12 天前
tensorrt·vllm·推理引擎·sglang
LLM 推理引擎三强争霸——vLLM vs SGLang vs TensorRT-LLM副标题: 2026 年的 LLM 推理引擎格局已经清晰——vLLM 是生产部署的事实标准,SGLang 在 Agent 和结构化输出场景独占鳌头,TensorRT-LLM 是 NVIDIA 硬件上的性能天花板。本文从架构哲学、调度策略、KV Cache 管理、编译优化到实测性能,做一次三强全面对比。
老刘说AI16 天前
人工智能·神经网络·机器学习·缓存·架构·sglang
SGLang 深度优化: Radix 缓存与复杂任务的极致吞吐vLLM 的高并发原理:vLLM 解决的是 如何让模型跑得快的问题。SGLang是解决如何让业务逻辑跑得快。
GPUStack21 天前
ai·大模型·llm·gpu·vllm·gpu集群·sglang·gpustack
Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。
Jay Kay22 天前
gateway·sglang
SGLang Model Gateway 特性详解(Cache-Aware 之外)随机选 2 个健康 Worker,比较负载(优先 token 级负载,降级为请求计数),发给负载更轻的那个。O(1) 决策,无需全局状态。
Briwisdom1 个月前
架构·vllm·sglang·pagedattention·radixattention
LLM 推理引擎架构:vLLM / SGLang 的核心设计副标题: PagedAttention 借用 OS 虚拟内存思想管理 KV Cache,Continuous Batching 让 GPU 不再等人,RadixAttention 进一步用前缀树实现"相同前缀不重算"——三层递进,拆解推理引擎的底层逻辑
Token炼金师1 个月前
人工智能·llm·llama·vllm·tensorrt-llm·sglang
引擎四强:vLLM、SGLang、TensorRT-LLM 与 llama.cpp —— 推理引擎选型对决推理引擎是大模型落地的核心基础设施。本文从 vLLM、SGLang、TensorRT-LLM、llama.cpp 四大主流引擎的架构原理、核心优化、性能对比、选型决策四个切口,给出源码级实现与企业级推理服务决策框架。
武子康1 个月前
人工智能·ai·架构·llm·gpu·vllm·sglang
调查研究-224 Prefill 与 Decode 分离:高并发 LLM Serving 的下一层架构备注:版本矩阵全部基于 vLLM 官方文档、Anatomy of vLLM 博客(2025-09-05)、DistServe / Mooncake / Sarathi-Serve / EPD 等公开论文(arXiv + OSDI 2024 + FAST 2025)、vllm-project/vllm GitHub PR、SegmentFault / CSDN 公开拆解文章核查;⚠️ 条目为已披露的安全/版本相关问题,需要运维侧主动升级或缓解。
zhanghaofaowhrql1 个月前
架构·vllm·sglang
vLLM 与 SGLang 推理框架性能横评:架构、吞吐与延迟的深度解析随着大语言模型(LLM)应用从探索走向落地,推理服务的性能、成本与易用性成为核心考量。vLLM 凭借其创新的 PagedAttention 技术,已成为高性能推理的事实标准之一。而 SGLang 作为后起之秀,提出了基于 RadixAttention 的运行时与编程语言一体化方案,旨在优化复杂提示词场景。本文将对这两个框架进行系统性横评,从架构设计、性能指标到适用场景,为开发者选型提供参考。
云卷云舒___________1 个月前
openai·sglang·ai日报·dspark·gptrealtime·蚂蚁集团·lingbotdepth
OpenAI发布GPT-Realtime-2.1-mini, 支持推理、SGLang支持DSpark、蚂蚁LingBot-Depth 2.0攻克透明物体感知💡 今日趋势速览:OpenAI实时语音引入推理能力,SGLang以置信度推测解码提升吞吐,蚂蚁LingBot-Depth 2.0将透明物体深度误差降低一半。
像风一样自由20202 个月前
人工智能·大模型·vllm·sglang
17.推理框架横评:vLLM / TGI / TensorRT-LLM / SGLang 全面对比《大模型知识与部署》系列 · No.17 / 35 适合人群:AI 工程师、后端开发、技术决策者 阅读时间:约 28 分钟
颜笑晏晏2 个月前
缓存·推理优化·sglang·ai infra·pd分离
长输入短输出场景下的 SGLang 推理性能实测前缀缓存、PD 分离配比与参数调优我们产线上的推理请求,几乎是清一色的"长输入、短输出":几万 token 的资料或上下文喂进去,模型只吐回几百 token 的答案。RAG、长文档问答、代码库分析,本质上都是这个形状。
沐曦股份MetaX2 个月前
人工智能·开源·sglang
沐曦芯生,开源共创 | 沐曦股份 × SGLang联合举办技术交流Meetup,共同探索AI推理落地新路径6月6日,由沐曦股份联合SGLang开源社区、阿里云、龙蜥社区、腾讯云及融科资讯中心举办的“沐曦芯生,开源共创——SGLang技术交流Meetup”,在北京圆满举办。