技术栈
sglang
GPUStack
4 小时前
ai
·
大模型
·
llm
·
gpu
·
vllm
·
gpu集群
·
sglang
·
gpustack
Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试
Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M token 上下文窗口。
Jay Kay
1 天前
gateway
·
sglang
SGLang Model Gateway 特性详解(Cache-Aware 之外)
随机选 2 个健康 Worker,比较负载(优先 token 级负载,降级为请求计数),发给负载更轻的那个。O(1) 决策,无需全局状态。
Briwisdom
6 天前
架构
·
vllm
·
sglang
·
pagedattention
·
radixattention
LLM 推理引擎架构:vLLM / SGLang 的核心设计
副标题: PagedAttention 借用 OS 虚拟内存思想管理 KV Cache,Continuous Batching 让 GPU 不再等人,RadixAttention 进一步用前缀树实现"相同前缀不重算"——三层递进,拆解推理引擎的底层逻辑
Token炼金师
10 天前
人工智能
·
llm
·
llama
·
vllm
·
tensorrt-llm
·
sglang
引擎四强:vLLM、SGLang、TensorRT-LLM 与 llama.cpp —— 推理引擎选型对决
推理引擎是大模型落地的核心基础设施。本文从 vLLM、SGLang、TensorRT-LLM、llama.cpp 四大主流引擎的架构原理、核心优化、性能对比、选型决策四个切口,给出源码级实现与企业级推理服务决策框架。
武子康
11 天前
人工智能
·
ai
·
架构
·
llm
·
gpu
·
vllm
·
sglang
调查研究-224 Prefill 与 Decode 分离:高并发 LLM Serving 的下一层架构
备注:版本矩阵全部基于 vLLM 官方文档、Anatomy of vLLM 博客(2025-09-05)、DistServe / Mooncake / Sarathi-Serve / EPD 等公开论文(arXiv + OSDI 2024 + FAST 2025)、vllm-project/vllm GitHub PR、SegmentFault / CSDN 公开拆解文章核查;⚠️ 条目为已披露的安全/版本相关问题,需要运维侧主动升级或缓解。
zhanghaofaowhrql
12 天前
架构
·
vllm
·
sglang
vLLM 与 SGLang 推理框架性能横评:架构、吞吐与延迟的深度解析
随着大语言模型(LLM)应用从探索走向落地,推理服务的性能、成本与易用性成为核心考量。vLLM 凭借其创新的 PagedAttention 技术,已成为高性能推理的事实标准之一。而 SGLang 作为后起之秀,提出了基于 RadixAttention 的运行时与编程语言一体化方案,旨在优化复杂提示词场景。本文将对这两个框架进行系统性横评,从架构设计、性能指标到适用场景,为开发者选型提供参考。
云卷云舒___________
13 天前
openai
·
sglang
·
ai日报
·
dspark
·
gptrealtime
·
蚂蚁集团
·
lingbotdepth
OpenAI发布GPT-Realtime-2.1-mini, 支持推理、SGLang支持DSpark、蚂蚁LingBot-Depth 2.0攻克透明物体感知
💡 今日趋势速览:OpenAI实时语音引入推理能力,SGLang以置信度推测解码提升吞吐,蚂蚁LingBot-Depth 2.0将透明物体深度误差降低一半。
像风一样自由2020
1 个月前
人工智能
·
大模型
·
vllm
·
sglang
17.推理框架横评:vLLM / TGI / TensorRT-LLM / SGLang 全面对比
《大模型知识与部署》系列 · No.17 / 35 适合人群:AI 工程师、后端开发、技术决策者 阅读时间:约 28 分钟
颜笑晏晏
1 个月前
缓存
·
推理优化
·
sglang
·
ai infra
·
pd分离
长输入短输出场景下的 SGLang 推理性能实测前缀缓存、PD 分离配比与参数调优
我们产线上的推理请求,几乎是清一色的"长输入、短输出":几万 token 的资料或上下文喂进去,模型只吐回几百 token 的答案。RAG、长文档问答、代码库分析,本质上都是这个形状。
沐曦股份MetaX
1 个月前
人工智能
·
开源
·
sglang
沐曦芯生,开源共创 | 沐曦股份 × SGLang联合举办技术交流Meetup,共同探索AI推理落地新路径
6月6日,由沐曦股份联合SGLang开源社区、阿里云、龙蜥社区、腾讯云及融科资讯中心举办的“沐曦芯生,开源共创——SGLang技术交流Meetup”,在北京圆满举办。
xier_ran
1 个月前
缓存
·
sglang
【infra之路】SGLang推理框架_KV缓存复用与Radix_Attention
大语言模型推理时,每一轮生成都会产生 Key-Value 缓存(KV Cache),用于避免重复计算历史 token的注意力。但在多轮对话、少样本学习等场景中,不同请求之间往往存在大量相同的前缀,这些前缀对应的 KV缓存如果各自独立计算,就是纯粹的浪费。SGLang 是一个面向 LLM 的程序化推理框架,它用基数树(RadixTree)统一管理所有请求的 KV 缓存,并配合缓存感知调度策略最大化复用率,从而显著提升推理吞吐。 本文基于 SGLang 的相关技术资料,围绕以下三个问题展开:语言模型程序的定义
一只努力的微服务
1 个月前
vllm
·
sglang
vLLM vs SGLang 深度技术对比
这是两个框架最根本的技术差异,决定了各自的适用场景上限。问题背景:传统 LLM 推理需要为每个序列预分配连续的 KV Cache 显存空间,由于序列长度在推理前未知,通常按最大长度预留,导致严重的显存浪费(内部碎片),也限制了同时服务的并发数。
香菜烤面包
2 个月前
sglang
SGLang HiCache 原理与部署配置
在大语言模型(LLM)推理中,预填充(Prefill)阶段往往是性能瓶颈:输入序列需先转换为 KV Cache,才能进行后续解码。当多个请求共享相同前缀时,对应的 KV Cache 完全一致,存在大量重复计算。
海天一色y
2 个月前
python
·
sglang
SGLang 本地部署 Qwen3-8B 大模型实战指南
随着大语言模型(LLM)技术的快速发展,如何高效地在本地或私有服务器上部署和推理这些模型,已成为 AI 工程实践中的核心议题。相较于传统的 Transformers 推理方案,SGLang 作为一个专为 LLM 和视觉语言模型(VLM)设计的高性能推理框架,凭借其卓越的吞吐量和低延迟特性,正在获得越来越多开发者的青睐。
大模型推理
2 个月前
python
·
深度学习
·
sglang
《从 0 实现 SGLang》第 5 篇 · 实现 KV Cache
千行代码,一步步搭出一个现代 LLM 推理引擎,掌握大模型推理的每一项关键技术。上一篇引出无 KV cache 的代价: 每步从头跑整段 forward, 前面位置的 K/V 在下一步又被重算一遍, 带来大量重复计算。
大模型推理
2 个月前
sglang
《从 0 实现 SGLang》第 4 篇 · prefill 和 decode 原理
千行代码, 一步步搭出一个现代 LLM 推理引擎, 掌握大模型推理的每一项关键技术。第 3 篇第 8 章用 ~15 行代码跑通了"问 Qwen3 你是谁": tokenize → prefill → decode 循环 → detokenize。流程跑通了, 但代码里有 4 个容易产生疑惑的地方。
日光明媚
2 个月前
人工智能
·
计算机视觉
·
aigc
·
音视频
·
sglang
深度解析 SGLang 框架 Wan2.1 视频生成加速技术:从 49 分钟到 1 分钟的极致优化
Wan2.1 作为当前开源视频生成模型的标杆,其 14B 参数版本在生成质量上已经达到了商业级水准,但原生推理速度却令人望而却步:单卡 A800 生成一段 5 秒 720P 视频需要近 50 分钟。
是Yu欸
3 个月前
android
·
数据库
·
大模型
·
github
·
昇腾
·
sglang
·
qwen3
SGLang 推理服务基础性能评测
版权声明:本文为原创,遵循 CC 4.0 BY-SA 协议。转载请注明出处。SGLang 推理服务基础性能评测