sglang

赋创小助手2 天前
服务器·人工智能·大模型·qwen·vllm·sglang·context长度
Qwen3.8-27B 本地推理 Benchmark 解析:llama.cpp、vLLM、SGLang 与长 Context 的性能差异本文基于一组 Qwen3.8-27B 多平台公开基准测试,重点讨论 Benchmark 方法、推理引擎、Context、MTP、TTFT / Prefill / Decode 的技术关系。不同平台的量化和运行配方并不完全一致,因此本文不把结果当作严格的硬件排名。
谢白羽3 天前
笔记·python·llm·llama·sglang
在4×B300用SGLang部署DeepSeek-V4.1 Flash优化实录本文提到的 DeepSeek-V4.1 的 Day 0 适配和 kernel 优化由 SGLang 团队共同完成。最终在 4×B300、TP4 / EP4 配置下,配合 DSpark 达到
谢白羽4 天前
笔记·llm·论文·大模型部署·sglang
MiniMax-H3 : 4卡 H20-3e一套权重部署实践/8卡H200部署优化实测H3-Base 将各模态编码后组织为统一序列,由同一个 Omni Transformer 联合预测视频与音频的潜在表示,再交给各自的 VAE 解码。文字和视觉条件会经过 H3-Encoder,视觉内容还通过 Visual VAE 表示,音频则由 Audio VAE 编码。这使参考素材的类型和长度都可能改变工作量;只验证文本生成,不能覆盖有声视频或混合参考的编码路径。
markvivv15 天前
sglang
海光 K100AI DCU(8 卡)部署 Qwen3.8-27B 实践指南(SGLang 篇)上一篇:海光 K100AI DCU (8卡) 部署 Qwen3.8-27B 实践指南(VLLM篇)本文产生的背景是使用VLLM完成了Qwen3.8 27B模型推理,结果客户有一个硬指标,希望5个并发的时候TPOT(Time Per Output Token,单 Token 输出延迟)在20ms以内,也就是每个Token的产生时间要在20ms以内,虽然海光的社区给了SGLang推理Qwen3.8-27B的的参考,但是非流式输出中文乱码,TPOT达不到20ms,这篇文章是基于真实部署与压测过程的排坑记录,从容
谢白羽18 天前
笔记·python·sglang
SGLang的AWQ量化笔记AWQ 的完整生命周期可以分为两个阶段,它们之间的职责边界比较清晰。这种分工,是 AWQ 能够实现工程化部署的重要前提之一:
auto_go22 天前
vllm·sglang
大模型实战指南(11)——推理框架选型实战:vLLM × SGLang × TensorRT-LLM 深度对比与部署指南这是《大模型实战指南》系列第十一篇。前十篇我们从 Token、上下文窗口、温度采样、Embedding、Harness、微调、推理优化、RAG、Agent 一路拆到多模态,把大模型从“会打字的魔法盒子”拆成了一套可操控的工程系统。这一篇解决所有工程师都会遇到的那道坎:模型选好了、甚至微调好了,怎么把它部署成高并发、低延迟、能扛住真实流量的线上服务?
谢白羽23 天前
笔记·llm·论文·agent·vllm·大模型部署·sglang
SGLang模型加载过程笔记1.如果dp_size大于1 PP = 2 TP = 2 DP = 1因此会创建:2.如果dp_size大于1 DP Controller 根据轮询、当前请求数或 Token 数,把每个请求交给负载较低的模型副本。
一次旅行1 个月前
人工智能·缓存·sglang
2026‑08‑22 AI产业深度解读|Anthropic自研芯片布局、SGLang权重缓存守护进程、Agent任务作弊审计、AI原生SDLC梳理8月22日对AI研发人员高价值产业动态;覆盖Anthropic挖角前谷歌TPU负责人布局自研芯片、SGLang Weight Cache Daemon亚秒级引擎重启、大模型任务作弊审计报告、Anthropic AI原生SDLC实战手册、面壁MathForm数学形式化开源项目;每条附带工程视角解读、收益与现实约束;适合大模型推理、Agent安全、AI软件工程、科研研发人员。 关键词:SGLang;Weight‑Cache‑Daemon;Anthropic自研芯片;Agent安全;AI‑Native SD
Jay Kay1 个月前
sglang
DFlash 与 DSpark:从原理到 SGLang 实现本文梳理 Flash-style block speculative decoding 里两条相关路线:DFlash(block diffusion + KV injection)与 DSpark(半自回归 refine + confidence 调度 verify),并对照 SGLang 中的落地方式。
天涯明月19931 个月前
人工智能·后端·推理·sglang
SGLang深度研究报告一份面向工程实践的系统剖析,覆盖设计动机、前后端协同架构、RadixAttention、约束解码、零开销调度、投机解码、分布式部署与真实性能基准。 版本基线:SGLang v0.5.x(2026 年中),论文原作 NeurIPS 2024。
海天一色y1 个月前
人工智能·llm·sglang
Sglang本地部署Qwen3.5-9B模型随着大语言模型(LLM)的快速发展,模型规模不断增大,对推理部署的要求也越来越高。如何在本地高效地部署和运行大模型,已成为许多开发者和AI从业者面临的核心挑战之一。本文将详细介绍如何使用 SGLang 推理框架在本地部署 Qwen3.5-9B 大模型,从环境准备到服务调用的完整流程。
咖啡星人k1 个月前
vllm·sglang
本地跑起 MiniMax H3:SGLang/vLLM/diffusers/ComfyUI 四种部署路线实测对比H3 开源之后,最受关注的问题之一就是:本地到底怎么跑?这一篇汇总四种主流部署路线,对比各自的适用场景、上手成本和坑点,帮你选对姿势。
Luchang-Li1 个月前
sglang
SGLang Qwen3/kimi-k3 Hybrid Linear Mamba KV cache管理Kimi K3 Tech Blog: Open Frontier Intelligence当 Prefix Cache 遇见 KDA:Mooncake 如何 Day-0 支持 Kimi K3
谢白羽1 个月前
分布式·架构·llm·vllm·sglang
SGLang源码剖析-2-sglang双层体系架构全景SGLang 与 vLLM、TensorRT-LLM 等推理框架的核心差异在于:SGLang 不只提供高性能 serving engine,还提供面向 LLM 应用编排的前端语言层。它既能作为后端推理引擎使用,也能通过前端语言表达多轮、多分支、结构化的 LLM 交互程序。
奔跑中的小象2 个月前
人工智能·uos·sglang·天数智芯
统信UOS + 天数AI卡部署SGLang服务手册请参考:统信 UOS 天数智芯驱动安装手册📷 服务启动成功截图:📷 预期返回: JSON 格式的模型回复,示例如下:
SLD_Allen2 个月前
架构·vllm·sglang
大模型推理引擎架构深度解析:vLLM、SGLang与TensorRT-LLM的技术路线对决标签:AI-INFRA / 推理优化 日期:2026-08-03 阅读约 12 分钟2026年,大模型从"能用"迈入"好用"的阶段,推理引擎的竞争格局已趋于清晰。vLLM、SGLang和TensorRT-LLM三足鼎立,各自占据了不同的生态位。对AI工程师而言,选择哪个推理框架直接决定了服务的延迟、吞吐量和运营成本。本文将从底层架构原理出发,深度拆解三大框架的技术路线差异,并结合实际部署场景给出选型指南。
love530love2 个月前
windows·缓存·sglang
Windows 原生编译 SGLang(4/8):环境关——VS 版本、venv 顺序、CUDA 多版本、生成器缓存这是攻关系列的第一篇实战。很多人以为编译的难点全在源码,其实最容易被低估、却最容易让人卡在第一步的,是环境。本篇要讲的四个坑,没有一个跟 sglang 本身有关——它们是所有人在 Windows 上编译 CUDA 扩展都可能撞上的共性问题。把这一关过了,才谈得上碰源码。
love530love2 个月前
windows·sglang
Windows 原生编译 SGLang(2/8):三铁证判定可行 + --no-deps 外科手术式安装上一篇(第 0 篇)我们用 EPGF 架构把 Unlimited-OCR 部署到了能跑通推理的状态,并停在了一个岔路口:高性能后端 sglang 在 Windows 上"装不了",主流建议是退回 Transformers 或转投 WSL2 / Docker。