海光 K100AI DCU(8 卡)部署 Qwen3.8-27B 实践指南(SGLang 篇)上一篇:海光 K100AI DCU (8卡) 部署 Qwen3.8-27B 实践指南(VLLM篇)本文产生的背景是使用VLLM完成了Qwen3.8 27B模型推理,结果客户有一个硬指标,希望5个并发的时候TPOT(Time Per Output Token,单 Token 输出延迟)在20ms以内,也就是每个Token的产生时间要在20ms以内,虽然海光的社区给了SGLang推理Qwen3.8-27B的的参考,但是非流式输出中文乱码,TPOT达不到20ms,这篇文章是基于真实部署与压测过程的排坑记录,从容