大模型服务从 POC 试点走向规模化生产,稳定性往往是最大拦路虎。不少团队完成压测后,GPU 利用率、平均 RT 都满足预期,接入真实业务流量后,间歇性出现时延陡增、流式输出卡顿、偶发请求超时熔断。抖动问题复现难度高,普通监控只能看到时延异常,很难直接定位根因。很多工程师第一反应怀疑 GPU 硬件或者推理内核,实际生产中纯粹内核缺陷占比很低,绝大多数抖动来自缓存、流量、调度、软硬件交互的组合问题。
1 区分两类抖动现象
排查第一步要先对现象分类,不同抖动对应完全不同处理思路。 全局抖动:抖动发生时实例上全部请求时延同步抬高,GPU 利用率剧烈震荡。代表实例公共资源出现瓶颈:显存碎片、GC 回收、CPU‑GPU 数据拷贝冲突。服务重启后短暂恢复,运行数小时故障复现,是碎片类问题典型特征。
单请求长尾抖动:绝大多数请求时延正常,仅少量请求耗时暴涨,其余业务不受影响。诱因集中在请求本身:超长上下文序列、投机解码频繁回退、特殊 token 触发计算路径退化。线上环境两类抖动经常混合出现,必须依靠请求粒度日志区分,记录每条请求输入输出 token、时间戳、GPU 快照,判断是整体变慢还是个别请求拖垮指标。
2 核心根因拆解
2.1 KV‑Cache 显存碎片
多会话并发推理下,不同对话生命周期长短不一,KV 缓存频繁申请释放,GPU 产生大量内存碎片。即便显存总占用率不高,也无法分配连续大块内存。推理引擎被迫执行缓存拷贝、回收整理,抢占 GPU 算力,瞬间拉高全体请求时延。MoE 模型专家显存分配更加零散,碎片问题相比稠密模型更加突出。只监控显存总使用率,会完全忽略碎片风险。盲目调高并发上限,会加速碎片累积。
2.2 流量长尾与分布漂移
压测流量大多为人工构造,token 长度集中在固定区间。真实业务存在显著长尾,少量上万 token 超长请求混杂在短请求中。长序列不仅消耗大量显存,部分推理框架长序列计算路径效率下降。若没有请求隔离,单条超长请求就会污染整个实例负载。 更隐蔽风险是业务迭代带来流量分布漂移,上游悄悄改变输入平均长度,原先压测调优参数全部失效。压测很难模拟真实长尾,这就是压测正常、线上故障频发的重要原因。
2.3 投机解码回退抖动
vLLM、SGLang 广泛开启投机解码提升吞吐。小模型预生成候选 token,大模型校验。预测正确则加速输出;预测错误必须丢弃已生成 token,回退重做计算。高难度推理场景下,小模型命中率暴跌,频繁回退造成单请求时延急剧上涨。很多团队只关注平均吞吐,忽视投机回退对 P99 长尾时延的破坏。
2.4 CPU 与 PCI‑E 拷贝瓶颈
排查问题时大家习惯聚焦 GPU,常常忽略 CPU 链路。请求到达后 token 编码、JSON 解析、数据向 GPU 拷贝;生成后 token 解码、流式报文组装全部依赖 CPU。并发上涨 CPU 资源不足会出现队列堆积,表现为 GPU 利用率不高,但整体时延持续走高。PCI‑E 带宽不足带来的数据拷贝阻塞,也会制造类似现象,极易被误判为 GPU 推理慢。
2.5 调度与弹性伸缩次生抖动
K8s 弹性伸缩、网关负载均衡同样引入抖动。实例冷启动加载权重耗时数分钟,未预热完成直接承接流量性能极差。会话粘连策略会造成流量分布不均,部分实例过载其余空闲。网关缺少排队限流,流量洪峰直接压垮推理服务内部队列。
3 标准化排查流程
- 搭建分层监控:业务层 P50/P95/P99 时延;推理层 token 长度分布;GPU 层显存碎片、利用率;CPU 负载、队列;额外采集投机解码命中率、回退次数。
- 定位抖动时间窗口,区分全局抖动还是单请求长尾。
- 全局抖动优先观察显存碎片变化,再排查 CPU、PCI‑E 拷贝瓶颈。
- 长尾抖动提取慢请求样本,分析 token 规模、投机回退记录。
- 使用线上真实流量回放复现故障,不要依赖人工构造压测用例。
4 落地优化方案
显存碎片治理:开启缓存复用池,设置会话 TTL 主动清理闲置 KV 缓存;业务低峰定时滚动重启实例释放碎片;不只限制请求并发,同时限制实例总 token 容量。
长尾流量隔离:网关层识别超长上下文请求,路由至独立大上下文实例池,不和普通短请求混部;设置单请求 token 上限;压测脚本必须引入长尾样本。
投机解码策略:增加命中率监控,对高复杂度请求动态关闭投机解码,牺牲吞吐保障 P99 时延。
CPU 链路优化:tokenizer 进程隔离,预留充足 CPU 核心,减少序列化拷贝开销。
弹性与网关:实例完成权重预热后再接入流量;伸缩判断同时参考队列长度,不只看硬件指标;网关实现请求排队、限流熔断,防止洪峰击穿后端。
大模型服务稳定性不能只看吞吐量与平均时延,真正影响用户体验的是 P99、P999 长尾指标。推理抖动大多不是单一 BUG,而是流量、缓存、调度多重条件耦合触发。很多团队全力调优模型效果,忽视服务运维,最终模型能力很强,线上体验却持续糟糕。建立完整可观测体系,回放真实流量复现问题,才可以系统性解决抖动,为大模型业务规模化落地打下稳定地基。