技术栈
dsv4flash
缘友一世
2 小时前
模型部署
·
故障修复
·
deepseek
·
dsv4flash
DeepSeek-V4 长时运行宕机复盘 + 稳定性加固:为什么一个 5-token 请求会压垮整个服务
2026-08-20 复盘一句话结论: 这不是"前缀缓存清理不掉" —— vLLM 前缀缓存是 LRU 自动淘汰。真正的根因是单个超长上下文请求的 decode 单步耗时随长度超线性增长, 最终压垮 worker, 而 vLLM 的 EngineCore 超时后不自愈, 导致服务永久僵死。
我是有底线的