技术栈

dsv4flash

缘友一世
2 小时前
模型部署·故障修复·deepseek·dsv4flash
DeepSeek-V4 长时运行宕机复盘 + 稳定性加固:为什么一个 5-token 请求会压垮整个服务2026-08-20 复盘一句话结论: 这不是"前缀缓存清理不掉" —— vLLM 前缀缓存是 LRU 自动淘汰。真正的根因是单个超长上下文请求的 decode 单步耗时随长度超线性增长, 最终压垮 worker, 而 vLLM 的 EngineCore 超时后不自愈, 导致服务永久僵死。
我是有底线的