技术栈

glm5.3 nvfp4

缘友一世
20 天前
vllm·glm5.3 nvfp4·sm80
GLM-5.3-NVFP4 部署实战系列[八]启动加速:编译缓存挂载与 CUDA 图捕获裁剪,首启 8 分钟 → 3 分钟先看启动耗时的构成(页缓存热,87 分片加载仅 ~9s):两个细节:排查编译崩溃期间我们用过 mode=none + cudagraph_mode=FULL,最终配置是默认编译 + piecewise 图。两者值得辨析:
缘友一世
20 天前
vllm·glm5.3 nvfp4·sm80
GLM-5.3-NVFP4 部署实战系列[七]正确的部署脚本与一键部署:deploy.sh参数拆解这样做的优势其中 KV_CACHE_MEMORY 值得单独说:启动日志会提示"剩余显存还可放多少 KV",把它换算成字节数填进去即可把 0.95 利用率下的 KV 从 ~15GiB 提到 ~17–18GiB,长上下文并发场景直接受益。
缘友一世
20 天前
vllm·glm5.3 nvfp4·sm80
GLM-5.3-NVFP4 部署实战系列[四]问题深拆①:sm80 没有稀疏 MLA 注意力后端怎么办系列:GLM-5.3-NVFP4 部署实录(8×A800 / sm80)。 上一篇:03 踩坑总览。 本文覆盖坑 1、2、3、4、5、10、11——整个部署中工作量最大的一组问题。
我是有底线的