vLLM-05|MLA、Compressor、Indexer 与 SWA:Flash 注意力栈在 vLLM 里怎么落地协议层把 prompt 编成 token ids 之后,计算进入 DeepseekV4ForCausalLM.forward。Flash 的注意力实现不是标准多头注意力(MHA)单路径:在 DeepSeek V2/V3 的 MLA(Multi-head Latent Attention)底座上,按层叠加滑动窗口 SWA、可选 Compressor、以及仅在部分层出现的 Indexer 与 FlashMLA 稀疏 kernel。本文回答:compress_ratio 为 1、4、128 时,一层 atten