PagedAttention 与 Continuous Batching原文发布于 quant67.com,转载请保留出处。本篇分工(与第 13 篇互补):本篇只讲 KV block 分页 + 迭代级调度 两条机制——Continuous Batching、PagedAttention、Chunked Prefill、Prefix Caching 及其内核耦合;不做 vLLM / SGLang / TensorRT-LLM 的产品横评。引擎选型、生态与部署模式见下一篇《vLLM / SGLang / TensorRT-LLM / TGI 对比》。