技术栈

推理服务化

thesky123456
2 小时前
大模型·vllm·eagle·pagedattention·medusa·推理服务化·投机解码
27届大模型面试准备(二十五):推理服务化与投机解码——vLLM、PagedAttention、Medusa 与连续批处理上一篇《位置编码与长度外推》解决了"模型怎么读懂 128K 上下文"的问题,解决了"能装下"之后,下一个绕不开的工程问题是"怎么把模型高效的往外吐"。这是本系列第二十五篇。一个 70B 模型在单卡上跑不起来、在八卡上吞吐上不去、在百路并发下延迟爆炸,这些都是推理服务化的范畴。2025 年之后,几乎所有大模型团队的面试都会问到 vLLM、PagedAttention、连续批处理(continuous batching),以及越来越火的投机解码(speculative decoding)。本系列 A15 讲的
我是有底线的