技术栈

投机解码

AI大佬的小弟
9 天前
推理优化·ai入门·大模型基础概念·投机解码·草稿模型·eagl·无损加速
大模型名词精讲21:投机解码(Speculative Decoding)上一篇我们聊了模型量化,把模型从"巨无霸"压成了"小钢炮"。但即便模型压缩了,推理时还是一个字一个字地生成——每次生成都要跑一遍完整的70B参数,一个字都跑不掉。有没有办法让大模型"少干点活"?
thesky123456
24 天前
大模型·vllm·eagle·pagedattention·medusa·推理服务化·投机解码
27届大模型面试准备(二十五):推理服务化与投机解码——vLLM、PagedAttention、Medusa 与连续批处理上一篇《位置编码与长度外推》解决了"模型怎么读懂 128K 上下文"的问题,解决了"能装下"之后,下一个绕不开的工程问题是"怎么把模型高效的往外吐"。这是本系列第二十五篇。一个 70B 模型在单卡上跑不起来、在八卡上吞吐上不去、在百路并发下延迟爆炸,这些都是推理服务化的范畴。2025 年之后,几乎所有大模型团队的面试都会问到 vLLM、PagedAttention、连续批处理(continuous batching),以及越来越火的投机解码(speculative decoding)。本系列 A15 讲的
我是有底线的