连续批处理

thesky12345611 天前
大模型·抢占·连续批处理·推理调度·请求优先级·弹性扩缩容·chunked prefill
27届大模型面试准备(六十六):大模型推理调度与弹性扩缩容工程——排队、优先级、抢占与弹性前面(五十九)讲了推理引擎内核、(五十四)讲了成本与吞吐、(六十一)讲了可观测性。本文站在它们之上讲"调度层":当一堆请求涌进来,引擎内部怎么排队、怎么决定谁先跑、GPU 不够了怎么弹性扩缩、高优请求怎么不被长尾拖死。这是推理服务从"能跑"到"生产级稳"的关键一跳。
thesky12345613 天前
大模型·vllm·flashattention·推理引擎·pagedattention·连续批处理·显存管理
27届大模型面试准备(五十九):大模型推理引擎内核深度剖析——PagedAttention、调度器与显存管理前面(二十五)讲推理服务化与投机解码、(五十三)讲多模态服务化、(五十四)讲成本与吞吐调优,都偏「架构与成本」。本篇往内核里再钻一层:一个推理引擎(vLLM、TensorRT-LLM、SGLang 之类)到底怎么把一次请求变成显存里的 KV Cache、怎么调度 token、怎么不浪费显存。这是面试「部署优化」这条线的硬核题,也是华为多模态 LLM 岗现场写代码/画架构高频考点。
thesky12345617 天前
大模型·pd分离·连续批处理·推理成本优化·吞吐调优·kv量化·显存带宽
27届大模型面试准备(五十四):大模型推理成本与吞吐调优实战——从连续批处理到 PD 分离A25 讲过推理服务化的基础组件(PagedAttention、连续批处理、投机解码),A30 讲过全栈性能优化。但面试官真正想听的不是名词罗列,而是"给定一块卡、一个 SLA、一个成本上限,你怎么把吞吐和延迟同时压到最优"。本篇是工程实战深化的第二讲,把推理成本拆成"算力、显存、带宽"三本账,给出可落地的调优杠杆,并重点讲清近年最关键的架构演进——Prefill 与 Decode 分离(PD 分离)。
九章云极AladdinEdu1 年前
vllm·kv缓存·推理优化·pagedattention·连续批处理·吞吐量对比
大模型推理服务优化:vLLM的PagedAttention与连续批处理实现大型语言模型(LLM)推理面临两大核心矛盾:计算密度高(单次推理需数十亿次浮点运算)与内存消耗大。以LLaMA-13B为例,仅KV缓存(Key-Value Cache)存储单个序列就可能占用1.7GB内存,而传统推理系统(如HuggingFace Transformers、FasterTransformer)由于固定内存预分配策略,导致60%-80%的内存因碎片化和过度保留而被浪费。
我是有底线的