技术栈
吞吐调优
thesky123456
3 小时前
大模型
·
pd分离
·
连续批处理
·
推理成本优化
·
吞吐调优
·
kv量化
·
显存带宽
27届大模型面试准备(五十四):大模型推理成本与吞吐调优实战——从连续批处理到 PD 分离
A25 讲过推理服务化的基础组件(PagedAttention、连续批处理、投机解码),A30 讲过全栈性能优化。但面试官真正想听的不是名词罗列,而是"给定一块卡、一个 SLA、一个成本上限,你怎么把吞吐和延迟同时压到最优"。本篇是工程实战深化的第二讲,把推理成本拆成"算力、显存、带宽"三本账,给出可落地的调优杠杆,并重点讲清近年最关键的架构演进——Prefill 与 Decode 分离(PD 分离)。
我是有底线的