技术栈
llm 部署
weixin_44021329
1 天前
vllm
·
大模型推理
·
decode
·
kv cache
·
prefill
·
llm 部署
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子
在大模型落地部署、推理优化中,KV Cache、Prefill/Decode、TTFT/TPOT、GPU算子、vLLM 是一套高度关联的核心体系。本文将系统性地讲解大模型自回归推理的核心原理、推理阶段特性、性能瓶颈与工程优化方案,梳理完整的底层落地逻辑。
我是有底线的