prefill

weixin_4402132912 天前
vllm·大模型推理·decode·kv cache·prefill·llm 部署
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子在大模型落地部署、推理优化中,KV Cache、Prefill/Decode、TTFT/TPOT、GPU算子、vLLM 是一套高度关联的核心体系。本文将系统性地讲解大模型自回归推理的核心原理、推理阶段特性、性能瓶颈与工程优化方案,梳理完整的底层落地逻辑。
Briwisdom1 个月前
gemm·vllm·moe·decode·prefill
MoE 推理优化实战——从“瓶颈罗列“到“性能调优“副标题: #20 篇拆解了 MoE 部署的五大瓶颈,这篇给出对应的解法——Expert Parallelism 怎么配、Grouped GEMM 为什么比 for-loop 快 10 倍、路由怎么调丝滑、推测解码如何掩盖 MoE decode 的劣势。从理论到实践的完整拼图。
Briwisdom2 个月前
模型部署·vllm·eagle·llama.cpp·prefill·speculative·decoding
Speculative Decoding:用小模型给大模型“打草稿“,推理加速 2-3×副标题: 大模型每生成一个 token 都要搬一次 KV Cache——瓶颈在搬数据,不在算。投机解码做的事就是:用更快的方式"猜"出几个 token 凑成一批,大模型一次验证,用"批处理"省掉重复搬运。
tiger1199 个月前
人工智能·llm·推理·moe·decode·deepseek·prefill
DeepSeek V3.1 的推理解析之前仔细学习过大模型的推理解析,但只是针对通用的早期大模型,并没有针对目前流行的MoE的在模型的推理进行解析。比如:DeepSeek。也就是针对通用的早期Transformer架构进行了学习。
我是有底线的