技术栈
prefill
Briwisdom
10 天前
模型部署
·
vllm
·
eagle
·
llama.cpp
·
prefill
·
speculative
·
decoding
Speculative Decoding:用小模型给大模型“打草稿“,推理加速 2-3×
副标题: 大模型每生成一个 token 都要搬一次 KV Cache——瓶颈在搬数据,不在算。投机解码做的事就是:用更快的方式"猜"出几个 token 凑成一批,大模型一次验证,用"批处理"省掉重复搬运。
tiger119
8 个月前
人工智能
·
llm
·
推理
·
moe
·
decode
·
deepseek
·
prefill
DeepSeek V3.1 的推理解析
之前仔细学习过大模型的推理解析,但只是针对通用的早期大模型,并没有针对目前流行的MoE的在模型的推理进行解析。比如:DeepSeek。也就是针对通用的早期Transformer架构进行了学习。
我是有底线的