LLM 推理引擎与内核系统工程原理摘要:本文从计算机系统的基础理论出发,系统阐述大语言模型推理引擎与内核工程的原理体系。核心论点是:decode 的性能由内存带宽决定而非算力决定,帧时间等于活跃权重字节数除以有效带宽;由此推出全部工程手段的分类——量化削减字节、批处理摊薄字节、预取提高有效带宽、卸载改变带宽档位、投机解码减少搬运次数、分页管理 KV 容量。全文以一次推理请求的生命周期为线索:硬件存储层次(第二章)→ 带宽瓶颈的推导与实测(第三章)→ 计算分解(第四章)→ 调度与批处理(第五章)→ KV cache 与分页显存(第六章)→