技术栈
显存管理
thesky123456
15 天前
大模型
·
vllm
·
flashattention
·
推理引擎
·
pagedattention
·
连续批处理
·
显存管理
27届大模型面试准备(五十九):大模型推理引擎内核深度剖析——PagedAttention、调度器与显存管理
前面(二十五)讲推理服务化与投机解码、(五十三)讲多模态服务化、(五十四)讲成本与吞吐调优,都偏「架构与成本」。本篇往内核里再钻一层:一个推理引擎(vLLM、TensorRT-LLM、SGLang 之类)到底怎么把一次请求变成显存里的 KV Cache、怎么调度 token、怎么不浪费显存。这是面试「部署优化」这条线的硬核题,也是华为多模态 LLM 岗现场写代码/画架构高频考点。
Lucy-Fintech社区
5 个月前
大语言模型
·
gemma
·
ai部署
·
显存管理
Gemma-3-12b-it显存精细化管理实战:动态释放+缓存清理自动化脚本
如果你正在本地运行像Gemma-3-12b-it这样的大模型,可能已经遇到了一个头疼的问题:显存不够用。刚开始对话时一切正常,但随着对话轮次增加,或者处理了几张图片后,程序开始报错,提示显存不足,甚至直接崩溃。
我是有底线的