技术栈
弹性扩缩容
thesky123456
5 天前
大模型
·
mig
·
超分
·
mps
·
gpu池化
·
弹性扩缩容
·
弹性推理
27届大模型面试准备(九十四):大模型弹性推理与GPU资源池化工程——GPU池化/虚拟化复用/弹性扩缩/显存碎片整理
本文是 A 系列第 94 篇。前面 A71 讲了多租户 GPU 虚拟化与推理隔离,A66 讲了请求级的推理调度与弹性扩缩容,A92 讲了单卡显存与算力极致优化。本文把视角从"单卡/单实例"拉到"一池 GPU":如何把一堆异构、散落在不同机器的 GPU,抽象成一个统一资源池,按需切分、弹性伸缩、并持续做碎片整理,让昂贵的卡不再空转。
thesky123456
21 天前
大模型
·
抢占
·
连续批处理
·
推理调度
·
请求优先级
·
弹性扩缩容
·
chunked prefill
27届大模型面试准备(六十六):大模型推理调度与弹性扩缩容工程——排队、优先级、抢占与弹性
前面(五十九)讲了推理引擎内核、(五十四)讲了成本与吞吐、(六十一)讲了可观测性。本文站在它们之上讲"调度层":当一堆请求涌进来,引擎内部怎么排队、怎么决定谁先跑、GPU 不够了怎么弹性扩缩、高优请求怎么不被长尾拖死。这是推理服务从"能跑"到"生产级稳"的关键一跳。
我是有底线的