技术栈

弹性扩缩容

thesky123456
43 分钟前
大模型·抢占·连续批处理·推理调度·请求优先级·弹性扩缩容·chunked prefill
27届大模型面试准备(六十六):大模型推理调度与弹性扩缩容工程——排队、优先级、抢占与弹性前面(五十九)讲了推理引擎内核、(五十四)讲了成本与吞吐、(六十一)讲了可观测性。本文站在它们之上讲"调度层":当一堆请求涌进来,引擎内部怎么排队、怎么决定谁先跑、GPU 不够了怎么弹性扩缩、高优请求怎么不被长尾拖死。这是推理服务从"能跑"到"生产级稳"的关键一跳。
我是有底线的