27届大模型面试准备(七十一):多租户 GPU 虚拟化与推理隔离工程——MIG、MPS 与噪声邻居治理引言上篇(六十九)讲 Prefill-Decode 分离,把单卡算力按阶段拆开调度;(七十)讲网关层如何把请求路由到不同实例。本篇把视角再抬一层:当一张 A100/H100 要同时服务多个业务方(多租户)时,怎么在显存、算力、延迟三个维度做隔离与复用,既把卡利用率榨干,又不让某个租户的突发流量把别人的 P99 拖垮。这是华为云、大模型推理平台岗的高频题,也是面试里最容易区分"只会调 API"和"真做过平台"的分水岭。