本文基于八股精2025-2026 年约 355 条 AI部署与MLOps 方向的真实面试记录,梳理了字节跳动、腾讯、快手、百度、京东、Shopee 虾皮等公司在大模型部署与推理优化岗位的考察侧重,并附上各家的高频真题示例,供备战该方向的求职者参考。

一、整体图景:这个方向到底在考什么?
先说一个直观的观察:在样本覆盖的几家公司里,"大模型推理 + KV Cache + 推理加速 + vLLM"几乎是共同的主线。无论是题量最多的字节跳动,还是样本较少的虾皮,常考知识点里都反复出现这几个词。
换句话说,如果你目标是 AI 部署/MLOps 岗位,推理优化不是"加分项",而是"入场券"。差异主要体现在各家往哪个方向延伸:
- 字节、腾讯:偏重 vLLM/PagedAttention 的原理级理解,以及并发调用、线上线下效果差异等工程与业务结合的问题;
- 快手、京东:偏重资源受限场景下的实操------小显存跑大模型、OOM 怎么救、TensorRT 加速原理;
- 百度:除了推理效率,还会下探到 CUDA 内存结构这类底层知识,并关注模型漂移;
- 虾皮:样本较少(代表题量 3),但题目集中在低延迟架构、连续批处理、Ray 分布式调度,偏基础架构视角。
下面按代表题量从多到少逐家拆解。
二、分公司考察解读
1. 字节跳动(代表题量 31)
核心结论:题量断层领先的样本大户,考察重心在"大模型线上服务的效率问题",且明显偏爱 vLLM 与 KV Cache 的原理级追问,同时兼顾模型评估与选型。
常考知识点:模型评估、大模型推理、KV Cache、推理加速、边缘计算、模型优化、AI模型部署、模型选择。
真题示例:
- 线上部署大模型提供服务,推理速度和吞吐量是瓶颈。vLLM 这类工具主要通过什么核心思想(如 PagedAttention)解决 KV Cache 的内存问题,从而提升推理效率?
- vLLM 实现推理加速的原理、收益和代价分别是什么?
- 调用 LLM 时为什么要采用多线程、并发的方式?LLM 调用过程中是否存在并发场景?
避坑/得分点 :注意第 2 题问的是"原理、收益和代价 "三段式------很多人只答得出 PagedAttention 减少显存碎片、提升吞吐,却答不出代价(如实现复杂度、对某些场景的调度开销、批处理带来的单请求延迟权衡)。另外字节的知识面里出现了"模型评估""模型选择""边缘计算",说明它不只考纯推理,部署前的选型判断和部署形态(云端 vs 边缘)也在射程之内。
2. 腾讯(代表题量 22)
核心结论:与字节高度同源(vLLM、KV Cache、PagedAttention 高频出现),但腾讯更进一步,喜欢考"真实线上问题排查"和"离线指标与线上效果不一致"这类工程判断题。
常考知识点:vLLM、大语言模型部署、大模型推理、KV Cache、PagedAttention、推理加速、并发编程、大语言模型调用。
真题示例:
- vLLM 的核心优势是什么?它如何通过 PagedAttention 提升显存利用率?
- 若提问时传输的数据量较大(超过 10KB)导致后端接口无法接收,如何解决?解决后如何进一步提高响应速度?
- 推荐模型 A 和 B,离线实验中 A 指标更优,但上线后 A 实际效果比 B 差,分析可能的原因。
避坑/得分点 :第 2 题是很典型的"场景 troubleshooting"------接口体大小限制、压缩/分片传输、异步化、流式返回等都是可谈的方向,考察的是你有没有真的维护过线上服务 。第 3 题则是 MLOps 的经典命题:离线/线上特征不一致、数据分布漂移、线上线下评估口径不同、线上存在位置/选择偏差等都可能导致"离线赢、线上输"。能系统列出排查思路,比背出一个"标准答案"更能得分。
3. 快手(代表题量 17)
核心结论:推理优化主线之外,快手的问题明显更"接地气"------资源受限怎么办、数据质量怎么把关,考的是有限条件下的工程落地能力。
常考知识点:vLLM、推理加速、内存优化、低延迟服务架构、大模型推理、KV Cache、PagedAttention、边缘计算。
真题示例:
- 假设只有一台普通 PC 需要运行模型推理,有哪些方法可以优化推理速度?
- 模型训练数据上线前,你通常从哪些角度进行质量检验?采用了哪些自动化手段或人工规则?
- 如何将参数规模较大的模型部署在显存有限的环境下?
避坑/得分点 :第 1、3 题本质是同一类问题的两种问法------量化(INT8/INT4)、剪枝、蒸馏、算子融合、KV Cache 优化、模型并行/分片加载(如 CPU offload) ,这些手段要能按"精度损失从小到大"排出优先级并结合场景取舍。第 2 题提醒我们:快手的考察并不局限于推理侧,数据质量检验(分布检查、去重、脏数据规则、人工抽检流程)也是 MLOps 岗位的实打实考点,准备时别只盯着 vLLM。
4. 百度(代表题量 11)
核心结论:既考推理效率的常规题,也会下探到 CUDA 内存结构这类底层硬件知识,是几家中"最偏底层"的一家;同时关注模型漂移与线上线下差异。
常考知识点:vLLM、大模型推理、KV Cache、推理加速、并发编程、大语言模型调用、模型漂移、线上线下差异。
真题示例:
- 如果要将 LLM 部署到在线系统中,该如何解决推理效率问题?
- 请介绍 CUDA 的内存结构。
- 大模型推理场景下常见的资源瓶颈有哪些?
避坑/得分点 :第 2 题的 CUDA 内存结构(全局内存、共享内存、常量内存、寄存器、L1/L2 缓存的层次与访问速度差异)属于硬件层知识,纯应用背景的候选人最容易在这里卡壳 。第 3 题的"资源瓶颈"建议按 显存带宽(memory-bound)、算力(compute-bound)、KV Cache 占用、批处理调度 分层回答------Decode 阶段通常是访存瓶颈,这是很多人答不出的细节。另外百度知识点中出现了"模型漂移",与腾讯的线上线下差异题呼应,监控与再训练机制值得单独准备。
5. 京东(代表题量 11)
核心结论:题量与百度持平,但风格更"硬核实操"------直接给你 OOM 现场让你救火,还会问 TensorRT 底层优化原理和技术选型对比。
常考知识点:AI模型部署、推理加速、大模型推理、KV Cache、vLLM、并发编程、大语言模型调用、内存溢出。
真题示例:
- 请列举优化显存占用的常用方法。如果用 8 张 A100 训练 32B 参数模型出现 OOM,该如何解决?
- 你了解 TensorRT 的加速原理吗?它底层做了哪些优化,为什么算子融合之后能够提升推理速度?
- 本地部署模型相比调用 API 有什么优缺点?
避坑/得分点 :第 1 题的 OOM 排查有清晰的答题框架------混合精度、梯度检查点(activation checkpointing)、ZeRO/FSDP 分片优化器状态、减小 batch size + 梯度累积、并行策略调整 ,按"先省激活值、再省优化器状态、最后调并行"的顺序讲会非常有条理。第 2 题的算子融合,核心是减少 kernel launch 开销和显存读写往返 (中间结果留在寄存器/共享内存),能答到"访存次数下降"这一层才算真正理解。第 3 题是选型题,成本、数据隐私、可控性 vs 运维负担、弹性几个维度对比着说即可。
6. Shopee 虾皮(代表题量 3)
核心结论:样本较少,结论仅供参考,但三道题全部指向"低延迟 + 分布式调度",呈现出明显的基础架构(Infra)视角,与电商业务的实时性要求相吻合。
常考知识点:低延迟服务架构、推理性能优化、连续批处理、GPU利用率、分布式调度器、内存溢出处理。
真题示例:
- 连续批处理(Continuous Batching)如何提高 GPU 利用率?
- 如果线上 AI 服务对推理延迟有很高的要求,你会采用哪些方案进行优化?
- 请说明 Ray 的调度器结构,若单节点上发生 OOM,应如何处理?
避坑/得分点 :第 1 题的 Continuous Batching 与 vLLM 是天然关联的------传统静态批处理要等整批请求都生成完才释放,而连续批处理允许请求随到随进、完成即出,消除了批内长短请求互相等待造成的 GPU 空转 。第 3 题涉及 Ray 的分布式调度(GCS、Raylet、对象存储等组件),如果简历里写了 Ray/vLLM 分布式部署,这类追问几乎是必然的,务必能讲出自己实际用过的部分。
三、跨公司规律小结
把六家公司的数据放在一起看,可以得出几个有据可依的结论:
- vLLM / KV Cache / PagedAttention 是全行业级别的必考主线:字节、腾讯、快手、百度、京东的常考知识点中全部出现,虾皮的"连续批处理"也是 vLLM 的核心机制之一。这一块的原理必须吃透,而不是停留在"用过"。
- 并发编程与 LLM 调用出现在字节、腾讯、百度、京东四家:多线程/异步调用 LLM 的工程问题(为什么并发、并发场景在哪、大批量请求怎么处理)是第二梯队的高频考点。
- OOM / 显存优化是实操题的重灾区 :京东直接考 8×A100 训 32B 的 OOM,快手考小显存部署大模型,虾皮考 Ray 单节点 OOM------"显存不够怎么办"几乎人手一题。
- 线上线下差异 / 模型漂移是 MLOps 的"业务侧"考点:腾讯、百度、京东(本地 vs API 选型)都在考察你从离线实验走到线上服务的完整判断力。
- 底层知识存在公司差异 :百度考 CUDA 内存结构,京东考 TensorRT 算子融合------投递偏底层推理引擎的团队时,硬件与编译器层面的知识不能空白。
四、备考建议
-
把 vLLM 当成"一号工程"来准备:六家公司中五家的常考知识点直接包含 vLLM 或其核心机制。建议动手跑一次 vLLM 部署,能白板画出 PagedAttention 的分块显存管理示意,并能完整回答"原理---收益---代价"三段式(字节真题原话),同时理解 Continuous Batching 对 GPU 利用率的提升逻辑(虾皮真题)。
-
准备一套自己的"OOM 急救手册":从京东的 8×A100 训 32B OOM、快手的"大模型塞进小显存",到虾皮的 Ray 节点 OOM,显存问题反复出现。按训练侧(混合精度、梯度检查点、ZeRO/FSDP、batch 调整)和推理侧(量化、KV Cache 压缩、offload、模型分片)分别整理成清单,面试时按框架输出。
-
补齐底层短板:CUDA 内存层次 + 算子融合:百度考 CUDA 内存结构,京东考 TensorRT 加速原理。这两块知识点范围有限、性价比高------重点理解显存层级速度差异、算子融合减少 kernel launch 与访存的机制,以及 Decode 阶段 memory-bound 的本质。
-
准备"离线好、线上差"的分析框架:腾讯和百度的知识点里都出现了线上线下差异/模型漂移。从特征一致性、数据分布变化、评估口径、线上偏差、监控与再训练机制五个角度整理答案,再结合一个自己做过的项目实例,说服力会强很多。
-
别忽略数据质量与选型题:快手考了训练数据上线前的质量检验,京东考了本地部署 vs API 的优缺点。这类"软题"恰恰是区分候选人工程成熟度的地方,建议提前想好自己在数据校验(自动化规则 + 人工抽检)和技术选型(成本/隐私/可控性/运维)上的真实做法。
注:虾皮样本量仅 3 题,对其考察风格的判断置信度有限,备考优先级应放在字节、腾讯、快手等有更大样本支撑的公司上。
数据来源于八股精(AI部署与MLOps)约 355 条真实面试记录,覆盖 2025-2026;结论基于统计,仅供参考。