2025-2026年AI部署与MLOps大厂面试高频问题

本文基于八股精2025-2026 年约 355 条 AI部署与MLOps 方向的真实面试记录,梳理了字节跳动、腾讯、快手、百度、京东、Shopee 虾皮等公司在大模型部署与推理优化岗位的考察侧重,并附上各家的高频真题示例,供备战该方向的求职者参考。


一、整体图景:这个方向到底在考什么?

先说一个直观的观察:在样本覆盖的几家公司里,"大模型推理 + KV Cache + 推理加速 + vLLM"几乎是共同的主线。无论是题量最多的字节跳动,还是样本较少的虾皮,常考知识点里都反复出现这几个词。

换句话说,如果你目标是 AI 部署/MLOps 岗位,推理优化不是"加分项",而是"入场券"。差异主要体现在各家往哪个方向延伸:

  • 字节、腾讯:偏重 vLLM/PagedAttention 的原理级理解,以及并发调用、线上线下效果差异等工程与业务结合的问题;
  • 快手、京东:偏重资源受限场景下的实操------小显存跑大模型、OOM 怎么救、TensorRT 加速原理;
  • 百度:除了推理效率,还会下探到 CUDA 内存结构这类底层知识,并关注模型漂移;
  • 虾皮:样本较少(代表题量 3),但题目集中在低延迟架构、连续批处理、Ray 分布式调度,偏基础架构视角。

下面按代表题量从多到少逐家拆解。


二、分公司考察解读

1. 字节跳动(代表题量 31)

核心结论:题量断层领先的样本大户,考察重心在"大模型线上服务的效率问题",且明显偏爱 vLLM 与 KV Cache 的原理级追问,同时兼顾模型评估与选型。

常考知识点:模型评估、大模型推理、KV Cache、推理加速、边缘计算、模型优化、AI模型部署、模型选择。

真题示例

  1. 线上部署大模型提供服务,推理速度和吞吐量是瓶颈。vLLM 这类工具主要通过什么核心思想(如 PagedAttention)解决 KV Cache 的内存问题,从而提升推理效率?
  2. vLLM 实现推理加速的原理、收益和代价分别是什么?
  3. 调用 LLM 时为什么要采用多线程、并发的方式?LLM 调用过程中是否存在并发场景?

避坑/得分点 :注意第 2 题问的是"原理、收益和代价 "三段式------很多人只答得出 PagedAttention 减少显存碎片、提升吞吐,却答不出代价(如实现复杂度、对某些场景的调度开销、批处理带来的单请求延迟权衡)。另外字节的知识面里出现了"模型评估""模型选择""边缘计算",说明它不只考纯推理,部署前的选型判断和部署形态(云端 vs 边缘)也在射程之内


2. 腾讯(代表题量 22)

核心结论:与字节高度同源(vLLM、KV Cache、PagedAttention 高频出现),但腾讯更进一步,喜欢考"真实线上问题排查"和"离线指标与线上效果不一致"这类工程判断题。

常考知识点:vLLM、大语言模型部署、大模型推理、KV Cache、PagedAttention、推理加速、并发编程、大语言模型调用。

真题示例

  1. vLLM 的核心优势是什么?它如何通过 PagedAttention 提升显存利用率?
  2. 若提问时传输的数据量较大(超过 10KB)导致后端接口无法接收,如何解决?解决后如何进一步提高响应速度?
  3. 推荐模型 A 和 B,离线实验中 A 指标更优,但上线后 A 实际效果比 B 差,分析可能的原因。

避坑/得分点 :第 2 题是很典型的"场景 troubleshooting"------接口体大小限制、压缩/分片传输、异步化、流式返回等都是可谈的方向,考察的是你有没有真的维护过线上服务 。第 3 题则是 MLOps 的经典命题:离线/线上特征不一致、数据分布漂移、线上线下评估口径不同、线上存在位置/选择偏差等都可能导致"离线赢、线上输"。能系统列出排查思路,比背出一个"标准答案"更能得分。


3. 快手(代表题量 17)

核心结论:推理优化主线之外,快手的问题明显更"接地气"------资源受限怎么办、数据质量怎么把关,考的是有限条件下的工程落地能力。

常考知识点:vLLM、推理加速、内存优化、低延迟服务架构、大模型推理、KV Cache、PagedAttention、边缘计算。

真题示例

  1. 假设只有一台普通 PC 需要运行模型推理,有哪些方法可以优化推理速度?
  2. 模型训练数据上线前,你通常从哪些角度进行质量检验?采用了哪些自动化手段或人工规则?
  3. 如何将参数规模较大的模型部署在显存有限的环境下?

避坑/得分点 :第 1、3 题本质是同一类问题的两种问法------量化(INT8/INT4)、剪枝、蒸馏、算子融合、KV Cache 优化、模型并行/分片加载(如 CPU offload) ,这些手段要能按"精度损失从小到大"排出优先级并结合场景取舍。第 2 题提醒我们:快手的考察并不局限于推理侧,数据质量检验(分布检查、去重、脏数据规则、人工抽检流程)也是 MLOps 岗位的实打实考点,准备时别只盯着 vLLM。


4. 百度(代表题量 11)

核心结论:既考推理效率的常规题,也会下探到 CUDA 内存结构这类底层硬件知识,是几家中"最偏底层"的一家;同时关注模型漂移与线上线下差异。

常考知识点:vLLM、大模型推理、KV Cache、推理加速、并发编程、大语言模型调用、模型漂移、线上线下差异。

真题示例

  1. 如果要将 LLM 部署到在线系统中,该如何解决推理效率问题?
  2. 请介绍 CUDA 的内存结构。
  3. 大模型推理场景下常见的资源瓶颈有哪些?

避坑/得分点 :第 2 题的 CUDA 内存结构(全局内存、共享内存、常量内存、寄存器、L1/L2 缓存的层次与访问速度差异)属于硬件层知识,纯应用背景的候选人最容易在这里卡壳 。第 3 题的"资源瓶颈"建议按 显存带宽(memory-bound)、算力(compute-bound)、KV Cache 占用、批处理调度 分层回答------Decode 阶段通常是访存瓶颈,这是很多人答不出的细节。另外百度知识点中出现了"模型漂移",与腾讯的线上线下差异题呼应,监控与再训练机制值得单独准备


5. 京东(代表题量 11)

核心结论:题量与百度持平,但风格更"硬核实操"------直接给你 OOM 现场让你救火,还会问 TensorRT 底层优化原理和技术选型对比。

常考知识点:AI模型部署、推理加速、大模型推理、KV Cache、vLLM、并发编程、大语言模型调用、内存溢出。

真题示例

  1. 请列举优化显存占用的常用方法。如果用 8 张 A100 训练 32B 参数模型出现 OOM,该如何解决?
  2. 你了解 TensorRT 的加速原理吗?它底层做了哪些优化,为什么算子融合之后能够提升推理速度?
  3. 本地部署模型相比调用 API 有什么优缺点?

避坑/得分点 :第 1 题的 OOM 排查有清晰的答题框架------混合精度、梯度检查点(activation checkpointing)、ZeRO/FSDP 分片优化器状态、减小 batch size + 梯度累积、并行策略调整 ,按"先省激活值、再省优化器状态、最后调并行"的顺序讲会非常有条理。第 2 题的算子融合,核心是减少 kernel launch 开销和显存读写往返 (中间结果留在寄存器/共享内存),能答到"访存次数下降"这一层才算真正理解。第 3 题是选型题,成本、数据隐私、可控性 vs 运维负担、弹性几个维度对比着说即可。


6. Shopee 虾皮(代表题量 3)

核心结论:样本较少,结论仅供参考,但三道题全部指向"低延迟 + 分布式调度",呈现出明显的基础架构(Infra)视角,与电商业务的实时性要求相吻合。

常考知识点:低延迟服务架构、推理性能优化、连续批处理、GPU利用率、分布式调度器、内存溢出处理。

真题示例

  1. 连续批处理(Continuous Batching)如何提高 GPU 利用率?
  2. 如果线上 AI 服务对推理延迟有很高的要求,你会采用哪些方案进行优化?
  3. 请说明 Ray 的调度器结构,若单节点上发生 OOM,应如何处理?

避坑/得分点 :第 1 题的 Continuous Batching 与 vLLM 是天然关联的------传统静态批处理要等整批请求都生成完才释放,而连续批处理允许请求随到随进、完成即出,消除了批内长短请求互相等待造成的 GPU 空转 。第 3 题涉及 Ray 的分布式调度(GCS、Raylet、对象存储等组件),如果简历里写了 Ray/vLLM 分布式部署,这类追问几乎是必然的,务必能讲出自己实际用过的部分。


三、跨公司规律小结

把六家公司的数据放在一起看,可以得出几个有据可依的结论:

  1. vLLM / KV Cache / PagedAttention 是全行业级别的必考主线:字节、腾讯、快手、百度、京东的常考知识点中全部出现,虾皮的"连续批处理"也是 vLLM 的核心机制之一。这一块的原理必须吃透,而不是停留在"用过"。
  2. 并发编程与 LLM 调用出现在字节、腾讯、百度、京东四家:多线程/异步调用 LLM 的工程问题(为什么并发、并发场景在哪、大批量请求怎么处理)是第二梯队的高频考点。
  3. OOM / 显存优化是实操题的重灾区 :京东直接考 8×A100 训 32B 的 OOM,快手考小显存部署大模型,虾皮考 Ray 单节点 OOM------"显存不够怎么办"几乎人手一题
  4. 线上线下差异 / 模型漂移是 MLOps 的"业务侧"考点:腾讯、百度、京东(本地 vs API 选型)都在考察你从离线实验走到线上服务的完整判断力。
  5. 底层知识存在公司差异 :百度考 CUDA 内存结构,京东考 TensorRT 算子融合------投递偏底层推理引擎的团队时,硬件与编译器层面的知识不能空白

四、备考建议

  1. 把 vLLM 当成"一号工程"来准备:六家公司中五家的常考知识点直接包含 vLLM 或其核心机制。建议动手跑一次 vLLM 部署,能白板画出 PagedAttention 的分块显存管理示意,并能完整回答"原理---收益---代价"三段式(字节真题原话),同时理解 Continuous Batching 对 GPU 利用率的提升逻辑(虾皮真题)。

  2. 准备一套自己的"OOM 急救手册":从京东的 8×A100 训 32B OOM、快手的"大模型塞进小显存",到虾皮的 Ray 节点 OOM,显存问题反复出现。按训练侧(混合精度、梯度检查点、ZeRO/FSDP、batch 调整)和推理侧(量化、KV Cache 压缩、offload、模型分片)分别整理成清单,面试时按框架输出。

  3. 补齐底层短板:CUDA 内存层次 + 算子融合:百度考 CUDA 内存结构,京东考 TensorRT 加速原理。这两块知识点范围有限、性价比高------重点理解显存层级速度差异、算子融合减少 kernel launch 与访存的机制,以及 Decode 阶段 memory-bound 的本质。

  4. 准备"离线好、线上差"的分析框架:腾讯和百度的知识点里都出现了线上线下差异/模型漂移。从特征一致性、数据分布变化、评估口径、线上偏差、监控与再训练机制五个角度整理答案,再结合一个自己做过的项目实例,说服力会强很多。

  5. 别忽略数据质量与选型题:快手考了训练数据上线前的质量检验,京东考了本地部署 vs API 的优缺点。这类"软题"恰恰是区分候选人工程成熟度的地方,建议提前想好自己在数据校验(自动化规则 + 人工抽检)和技术选型(成本/隐私/可控性/运维)上的真实做法。

注:虾皮样本量仅 3 题,对其考察风格的判断置信度有限,备考优先级应放在字节、腾讯、快手等有更大样本支撑的公司上。
数据来源于八股精(AI部署与MLOps)约 355 条真实面试记录,覆盖 2025-2026;结论基于统计,仅供参考。

相关推荐
嘿嘿-662 小时前
Windows 一键使用 GPT-6 Astra:Codex CLI 配置教程
java·人工智能·windows·gpt·chatgpt·web
冬奇Lab2 小时前
Code Agent 解剖(22):从零扩展——用 Markdown 写一个 Skill
人工智能
小饕2 小时前
llama.cpp 参数调优指南:Jetson 8GB 实战手记
人工智能·llama·大模型端侧部署
火山引擎开发者社区2 小时前
Viking AI 搜索 × SearchCLI:搭建售后助手,让搜索能力参与售后回答
人工智能
冬奇Lab2 小时前
一天一个开源项目(第210篇):herdr - AI 编程 Agent 的运行时底座
人工智能·开源·资讯
dadanhuang2 小时前
PyTorch深度学习与实践【04】【迭代周期、autograd、构建计算图、*params参数解包、.grad属性】
人工智能·pytorch·深度学习
JavaPub-rodert2 小时前
LangChain 从入门到 Agent 实战:用 Python 搭建一个真正能调用工具和知识库的 AI 助手
人工智能·python·langchain
米小虾2 小时前
告别逐 token 蹦字:扩散语言模型(dLLM)到底能不能终结自回归?
人工智能·llm
火山引擎开发者社区2 小时前
从多模态数据湖到 Agent 湖:Lance 的格式设计与实践|Lance Meetup 火热报名中
人工智能