大模型推理优化面试题

1、vllm推理

vLLM 的推理分为 Prefill 和 Decode 两个阶段。

Prefill 会并行处理整个 Prompt,完成 Transformer 前向计算,并为每层生成 KV Cache。最后根据 Prompt 最后一个位置的 logits 采样出第一个输出 token。这个阶段包含大量 GEMM,计算密度较高,所以通常是 compute-bound,主要看 GPU 的 Tensor Core 算力。对于超长上下文,Attention 的二次复杂度也会成为瓶颈。

Decode 从第一个输出 token 开始自回归生成。每一轮输入最新 token,复用历史 KV Cache,再生成下一个 token。由于每轮只处理少量 token,却需要读取大量模型权重和不断增长的 KV Cache,所以通常是 memory-bound,主要受 HBM 显存带宽限制。

TTFT 指请求到达后,客户端收到第一个输出 token 的时间,大致可以拆成:

TTFT = 预处理 + 排队调度 + Prefill + 首次采样 + 传输

优化 TTFT,我会先通过监控确认时间花在排队、Prefill 还是返回链路,然后分别处理。

第一,减少输入 token,例如压缩历史对话和 RAG 文档;多模态模型还可以减少图片数量、分辨率和视频帧数。

第二,对重复的 system prompt、工具定义或公共文档启用 Prefix Caching,复用已有 KV Cache。它要求前缀 token 完全一致,而且首次请求没有收益。

第三,高并发时降低排队和阶段间干扰。可以调整并发量、max_num_batched_tokensmax_num_seqs,使用 Chunked Prefill,或者做 Prefill/Decode 分离。Chunked Prefill 能缓解长 Prompt 的队头阻塞,但分块过小可能增加单请求 TTFT。

第四,提高 Prefill 本身的执行效率,例如使用更小或低精度模型、高效 Attention kernel、更强硬件,以及合理的 Tensor Parallel。并行度过高也会引入通信开销,需要实测。

2、xprofiler工具

昆仑芯推出的性能采集工具,用于采集应用运行期间的 XPU 执行轨迹;导出的 Trace 文件通过 Perfetto 进行可视化和 SQL 分析,以定位性能瓶颈

它的核心作用是回答:

推理任务的时间到底消耗在了哪里?

例如:

复制代码
XPU 计算
Kernel 执行
Cluster/SDNN 运算
数据搬运和 DMA
Stream 等待
多卡同步
Kernel 下发间隔
设备负载不均
显存带宽使用

典型使用流程是:

复制代码
启动 XProfiler
→ 运行推理程序或发送推理请求
→ XProfiler 记录 CPU/XPU 活动
→ 导出 Trace JSON
→ 使用 Perfetto 查看时间线
→ 统计和定位性能瓶颈

最常用的 time 模式命令是:

复制代码
/usr/local/xpu/profiler/xprofiler \
  --xpu=all \
  --time=60 \
  --resolution-interval=500 \
  --export-profile=/实际路径/trace.json

XProfiler 有三种运行模式:

复制代码
fork

由 XProfiler 启动一次性程序,记录程序从启动到退出的全过程。

复制代码
time

记录已经运行的服务在指定时间窗口内的活动,适合 SGLang 这类常驻推理服务。

复制代码
deamon

由业务代码调用 profiler start/stop,只记录指定代码片段。

相关推荐
程序猿编码2 天前
告别改源码适配模型:纯 C++ 可配置 LLM 推理引擎,全格式全结构兼容
c++·大模型·llm·推理引擎
蔡俊锋2 天前
华为昇腾 960 超节点发布:4096 卡、5500 个光引擎替 4.8 万光模块——国产算力拐点到了吗?
大模型·模型部署·ai架构·国产算力·华为昇腾
O。O蛋黄酥啊2 天前
Claude Code 记忆机制全拆解:Auto Memory 与 CLAUDE.md 双轨解析
大模型·agent·memory·claude·codex·记忆
BlackStar_L2 天前
第二章 上下文工程
大模型·llm·agent
User_芊芊君子2 天前
让 Claude Code 换上国产大脑:蓝耘元生代上 GLM-5.2 / DeepSeek / Qwen 模型横评实测
人工智能·ai·大模型
寻道码路2 天前
大模型工程化实战(十二):RAG 数据工程底座——采集到入库流水线(离线+在线双链路)
大模型·知识库·rag·ai工程化·llmops`·数据工程底座·文档采集
Web3&Basketball2 天前
CRM Agent 后训练实战:3 倍更少错误
python·架构·大模型·agent·推理
蚁小二官方2 天前
AI 安全治理框架更新|大模型训练数据合规,企业实操落地思路
大模型·数据合规·ai安全
AI模力圈2 天前
On-Policy Distillation:原理、变体与工程实现解析
大模型·强化学习·知识蒸馏
长谷深风1113 天前
根因定位:三步隔离法破解AIBadcase
人工智能·ai·大模型·retrieval·ai智能体·aiagent·aibadcase