【vLLM 源码解析】BeamSearch

原理

Beam Search(束搜索)是一种在序列生成任务中常用的搜索算法,用于在每一步生成时平衡计算效率和结果质量文字。

主要作用:

  1. 减少搜索空间(相对于贪心搜索而言)
    • 在序列生成(如机器翻译、文本生成、语音识别)时,如果每一步都保留所有可能的候选词(穷举搜索),计算量将指数增长。
    • Beam Search 在每一步只保留 top-k(k 称为 beam size)个最有可能的候选序列,大幅降低计算负担。
  2. 近似最优解
    • 它并不是穷举所有路径(那样保证全局最优,但计算不可行),而是用局部贪心扩展结合一定宽度搜索,得到一个接近最优的序列。
  3. 平衡生成质量与速度
    • Beam Size 越小,速度越快,但可能错过更好的序列。
    • Beam Size 越大,质量通常更好(更接近穷举搜索),但计算越慢。

工作流程

假设 beam_size = 2,生成句子:

  1. 从起始符开始,第一步模型输出每个词的概率,保留概率最高的 2 个词(如 A, B)。
  2. 对于这 2 个候选词,分别预测下一个词的概率,这时会得到 2 × V 种可能(V 是词表大小)。
  3. 从这 2 × V 个候选序列(长度为 2)中,选择总概率(或对数概率之和)最高的 2 个继续扩展。
  4. 重复直到遇到结束符,最后从 beam 中选择分数最高的序列输出。

vLLM 实现

beamsearch 可视化:https://huggingface.co/spaces/m-ric/beam_search_visualizer

python 复制代码
if __name__ == '__main__':
    llm = LLM(model="facebook/opt-125m")
    params = BeamSearchParams(beam_width=2, max_tokens=50)
    prompts = [
        TextPrompt(prompt="The future of artificial intelligence")
    ]
    outputs = llm.beam_search(prompts, params)

    for output in outputs:
        generated_text = output.sequences[0].text
        print(f"Generated text: {generated_text!r}")

参数含义:

max_tokens: 迭代次数:for range(max_token)

beam_width: 束宽度。有下面两个作用:

  1. 针对每个输入,限制模型推理保留 top 2*beam_width 的 token;

  2. 控制每次迭代需要参与推理的 token 数量;

自回归阶段 promot = "`The future of artificial intelligence`"

item prefill decode
input_ids (token_id) 2, 133, 499, 9, 7350, 2316, 0, 0 13
positions 0, 1, 2, 3, 4, 5, 0, 0
logits_indices 5 0
hidden_states = model_output = tensor(8, 768) = model_output = tensor(1, 768)
sample_hidden_states = hidden_stateslogits_indices = tensor(1, 768) = hidden_stateslogits_indices = tensor(1, 768)
logits tensor(1, 50257) tensor(1, 50257)

GPUModelRunner._update_states()更新后的状态(input_batches)会被 _prepare_inputs 函数使用(更新 input_ids),以创建模型所需的GPU张量输入。这是GPU模型运行器中状态管理和输入准备的关键连接点。

未使用 beam_search : sampling_metadata.max_num_logprobs = None

使用 beam_search: sampling_metadata.max_num_logprobs = 10

相关推荐
circuitsosk8 小时前
平台整体能力与功能特性设计:分群、联运、ABTest与运营位系统
python·机器学习·搜索引擎·ab测试·vllm·rag检索
shxjnpl2 天前
Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录
人工智能·pytorch·vllm
SLD_Allen2 天前
大模型推理引擎架构深度解析:vLLM、SGLang与TensorRT-LLM的技术路线对决
架构·vllm·sglang
SunnyRivers4 天前
vllm内存优化技巧
vllm·内存调优
奔跑中的小象6 天前
UOS V2500 沐曦mx-exporter监控加速卡(非K8S)
grafana·prometheus·uos·vllm·沐曦
陈 洪 伟6 天前
大模型推理引擎vLLM(30):由一个GLM5 bug,整理MLP中的SwiGLU、算子融合、量化相关问题
bug·mlp·vllm
花无缺pize6 天前
vLLM框架:LLM推理的高效机制
服务器·人工智能·vllm
Briwisdom7 天前
MoE 推理优化实战——从“瓶颈罗列“到“性能调优“
gemm·vllm·moe·decode·prefill
Briwisdom8 天前
LLM 推理引擎三强争霸——vLLM vs SGLang vs TensorRT-LLM
tensorrt·vllm·推理引擎·sglang