【vLLM 源码解析】BeamSearch

原理

Beam Search(束搜索)是一种在序列生成任务中常用的搜索算法,用于在每一步生成时平衡计算效率和结果质量文字。

主要作用:

  1. 减少搜索空间(相对于贪心搜索而言)
    • 在序列生成(如机器翻译、文本生成、语音识别)时,如果每一步都保留所有可能的候选词(穷举搜索),计算量将指数增长。
    • Beam Search 在每一步只保留 top-k(k 称为 beam size)个最有可能的候选序列,大幅降低计算负担。
  2. 近似最优解
    • 它并不是穷举所有路径(那样保证全局最优,但计算不可行),而是用局部贪心扩展结合一定宽度搜索,得到一个接近最优的序列。
  3. 平衡生成质量与速度
    • Beam Size 越小,速度越快,但可能错过更好的序列。
    • Beam Size 越大,质量通常更好(更接近穷举搜索),但计算越慢。

工作流程

假设 beam_size = 2,生成句子:

  1. 从起始符开始,第一步模型输出每个词的概率,保留概率最高的 2 个词(如 A, B)。
  2. 对于这 2 个候选词,分别预测下一个词的概率,这时会得到 2 × V 种可能(V 是词表大小)。
  3. 从这 2 × V 个候选序列(长度为 2)中,选择总概率(或对数概率之和)最高的 2 个继续扩展。
  4. 重复直到遇到结束符,最后从 beam 中选择分数最高的序列输出。

vLLM 实现

beamsearch 可视化:https://huggingface.co/spaces/m-ric/beam_search_visualizer

python 复制代码
if __name__ == '__main__':
    llm = LLM(model="facebook/opt-125m")
    params = BeamSearchParams(beam_width=2, max_tokens=50)
    prompts = [
        TextPrompt(prompt="The future of artificial intelligence")
    ]
    outputs = llm.beam_search(prompts, params)

    for output in outputs:
        generated_text = output.sequences[0].text
        print(f"Generated text: {generated_text!r}")

参数含义:

max_tokens: 迭代次数:for range(max_token)

beam_width: 束宽度。有下面两个作用:

  1. 针对每个输入,限制模型推理保留 top 2*beam_width 的 token;

  2. 控制每次迭代需要参与推理的 token 数量;

自回归阶段 promot = "`The future of artificial intelligence`"

item prefill decode
input_ids (token_id) 2, 133, 499, 9, 7350, 2316, 0, 0 13
positions 0, 1, 2, 3, 4, 5, 0, 0
logits_indices 5 0
hidden_states = model_output = tensor(8, 768) = model_output = tensor(1, 768)
sample_hidden_states = hidden_stateslogits_indices = tensor(1, 768) = hidden_stateslogits_indices = tensor(1, 768)
logits tensor(1, 50257) tensor(1, 50257)

GPUModelRunner._update_states()更新后的状态(input_batches)会被 _prepare_inputs 函数使用(更新 input_ids),以创建模型所需的GPU张量输入。这是GPU模型运行器中状态管理和输入准备的关键连接点。

未使用 beam_search : sampling_metadata.max_num_logprobs = None

使用 beam_search: sampling_metadata.max_num_logprobs = 10

相关推荐
鬓戈2 天前
Qwen3.8-27B + vLLM 性能优化
人工智能·性能优化·vllm
昇腾知识体系2 天前
vLLM-Ascend 支持矩阵:supported_models 模型列表、BF16/ACLGraph 支持项核对方法
人工智能·华为·知识图谱·vllm
Είναι η κοπέλα3 天前
本地大模型部署完全指南:Ollama / vLLM / llama.cpp / MLX 四大引擎横评与选型实战
macos·llama·vllm
零依赖极客3 天前
Day 6·1 ARMv8.2 dotprod——vdotq_s32 一条指令做 4 个点积
c语言·开发语言·人工智能·矩阵·arm·vllm
Albart5754 天前
大模型无限循环输出、重复生成文本:参数层面规避幻觉输出实战
大模型·llm·vllm·大模型推理·幻觉·重复输出
早睡早起身体好1235 天前
用 XGrammar 约束大模型工具调用:解决参数为空的问题
android·人工智能·神经网络·机器学习·自然语言处理·vllm
basketball6168 天前
AI Infra 推理部署技术总结:2. vLLM 内核——PagedAttention 与调度器原理
android·人工智能·vllm·ai infra
CV-杨帆10 天前
在自己的服务器上搭建VLLM 以Qwen3.5-0.8B与Qwen3.5-4B为模型基础
运维·服务器·vllm