sglang 部署Qwen2VL7B,大模型部署,速度测试,深度学习

sglang

项目github仓库:

https://github.com/sgl-project/sglang

项目说明书:

https://sgl-project.github.io/start/install.html

资讯:

https://github.com/sgl-project/sgl-learning-materials?tab=readme-ov-file#the-first-sglang-online-meetup

快得离谱:

外链图片转存中...(img-E3n1Ivz9-1731913508383)

图来源:https://lmsys.org/blog/2024-09-04-sglang-v0-3/

Docker使用:

bash 复制代码
docker run --gpus device=0 \
    --shm-size 32g \
    -p 30000:30000 \
    -v /root/xiedong/Qwen2-VL-7B-Instruct:/Qwen2-VL \
    --env "HF_TOKEN=abc-1234" \
    --ipc=host \
    -v /root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4:/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4 \
    lmsysorg/sglang:latest \
    python3 -m sglang.launch_server --model-path /Qwen2-VL --host 0.0.0.0 --port 30000 --chat-template qwen2-vl --context-length 8192 --log-level-http warning

启动成功:

接口文档:

http://101.136.22.140:30000/docs

速度测试代码

bash 复制代码
import time
from openai import OpenAI

# 初始化OpenAI客户端
client = OpenAI(api_key='YOUR_API_KEY', base_url='http://0.0.0.0:30000/v1')

# 定义图像路径
image_paths = [
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo256.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo512.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo768.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo1024.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo1280.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo2560.jpeg"
]

# 设置请求次数
num_requests = 10

# 存储每个图像的平均响应时间
average_speeds = {}

# 遍历每张图片
for image_path in image_paths:
    total_time = 0

    # 对每张图片执行 num_requests 次请求
    for _ in range(num_requests):
        start_time = time.time()

        # 发送请求并获取响应
        response = client.chat.completions.create(
            model="/Qwen2-VL",
            messages=[{
                'role': 'user',
                'content': [{
                    'type': 'text',
                    'text': 'Describe the image please',
                }, {
                    'type': 'image_url',
                    'image_url': {
                        'url': image_path,
                    },
                }],
            }],
            temperature=0.8,
            top_p=0.8
        )

        # 记录响应时间
        elapsed_time = time.time() - start_time
        total_time += elapsed_time

        # 打印当前请求的响应内容(可选)
        print(f"Response for {image_path}: {response.choices[0].message.content}")

    # 计算并记录该图像的平均响应时间
    average_speed = total_time / num_requests
    average_speeds[image_path] = average_speed

    print(f"Average speed for {image_path}: {average_speed} seconds")

# 输出所有图像的平均响应时间
for image_path, avg_speed in average_speeds.items():
    print(f"{image_path}: {avg_speed:.2f} seconds")

速度测试结果

sglang 测试结果:

Model 显存占用 (MiB) 分辨率 处理时间 (秒)
Qwen2-VL-7B-Instruct 70G 256 x 256 1.71
512 x 512 1.52
768 x 768 1.85
1024 x 1024 2.05
1280 x 1280 1.88
2560 x 2560 3.26

纯transformer,不用加速框架,我之前的测了一张图的速度是:5.22 seconds,很慢。

附录-vllm速度测试

启动:

bash 复制代码
docker run --gpus device=0 \
    -v /root/xiedong/Qwen2-VL-7B-Instruct:/Qwen2-VL \
    -v /root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4:/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4 \
    -p 30000:8000 \
    --ipc=host \
    vllm/vllm-openai:latest \
    --model /Qwen2-VL --gpu_memory_utilization=0.9 

代码:

bash 复制代码
import time
import base64
from openai import OpenAI

# 初始化OpenAI客户端
client = OpenAI(api_key='YOUR_API_KEY', base_url='http://0.0.0.0:30000/v1')

# 定义图像路径
image_paths = [
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo256.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo512.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo768.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo1024.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo1280.jpeg",
    "/root/xiedong/Qwen2-VL-72B-Instruct-GPTQ-Int4/demo2560.jpeg"
]

# 设置请求次数
num_requests = 10

# 存储每个图像的平均响应时间
average_speeds = {}

# 将图片转换为 Base64 编码的函数
def image_to_base64(image_path):
    with open(image_path, "rb") as img_file:
        return base64.b64encode(img_file.read()).decode('utf-8')

# 遍历每张图片
for image_path in image_paths:
    total_time = 0

    # 将图片转换为 Base64 编码
    image_base64 = image_to_base64(image_path)

    # 对每张图片执行 num_requests 次请求
    for _ in range(num_requests):
        start_time = time.time()

        # 发送请求并获取响应
        response = client.chat.completions.create(
            model="/Qwen2-VL",
            messages=[{
                'role': 'user',
                'content': [{
                    'type': 'text',
                    'text': 'Describe the image please',
                }, {
                    'type': 'image_url',
                    'image_url': {
                        'url': f"data:image/jpeg;base64,{image_base64}",  # 使用Base64编码的图片
                    },
                }],
            }],
            temperature=0.8,
            top_p=0.8
        )

        # 记录响应时间
        elapsed_time = time.time() - start_time
        total_time += elapsed_time

        # 打印当前请求的响应内容(可选)
        print(f"Response for {image_path}: {response.choices[0].message.content}")

    # 计算并记录该图像的平均响应时间
    average_speed = total_time / num_requests
    average_speeds[image_path] = average_speed

    print(f"Average speed for {image_path}: {average_speed} seconds")

# 输出所有图像的平均响应时间
for image_path, avg_speed in average_speeds.items():
    print(f"{image_path}: {avg_speed:.2f} seconds")

速度:

Model 显存占用 (MiB) 分辨率 处理时间 (秒)
Qwen2-VL-72B-Instruct-GPTQ-Int4 70G 256 x 256 1.50
512 x 512 1.59
768 x 768 1.61
1024 x 1024 1.67
1280 x 1280 1.81
2560 x 2560 1.97

https://www.dong-blog.fun/post/1856

相关推荐
JJJennie77710 小时前
当AI开始学会欺骗
网络·人工智能
糖果店的幽灵10 小时前
大模型测评DeepEval快速入门-安全与通用指标详解
人工智能·安全·langgraph·大模型测评·deepeval
江畔柳前堤16 小时前
roLabelImg 详细安装教程
开发语言·人工智能·后端·云原生
阿里云大数据AI技术16 小时前
分链路差异化设计的DSP准实时数仓|钛动科技基于阿里云实时计算 Flink 版 + DLF Paimon + EMR Serverless StarRocks 的实践
人工智能·flink
陕西企来客16 小时前
2026年7月AI智能搜索曝光趋势研判
大数据·人工智能·机器学习·ai智能搜索曝光
阿里云大数据AI技术17 小时前
从算力到智能体,面向 Agentic AI 的基础设施演进
人工智能·agent
hangyuekejiGEO17 小时前
GEO技术服务选型指南
大数据·人工智能·python
阿里云大数据AI技术18 小时前
EMR Serverless Spark AI Function 的双维降本实践
人工智能·sql·spark
维基框架18 小时前
GitHub源码处理提速 一趟扫描反而更慢
人工智能·github
冬奇Lab18 小时前
代码库知识库系列(05):向量检索 vs 知识图谱——加了调用图并没有变更好
人工智能