两张RTX 8000 运行大模型

降级 SGLang 到 0.1.9:0.1.9 版本内置的是 NCCL 2.18(与你系统的版本匹配,适配 Volta 架构);

降低NCCL版本尝试将NCCL降级到2.19.3(这是一个比较稳定的版本)

硬件层面:RTX 8000 是 2018 年发布的 Volta 架构 GPU,NCCL 从 2.20 版本开始大幅削减对 Volta 的支持,2.27.5 版本几乎完全移除了 Volta 相关的内核适配,导致初始化时直接段错误;

软件层面:SGLang 最新版的多卡张量并行(tp-size>1)模块硬编码调用 NCCL,即使指定 TORCH_DISTRIBUTED_USE_GLOO=1,也仅能让 PyTorch 分布式框架用 Gloo,但 SGLang 自身的设备通信层仍会调用 NCCL,无法绕过;

VLLM_USE_MODELSCOPE=true python3 -m vllm.entrypoints.openai.api_server

--model Qwen/Qwen2.5-32B-Instruct

--tensor-parallel-size 2 --dtype=half --port 8000

curl http://localhost:8000/v1/chat/completions

-H "Content-Type: application/json"

-d '{

"model": "Qwen/Qwen2.5-32B-Instruct",

"messages": [

{"role": "user", "content": "你好,请介绍一下自己"}

],

"temperature": 0.7,

"max_tokens": 1024

}'

python3 -c "

import torch, transformers, vllm

print(f'PyTorch版本: {torch.version }')

print(f'PyTorch CUDA: {torch.version.cuda}')

print(f'Transformers版本: {transformers.version }')

print(f'vLLM版本: {vllm.version }')

print(f'CUDA可用: {torch.cuda.is_available()}')

print(f'显卡数量: {torch.cuda.device_count()}')

"

PyTorch版本: 2.1.2+cu121

PyTorch CUDA: 12.1

Transformers版本: 4.41.0

vLLM版本: 0.3.0

CUDA可用: True

显卡数量: 2

相关推荐
m0_734571763 小时前
深入理解人工智能 chatGPT的软件架构
人工智能
飞塔老梅子3 小时前
09. Codex 节省Token ❀ 老梅子学AI
人工智能·ai·token·模型·codex
HyperAI超神经3 小时前
扰动实验+迁移学习,MIT团队推出IRIS,用「指纹」重建单细胞信号传导历史
人工智能·深度学习·机器学习·迁移学习
前沿在线3 小时前
启元机器人亮相外滩大会,探索个人机器人健康服务新场景
人工智能·ai·大模型
haishikeji696_3 小时前
现成无人机管理系统源码|支持私有化部署、二次开发、政企投标、自动机库对接
人工智能·无人机·低空经济·无人机管理系统·飞控管理系统
汇智信科3 小时前
煤矿视频智能分析系统:基于 AI 视觉实现井下安全隐患实时监测与闭环管控
人工智能
h78813943 小时前
录音容易纪要难?录音转文字 + AI 纪要实测,提升会议效率
人工智能·powerpoint
涛思数据(TDengine)3 小时前
从“极速算“到“知识沉淀“:工业 AI 实战直播(十三、十四期)
人工智能·时序数据库·tdengine·工业互联网·工业ai
Summer-Bright3 小时前
深度 | OpenAI 联合三星造芯:从模型层向底层算力延伸,AI 算力供应链开始重新洗牌
人工智能·ai·openai·芯片