阿里云部署qwen 大模型从0-1,第2步:阿里云平台创建ubuntu实例

1、登录阿里云平台

搜索 云服务器 ECS,

注意创建的实例要扣钱的,完全不用注销

1、ecs 是什么

ECS = Elastic Compute Service,阿里云弹性云服务器 通俗讲:就是阿里云给你开一台虚拟机电脑,你远程登录上去用。

  • ecs.gn7i-c8g1.2xlarge 是这台虚拟机的规格名字
  • 它里面虚拟出来:8 核 CPU、30G 内存、绑定 1 块 A10 显卡
  • 本质:在阿里云物理服务器上虚拟化出来的机器,你拿到的是独立系统,可以装 python、cuda、跑模型。

2、BF16 是什么(重点,和你跑模型显存强相关)

BF16 = Brain Float 16,16 位脑浮点数 ,是一种数字存储格式,用来存大模型权重。

大模型里面所有参数,本质就是一大堆小数;不同格式,占用存储空间不一样,精度略有差别。

三种最常用格式对比

  1. FP32(32 位单精度) 1 个参数占 4 字节。1B 参数≈4GB 显存。
  • 精度最高,显存消耗巨大,推理基本不用。
  1. FP16(半精度) 1 个参数占 2 字节。1B 参数≈2GB 显存。 老显卡(T4)支持。
  2. BF16(Brain Float16) 1 个参数也是占 2 字节,1B 参数≈2GB 显存 ✅ A10 显卡原生完美支持 BF16!
  • 和 FP16 占用显存一样大;但数值范围更大,跑大模型不容易溢出、报错。
  • 现在 Qwen、DeepSeek 这类新模型,推荐优先用 BF16 推理

一句话区分: BF16 / FP16 都是 16bit,显存占用一样;BF16 更适合 LLM 大模型,A10 显卡跑模型优先开 BF16。

INT8、INT4:是整数量化,占用显存更少(1B 参数对应 1GB / 0.5GB),会轻微损失模型回答精度。

1.5B 是什么

B = Billion,十亿 1.5B = 1.5 Billion = 15 亿参数 Qwen2.5-1.5B-Instruct,意思就是:这个大模型一共有 15 亿个参数

Qwen2.5-1.5B,BF16 加载: 1.5B × 2 字节 = 约 3GB 显存。 对比 FP32 需要 6GB(每个参数占用4个字节),直接省一半显存。

0.6B:6 亿参数(你的 Embedding 向量模型,很小)

  1. Qwen3.5-0_8B(主问答大模型,0.8B = 8 亿参数)
  • BF16 半精度:8 亿 ×2 字节 ≈ 1.6GB 显存
  • INT4 量化:仅约 0.4GB 显存 👉 比咱们之前看的 1.5B 更小!A10 的 24G 显存轻轻松松,加载飞快,推理速度更快,非常适合比赛。
  1. Qwen3-Embedding-0_6B(向量嵌入模型,0.6B=6 亿参数)
  • BF16:约 1.2GB 显存
  • INT4:0.3GB 显存

模型需要的内存 cpu 和 gpu 大小推荐

Qwen3.5-0_8B(主问答大模型,0.8B = 8 亿参数)

  • BF16 半精度:8 亿 ×2 字节 ≈ 1.6GB 显存
  • INT4 量化:仅约 0.4GB 显存

✅ 两个模型一起加载(BF16),总共也就2.8GB 显存

FAISS 向量检索(你比赛指定faiss-cpu,检索全部在 CPU 内存跑,不吃显存,吃内存 + CPU

**推荐:**8 vCPU + 30G 内存,8g 显存,

相关推荐
峥嵘life1 小时前
2026华为AI码道 CodeArts 使用分享:Windows端 + 服务器CLI 实战总结
android·大数据·开发语言·python
贝猫说python1 小时前
阿里云部署qwen 大模型从0-1,第3步:阿里云服务器上部署大模型
python
少陽君1 小时前
服务器服务检查报告
python
x秀x1 小时前
sam3新手使用教程
开发语言·python
Java后端的Ai之路1 小时前
大模型LLM评估完全指南
开发语言·人工智能·python·llm·评估
外收内放1 小时前
Python学习记录25(基础知识终结篇)
python·学习
别动我齐刘海1 小时前
ROS2 Jazzy + C++ 实战路线——基础学习1
c++·vscode·python·ubuntu·机器学习·自动驾驶·github
life码农1 小时前
python框架Flask多语言配置示例
python·flask
苏离~Hack1 小时前
SL-crawler:一个可视化配置的通用网页与 API 数据采集工具
python