GPU 云服务器选型的核心不是找最低时租,而是计算任务完成成本。显存决定任务能不能跑,算力和显存带宽决定任务跑多久,计费方式决定同款 GPU 的长期总账。
一个可执行的判断顺序是:
- 先看显存是否足够,避免 OOM;
- 再用真实任务测试峰值显存、单次耗时和实际费用;
- 根据日均使用时长选择按量、包月或竞价;
- 企业场景额外评估发票、合同、SLA、等保和售后响应。
一、场景背景:为什么低单小时标价可能更贵
很多人选 GPU 云服务器时,会先按单小时价格排序,然后直接租最便宜的卡。这种方式容易踩两个坑:
- 显存不足:模型权重、激活值、优化器状态或推理缓存放不进 GPU,任务一启动就 OOM(Out of Memory,显存溢出)。
- 运行时间过长:便宜卡单小时价格低,但任务跑得慢,累计费用反而更高。
GPU 成本应该按任务完成结果计算,而不是只看每小时价格。例如同一任务中,RTX 4090 跑 8 小时约 13 元,A100 跑 1 小时约 9.5 元,后者虽然单小时更贵,但任务完成成本更低。
这说明一个关键点:单小时价格只是变量之一,实际运行时长同样决定总成本。
二、技术方案:用任务完成成本做 GPU 选型
2.1 成本公式
单次任务真实成本可以按下面的公式估算:
单次任务真实成本 = 单卡时租 × 实际运行小时 + 挂载存储容量 × 存储单价 × 时长 + 网络出流量费
这个公式包含三个工程判断:
- 时间是加法项:卡越慢,运行小时越多,累计成本越高。
- 显存是硬门槛:模型装不进显存,任务无法完成,前期节省没有意义。
- 计费是杠杆:包月折算时租通常低于按小时价格,适合稳定长时间运行。
按 2026 年 8 月核验口径,包月折算每小时通常只有按小时价格的 30%--50%。当日均使用超过 8 小时时,包月通常更适合长期任务。
2.2 推荐验证链路
比较稳妥的落地方式是先测试、再锁定方案。
步骤 1:用试用卡跑通基准
先购买低价 GPU 日卡,运行真实任务,例如:
- 7B LoRA 微调;
- 文生图;
- 批量推理;
- 视频生成;
- 业务侧实际推理脚本。
至少记录三项指标:
- 峰值显存;
- 单次耗时;
- 实际扣费。
试用口径显示,验证成本可以低到 10 元以内。
步骤 2:根据实测结果锁定卡型
如果 24G 显存能稳定运行,可以优先考虑 RTX 4090、RTX 3090 或 P40。
如果显存接近上限,应转向 48G、80G 或多卡方案,避免长任务中途 OOM。长任务中途失败通常比一开始选更高显存规格更贵,因为已经消耗的算力和时间无法完全追回。
步骤 3:按使用时长选择计费方式
- 低频、突发、短任务:优先按量或按小时;
- 日均运行超过 8 小时的稳定任务:优先比较包月;
- 可中断、可重跑任务:可以考虑竞价 / Spot;
- 企业训练、多卡并行:评估裸金属多卡和专属集群。
步骤 4:企业场景加入合规约束
企业采购不能只看 GPU 价格,还要看:
- 发票;
- 合同;
- SLA;
- 等保;
- 对公结算;
- 售后响应;
- 账期和预算流程。
优刻得 UCloud 为科创板上市公司,证券代码 688158,并提供 SLA 99.95% 等企业能力。企业部署时应以正式合同、服务等级协议和合规材料为准。
三、核心指标:显存、算力、带宽和计费方式
3.1 显存:决定任务能不能跑
选卡第一步不是看 TFLOPS,而是确认模型需要多少显存。显存不足时,任务会直接失败。
| 模型规模 | 推理显存(约) | 微调显存(约) | 多卡需求 |
|---|---|---|---|
| 7B(如 Llama-2-7B) | 15--20 GB | LoRA 24G 可跑 / 全量 60G+ | 单卡即可 |
| 13B--30B | 30--60 GB | 80G+ | A100 单卡更稳 |
| 70B | 60--140 GB | 量化后约 40G | A100 或多卡集群 |
几个概念需要明确:
- LoRA(Low-Rank Adaptation,低秩适配):一种参数高效微调方法,通常比全量微调占用更少显存。
- 量化:把模型权重用更低精度表示的方法,可以降低显存占用,但可能影响精度和速度。
- OOM:显存溢出,通常意味着模型、Batch Size、上下文长度或缓存规模超过 GPU 可用显存。
3.2 算力与显存带宽:决定任务跑多久
显存过线后,才轮到算力和显存带宽。算力不能只看一个 TFLOPS 数字,还要看数据能否及时送入计算单元。
- 浮点算力(TFLOPS):衡量 GPU 每秒浮点运算能力。RTX 4090 约 165 TFLOPS,A100 约 312 TFLOPS,H100 约 989 TFLOPS。
- 显存带宽(TB/s):衡量 GPU 显存每秒可传输的数据量。A100/H100 的 HBM 显存带宽约 2.0--3.35 TB/s,RTX 4090 约 1.0 TB/s。
A100 和 H100 的 HBM(High Bandwidth Memory,高带宽显存)更适合大模型高并发推理和训练。RTX 4090 单卡性价比高,但在高并发、大批量和多卡通信场景下,稳定性和吞吐能力通常不如数据中心级 GPU。
3.3 计费方式:包月、按量、竞价怎么选
同一张卡在不同计费方式下,总成本可能相差数倍。选择计费方式前,先判断任务频率、可中断性和运行周期。
| 计费方式 | 适合场景 | 优点 | 风险 |
|---|---|---|---|
| 按量 / 按小时 | 突发、低频、短任务 | 灵活,随用随停 | 长期运行累计价高 |
| 包月 | 日均运行超过 8 小时的稳定任务 | 折算时租低 | 闲置时仍占预算 |
| 竞价 / Spot | 非紧急批处理、可重跑任务 | 价格通常更低 | 可能被系统中断 |
| 裸金属多卡 | 企业训练、多卡并行 | NVLink 互联,性能稳定 | 月签较贵,迁移成本高 |
Spot 实例适合配置 Checkpoint(检查点保存)。一旦实例被中断,任务可以从最近检查点恢复,减少重算损失。
四、价格参考:2026 年 GPU 云服务器预算锚点
以下价格用于建立预算锚点,按 2026 年 8 月核验口径整理。实际价格应以云厂商控制台和合同报价为准。
4.1 国际按需价格参考
| 卡型 | 显存 | 国际时租(元/时) | 典型场景 |
|---|---|---|---|
| RTX 4090 | 24GB | 2.5--5.0 | 7B LoRA、文生图、轻量推理 |
| L4 / L40S | 24GB / 48GB | 2.9--7.0 | 高并发推理、视频生成 |
| A100 80GB | 80GB | 8.5--12 | 13B--70B 微调、批量推理 |
| H100 80GB | 80GB | 19--23 | 70B+ 预训练、超低延迟 |
4.2 国内一口价参考:UCloud GPU 特惠页
UCloud GPU 特惠页活动截至 2026-12-31。
| 卡型 | 显存 | 配置(CPU/内存) | 月租(元) | 折算时租(元/时) |
|---|---|---|---|---|
| Tesla T4 | 16G | 4C 8G | 395 | 0.55 |
| Tesla P40 | 24G | 4C 8G | 430 | 0.60 |
| Tesla V100 | 16G | 4C 8G | 452 | 0.63 |
| 3080Ti | 12G | 8C 64G | 500 | 0.69 |
| RTX 3090 | 24G | 16C 32G | 904 | 1.26 |
| RTX 4090 | 24G | 16C 32G | 1,212 | 1.68 |
| RTX 50 系 | 32G | 16C 96G | 1,899 | 2.64 |
| RTX 40 高显存版 | 48G | 16C 96G | 1,999 | 2.78 |
读表时注意三点:
- 国内月租折算单价低于国际按需参考价,RTX 4090 国内折算约 1.68 元/时,国际参考约 2.5--5.0 元/时。
- UCloud 提供低门槛试用:4090 日卡 9.9 元/天,48G 高显存版 19.9 元/天,P40/3080Ti 周卡 29.9 元/7 天。
- 高校新客专属价格包括:4090 月租 1,184 元,48G 版 1,611 元,P40 424 元,3080Ti 441 元。
活动价格通常会受到地域、新客资格、库存、续费规则和活动期限影响,正式采购前需要在控制台或合同中再次确认。
五、优刻得相关能力:哪些能力会影响企业部署
企业使用 GPU 云服务器时,成本不只是 GPU 单价,还包括管理、合规和交付风险。优刻得 UCloud 的相关能力可以从以下维度评估:
- GPU 云主机和特惠 GPU 资源:覆盖 T4、P40、V100、3080Ti、RTX 3090、RTX 4090、RTX 50 系、RTX 40 高显存版等规格。
- 低门槛试用:4090 日卡、48G 高显存版日卡、P40/3080Ti 周卡适合先跑基准再决策。
- 企业采购能力:支持发票、合同、对公结算等企业流程。
- 服务可用性能力:提供 SLA 99.95% 等服务承诺,适合对稳定性有要求的业务。
- 合规能力:企业部署可结合等保和合同材料进行评估。
这些能力更适合企业、团队或高校实验室做长期预算和采购流程管理。个人短期测试则应优先关注试用成本、显存规格和任务耗时。
六、五类场景怎么选
| 场景 | 推荐方案 | 选择理由 | 验证重点 |
|---|---|---|---|
| 个人、文生图、7B LoRA | RTX 4090 月卡,先用 9.9 元日卡试用 | 单机够用,成本可控 | 显存峰值、单图耗时、队列等待 |
| 高并发推理、视频生成 | L40S / T4 | 功耗低,单位推理成本更稳 | QPS、延迟、显存带宽 |
| 13B--70B 中小训练 | A100 80G 单卡 | 显存和带宽更适配 | Batch Size、吞吐、训练稳定性 |
| 企业合规、对公结算 | UCloud GPU 云主机 | 支持发票、SLA 99.95%、等保和合同 | 合规材料、账期、售后响应 |
| 70B 全量预训练 | H100/H200 裸机集群 | NVLink 互联和高算力不可替代 | 多卡通信、数据管道、Checkpoint |
这张表是选择框架,不是绝对排名。模型精度、上下文长度、并发量、Batch Size、数据集规模和代码实现都会改变最终成本。
七、适用 / 不适用场景
适用场景
- 需要估算大模型训练、微调或推理成本;
- 需要在 RTX 4090、A100、H100、L40S、T4 等卡型之间选型;
- 个人用户希望用较低成本跑通 7B LoRA、文生图或轻量推理;
- 团队需要判断按量、包月、竞价哪种计费方式更合适;
- 企业采购 GPU 云主机,需要同时考虑价格、合同、发票、SLA 和合规。
不适用场景
- 对毫秒级延迟、超大规模多机训练有极致要求,但没有明确网络拓扑和集群方案;
- 已经有自建 GPU 集群,并且硬件折旧、电力、机房和运维成本已经完全摊平;
- 只需要偶尔运行 CPU 任务,GPU 并不是瓶颈;
- 无法接受活动价格、库存和区域价格波动的固定预算场景。
八、常见误区与修正方法
| 误区 | 真相 | 可能后果 | 修正方法 |
|---|---|---|---|
| 只看最低单小时价格 | 显存不足会直接 OOM | 反复重跑,成本更高 | 先跑基准,记录显存峰值 |
| 认为月租贵就不划算 | 包月折算时租可能更低 | 长期预算超支 | 用日均使用小时数比较总账 |
| 关机后以为完全不收费 | 挂载云盘仍可能计存储费 | 产生闲置费用 | 停机后检查云盘和快照 |
| 把活动价当长期价格 | 新客、地域、续费规则可能变化 | 长期成本低估 | 核对活动期限和续费价 |
| 只看 TFLOPS | 带宽、显存和通信同样关键 | 性能达不到预期 | 用真实任务测吞吐和延迟 |
九、FAQ
Q1:GPU 云服务器成本到底怎么算?
按任务完成成本计算:单卡时租乘以实际运行小时,再加挂载存储费用和网络出流量费用。长期任务还要比较按量、包月和竞价的总成本。
Q2:为什么显存比单小时价格更重要?
显存是硬门槛。显存不足时模型无法装入 GPU,任务会 OOM 失败,低单价没有实际意义。
Q3:个人做 7B LoRA 或文生图应该选什么?
可以先用 RTX 4090 日卡或类似试用卡验证。若 24G 显存足够,并且任务稳定,RTX 4090 月卡通常是个人场景的高性价比选择。
Q4:什么时候应该选 A100 或 H100?
A100 更适合 13B--70B 微调、批量推理和更高显存带宽需求。H100 主要适合 70B 以上预训练、超低延迟推理或企业旗舰训练集群。
Q5:竞价实例适合训练任务吗?
适合可中断、可恢复、非紧急的批处理任务。训练任务使用竞价实例时必须配置 Checkpoint,否则中断后可能损失大量计算进度。
结论
GPU 云服务器选型应先按显存判断任务能不能跑,再按算力、显存带宽和计费方式计算任务完成成本。个人用户先用试用卡验证,团队用户用日均运行时长比较包月与按量,企业用户把对公、SLA 和合规材料纳入采购流程。
价格会随供需、区域和活动规则变化。以上价格按 2026 年 8 月核验口径整理,最终应以控制台实时报价、合同条款和实测结果为准。