多款模型最高直降 50%:DigitalOcean 无服务器推理大降价

对于正在把大模型接入应用的团队来说,模型能力固然重要,但 API 调用成本仍是团队最关心的一项。尤其是 AI 编程、客服机器人、内容生成、代码辅助和 AI Agent 这类高频场景,单次请求便宜几厘钱看似不多,乘上每月数千万甚至数亿 Token 后,就会变成一笔不小的支出。

现在,这部分成本有望进一步下降。

DigitalOcean 近期对无服务器推理(Serverless Inference)中的多款模型进行了价格调整。本轮共有多款模型降价,涉及输入、输出和提示缓存三类计费项,整体降幅在 20%---50% 之间。

多款模型降价,最高降幅 50%

本轮价格调整覆盖 Qwen、DeepSeek、Meta、NVIDIA、小米和智谱 AI 等模型供应商。以下价格均以美元计价,单位为每 100 万 Token。

模型 计费项 原价格 新价格 降幅
Qwen 3.5 397B A17B 输入 $0.385 $0.302 21.56%
Qwen 3.5 397B A17B 输出 $2.450 $1.925 21.43%
DeepSeek V4 Flash 输入 $0.112 $0.084 25%
DeepSeek V4 Flash 输出 $0.224 $0.168 25%
DeepSeek V4 Flash 提示缓存 $0.028 $0.017 39.29%
DeepSeek V4 Pro 输入 $1.392 $0.870 37.5%
DeepSeek V4 Pro 输出 $2.784 $1.740 37.5%
DeepSeek V4 Pro 提示缓存 $0.348 $0.174 50%
DeepSeek V3.2 输入 $0.425 $0.250 41.18%
DeepSeek V3.2 输出 $1.360 $0.800 41.18%
DeepSeek V3.2 提示缓存 $0.150 $0.075 50%
Llama 4 Maverick 17B 128E Instruct 输入 $0.250 $0.200 20%
Llama 4 Maverick 17B 128E Instruct 输出 $0.870 $0.696 20%
Nemotron-3-Super-120B 输入 $0.210 $0.165 21.43%
Nemotron-3-Super-120B 输出 $0.455 $0.358 21.32%
MiMo V2.5 Pro 输入 $0.600 $0.400 33.33%
MiMo V2.5 Pro 输出 $3.000 $1.500 50%
MiMo V2.5 Pro 提示缓存 $0.160 $0.080 50%
GLM-5.2 输入 $1.050 $0.700 33.33%
GLM-5.2 输出 $4.400 $2.200 50%
GLM-5.2 提示缓存 $0.210 $0.120 42.86%

从这张表可以看到,这次并不是只调整某一个供应商或某一档模型,而是同时覆盖了高性价比模型、通用大模型和偏高能力的 Pro 模型。开发团队可以根据任务难度,在不同模型之间重新做一次成本与性能的权衡。

除了以上模型,DigitalOcean 无服务器推理还提供多种模型,包括 Claude、GPT、Kimi K3、DeepSeek、Qwen、GLM、Llama 和 Nemotron 等主流模型系列。开发者可以通过统一的 OpenAI 兼容接口调用不同供应商的模型,无需分别注册账号、管理多套 API Key,也能更方便地根据任务效果、响应速度和调用成本切换模型。

注:本文价格来自本次价格调整表,均以美元计价。实际可用模型、功能及账单金额请以 DigitalOcean 控制台和官方定价页面为准。具体也可直接咨询 DigitalOcean 中国区战略合作伙伴卓普云AI Droplet

与模型官方 API 相比,DigitalOcean 的价格如何?

降价之后,DigitalOcean Serverless Inference 的部分模型不仅比此前更便宜,与模型厂商官方 API 相比也出现了明显的价格优势。下面进一步对比部分模型在 DigitalOcean 当前价格与各模型官方的价格。表中金额均为每 100 万 Token 的美元价格,"DO / 官方"表示前者为 DigitalOcean 价格、后者为模型厂商官方价格。

模型 输入:DO / 官方 输出:DO / 官方 缓存:DO / 官方
DeepSeek V4 Flash 0.084/0.084 / 0.084/0.140 0.168/0.168 / 0.168/0.280 0.017/0.017 / 0.017/0.0028
GLM 5 0.750/0.750 / 0.750/1.000 2.400/2.400 / 2.400/3.200 0.200/0.200 / 0.200/0.200
GLM-5.1 0.975/0.975 / 0.975/1.400 4.300/4.300 / 4.300/4.400 0.260/0.260 / 0.260/0.260
GLM-5.2 0.700/0.700 / 0.700/1.400 2.200/2.200 / 2.200/4.400 0.120/0.120 / 0.120/0.260
Kimi K2.5 0.375/0.375 / 0.375/0.600 2.025/2.025 / 2.025/3.000 0.203/0.203 / 0.203/0.100
Kimi K2.6 0.760/0.760 / 0.760/0.950 3.200/3.200 / 3.200/4.000 0.190/0.190 / 0.190/0.160
Kimi K3 3.000/3.000 / 3.000/3.000 15.000/15.000 / 15.000/15.000 0.300/0.300 / 0.300/0.300
MiniMax M2.5 0.225/0.225 / 0.225/0.300 0.900/0.900 / 0.900/1.200 0.060/0.060 / 0.060/0.030
Qwen3-32B 0.250/0.250 / 0.250/0.287 0.550/0.550 / 0.550/1.147 无 / 官方不支持

从输入和输出价格来看,表中多款在 DigitalOcean 上低于官方价格。其中,GLM-5.2 的输入和输出价格均比官方低 50%,缓存价格低约 53.85%;Qwen3-32B 的输出价格比官方低约 52.05%;DeepSeek V4 Flash 的输入和输出价格均低 40%。Kimi K3 的三项价格则与官方一致。

哪些应用受益更明显?

首先是输出内容较长的应用,例如文案生成、报告撰写、代码生成和深度问答。MiMo V2.5 Pro 与 GLM-5.2 的输出价格都直接减半;当输出 Token 在总用量中占比较高时,账单下降会非常直观。

其次是使用固定长提示词的 AI Agent 和企业知识助手。这类应用通常会在每次请求中重复发送系统提示词、工具说明、角色设定或较长的公共上下文。如果模型支持并命中提示缓存,缓存价格下降可以进一步压低重复输入的成本。DeepSeek V4 Pro、DeepSeek V3.2 和 MiMo V2.5 Pro 的提示缓存价格此次均下降 50%。

另外,对于需要处理海量轻量任务的业务,例如商品信息整理、工单分类、内容审核、标签提取和批量摘要,DeepSeek V4 Flash 的新输入价格仅为每 100 万 Token 0.084 美元,输出价格为 0.168 美元。这类任务单次调用量不大,但请求规模往往很高,因此单位 Token 成本的下降同样值得关注。

当然,模型价格并不是选型的唯一标准。正式切换前,仍应结合自己的真实数据集,对回答质量、首 Token 延迟、整体响应时间、结构化输出稳定性和工具调用能力进行测试。更合理的做法不是简单选择"最便宜的模型",而是让不同难度的任务使用与之匹配的模型。

什么是 DigitalOcean 无服务器推理?

这里给一些还不太熟悉 DigitalOcean 云平台的用户介绍一下。

DigitalOcean 无服务器推理是一项托管式模型推理服务。开发者可以直接通过 API 调用基础模型,不需要购买 GPU、部署推理框架,也不需要自己处理扩缩容、模型升级和底层基础设施运维。目前,DigitalOcean Inference 提供 70 多款模型。

简单来说,它把"搭建并维护一套大模型推理服务"变成了"调用一个 API"。

Serverless Inference 按实际使用量计费。对于文本模型,费用通常由输入 Token、输出 Token 以及提示缓存构成;没有请求时,不需要为闲置 GPU 持续付费。因此,它更适合希望快速接入模型、流量存在波峰波谷、需要频繁尝试不同模型,或暂时不想维护推理基础设施的团队。

开发者还可以先在DigitalOcean 的 Model Playground 中测试和比较模型,再通过统一接口接入应用。随着模型目录持续扩展,团队不必为每一家模型供应商分别维护一套调用方式、账号和基础设施,也更容易根据效果、速度与价格调整模型组合。

此外,DigitalOcean 还提供 Inference Router(推理路由器)。开发者可以把多款模型加入同一个路由器,通过统一端点调用,并根据成本、响应速度或任务类型,将请求自动分配给更合适的模型。当首选模型不可用时,还可以切换至备用模型。这样既能避免所有任务都调用价格较高的大模型,也能减少模型切换、故障回退和多套 API 接口带来的开发工作,尤其适合需要同时使用多款模型的 AI Agent 和生产级应用。

相关推荐
罗高1 小时前
Hermes Agent Token 机制深度解析
llm·agent
网易云信1 小时前
立即下载!帝王蟹(ClawHive)桌面客户端正式上线!
人工智能·agent
众人皆醒我独醉1 小时前
Ray Serve:把 LLM 推理当"分布式 Actor"调度——不是 Kubernetes,是 Python 原生
面试·llm·ai编程
玉鸯2 小时前
界面用完即消失:Agent 生成式 UI 的短暂性哲学与前端工程的未来
前端·llm·agent
组合缺一2 小时前
SolonCode v2026.8.4 发布:界面字体可调、22 种语言、记忆搜索增强
llm·agent·ai编程·solon·claudecode·opencode
小兔子2 小时前
Agent 一旦能出网、改仓、调工具:对照 AISI 越权事件,把四层控制写进架构
人工智能·agent
用户469368483202 小时前
kimi-code 深度掌握系列文章-Agent 类编排者(四)
llm·agent
牧艺3 小时前
Knowledge Studio 本地开源版:对标百炼 RAG 控制台的架构、重难点与差异
llm·agent·next.js
晨米酱3 小时前
Matt Pocock Skills v1.2:控制从主流程深入到每一步
面试·架构·agent