Qwen 3.8 已上线 DigitalOcean 推理云平台

阿里通义千问新一代旗舰模型 Qwen3.8-2.4T-A95B 现已上线 DigitalOcean Inference Engine(推理引擎) ,并可通过 DigitalOcean 无服务器推理(Serverless Inference)直接调用。

根据官方所说,这次上线的并不是一款"小修小补"的 Qwen 模型。Qwen3.8-2.4T-A95B 采用 2.4 万亿参数 MoE(混合专家)架构,每次推理激活约 950 亿参数,重点面向长上下文、AI 编程以及 Agent 智能体等复杂工作负载。

尤其值得注意的是,它最高支持 100 万 Token 上下文 ,在代码、工具调用和智能体任务上的表现已经进入当前前沿大模型梯队,而 DigitalOcean 上的调用价格为每百万输入 Token 2 美元、输出 Token 6 美元

单看价格,Qwen 3.8 未必是市场上最便宜的选择。但 DigitalOcean 的优势并不只是提供一个 Qwen 3.8 API,而是可以让开发者通过同一套 API 接入平台上的多个模型 。如果你的应用还需要同时使用 DeepSeek v4、Kimi K3GLM 5.2Claude Fable5GPT-5.6 等不同模型,不需要分别维护多套 SDK、鉴权和调用逻辑,只需要在同一个推理接口中切换模型即可。

进一步来说,Qwen 3.8 还可以加入 DigitalOcean Inference Router(推理路由器)。对于 AI Coding、Agent 这类会频繁调用模型的应用,可以把简单分类、摘要、格式转换等任务交给成本更低的模型,而把复杂代码生成、长上下文分析和多步骤推理交给 Qwen 3.8。这样可以避免所有请求都固定使用旗舰模型,在保证复杂任务效果的同时,把整体推理成本控制在更合理的范围。

对于想尝试超大规模开源模型,但又不准备自己搭建多 GPU 推理集群的团队来说,现在不仅可以直接通过 API 使用 Qwen 3.8,也可以把它作为多模型架构中的一个高能力节点,根据实际任务灵活选择模型。

2.4 万亿参数,Qwen 3.8 更偏向复杂任务和 Agent

Qwen3.8-2.4T-A95B 是一个 Mixture-of-Experts(MoE,混合专家)模型

它拥有约 2.4 万亿总参数 ,但在处理一次请求时并不会把全部参数都激活,而是根据任务选择其中约 950 亿参数参与计算。

这种设计的意义在于:模型可以继续扩大整体参数规模和知识容量,同时避免每生成一个 Token 都执行完整的 2.4 万亿参数计算。

相比把所有任务都交给一个稠密大模型,MoE 架构更适合在模型能力与推理成本之间寻找平衡。

而从 Qwen 3.8 的能力侧重点来看,它显然也不是主要面向普通聊天场景,而是进一步瞄准了目前大模型最重要的几个生产级方向:

  • AI 编程与代码 Agent
  • 长文档与大型代码库分析
  • 多步骤复杂推理
  • 工具调用
  • Agent 智能体工作流
  • 企业级自动化任务

换句话说,如果你的业务只是简单摘要、分类或者客服问答,未必需要每个请求都使用这样的大模型。

但如果任务开始涉及理解整个代码仓库、操作终端、调用工具、持续执行几十甚至上百步任务,Qwen 3.8 这种模型的优势就会更加明显。

最高 100 万 Token 上下文,可以一次读入更大的代码库和文档

Qwen3.8-2.4T-A95B 最值得关注的一项能力,是最高 100 万 Token 的上下文窗口

对于普通聊天应用来说,几十万甚至 100 万 Token 可能显得有些过剩,但对于 AI Coding 和 Agent 场景,这类长上下文正在变得越来越重要。

例如,让一个代码 Agent 修复 Bug 时,它需要理解的内容可能不只是一个源代码文件,而是:

  • 整个代码仓库
  • README 和技术文档
  • API 定义
  • 数据库 Schema
  • Git 历史
  • 测试代码
  • 错误日志
  • 用户提出的修改要求

过去比较常见的方法,是先通过 RAG、代码索引或者分块检索,从代码库中挑选部分内容发送给模型。

这种架构仍然非常重要,但检索本身也可能漏掉真正关键的上下文。

更大的上下文窗口意味着,在一些任务中可以直接把更多相关代码、文档和历史记录放进一次推理,让模型在更完整的信息环境下进行判断。

类似的优势也适用于合同分析、科研论文、企业知识库、日志分析以及大型技术文档处理。

AI 编程和 Agent 能力进入第一梯队

根据 Qwen 官方公布的 benchmark,Qwen3.8-2.4T-A95B 在多项 Agent 和代码相关测试中已经具备很强的竞争力。

其中几个比较值得关注的数据包括:

Benchmark Qwen3.8-2.4T-A95B
PaperBench 93.0
IFBench 82.8
Terminal-Bench 2.1 86.6
SWE-bench Pro 67.7

其中 Terminal-Bench 2.1 主要测试模型在真实终端环境中完成复杂任务的能力。

Qwen 3.8 获得 86.6 分,高于 Claude Opus 4.8 / Fable 5 的 84.6,不过仍低于 GPT-5.6 Sol 的 88.8。

这意味着,在 Shell 命令执行、环境操作以及 Agent 自动化任务上,Qwen 3.8 已经进入当前顶级模型的竞争区间。

当然,这并不意味着 Qwen 3.8 在所有编程测试上都已经领先闭源模型。

例如在更强调真实软件工程问题解决能力的 SWE-bench Pro 中,Qwen 3.8 得分为 67.7,而 Fable 5 为 80.0。

因此,更准确的理解应该是:

Qwen 3.8 并不是简单地"全面超过某个闭源模型",而是在部分 Agent、长上下文和工具使用任务上已经具备非常强的竞争力,同时价格明显更低。

对于生产环境来说,这其实比单纯比较一个综合跑分更加重要。

每百万输入 Token 2 美元,输出仅 6 美元

大模型真正进入生产环境之后,性能只是问题的一半,另一半往往是成本。

目前 Qwen3.8-2.4T-A95B 在 DigitalOcean 无服务器推理上的价格为:

模型 输入 / 百万 Token 输出 / 百万 Token
Qwen3.8-2.4T-A95B 2 美元 6 美元
Claude Fable 5 10 美元 50 美元

也就是说,在公开价格下,Qwen 3.8:

输入 Token 价格约为 Fable 5 的 1/5,输出 Token 价格约为其 12%。

对于普通聊天任务,这种价格差距可能只是每次请求几分钱甚至更低。

但在 Agent 场景中,情况会完全不同。

一个 Agent 为了完成任务,可能连续运行几十次甚至几百次模型调用,还会反复读取代码、工具结果和历史上下文。

一旦请求规模扩大到每天数百万、数千万甚至更多 Token,模型之间几倍的单价差异最终就会变成非常明显的基础设施成本。

因此,Qwen 3.8 比较适合一种很现实的需求:

希望获得接近前沿模型的 Agent 和代码能力,同时不希望所有请求都按照顶级闭源模型的价格计费。

在 DigitalOcean 上,不需要自己部署 2.4 万亿参数模型

2.4 万亿参数听起来很强,但另一个问题也随之而来:

自己部署到底需要多少 GPU?

这种规模的模型已经明显不是租一两张 GPU 就能轻松处理的模型。

除了模型权重之外,生产级部署还需要考虑 KV Cache、并发请求、推理框架、跨 GPU 通信、量化方式、显存利用率以及高可用等问题。

而且,把模型"加载起来"和真正提供稳定的生产级 API,也是完全不同的两件事。

DigitalOcean 这次为 Qwen3.8-2.4T-A95B 提供的是无服务器推理

开发者不需要:

  • 自己采购或租用多张 GPU
  • 部署和维护推理框架
  • 配置多 GPU 并行
  • 处理模型更新
  • 管理推理集群扩缩容
  • 为 GPU 空闲时间持续付费

直接通过 API 调用即可,并按照实际消耗的 Token 计费。

对于还处于测试、产品早期或者请求量波动比较明显的团队来说,这通常比一开始就维持一个大型 GPU 集群更加灵活。

DigitalOcean 中国区企业用户 如果需要测试 Qwen 3.8、评估 Token 成本、迁移现有 OpenAI API 应用,或者规划 Serverless Inference、Inference Router 与 GPU 部署方案,也可以联系 DigitalOcean 中国区战略合作伙伴卓普云 AI Droplet获取中文技术支持。

相关推荐
神奇霸王龙3 小时前
DeepSeek 接 Anthropic:迁移屠夫
ai·ai作画·agent·ai编程·claude·claudecode
IT Panda4 小时前
【Harness Engineering】Skill 自进化 - SkillOpt
ai·agent·skill·harness·自进化·skillopt·skill自进化
Luhui Dev4 小时前
如何在 WorkBuddy 中使用大角几何:从 MCP 接入到 AI 几何作图
人工智能·数学·算法·agent·luhuidev
安逸sgr5 小时前
RAG 检索到了正确内容,但模型回答仍然错误,可能是什么原因?
人工智能·ai·大模型·agent·智能体
安逸sgr5 小时前
神经网络是怎么工作的?从神经元到多层感知机
人工智能·ai·大模型·agent·智能体
迷路爸爸1806 小时前
RAG 优化方案汇总介绍
python·langchain·agent·rag
MicrosoftReactor6 小时前
技术速递|GitHub Copilot App 中的堆叠会话与拉取请求
ai·github·copilot·agent
武子康7 小时前
Pi Agent 为什么不内置 MCP:工具发现与上下文成本的真实争议
人工智能·llm·agent
用户469368483207 小时前
kimi-code 深度掌握系列文章-V2 引擎的 HTTP 服务层:kap-server(十六)
agent