阿里通义千问新一代旗舰模型 Qwen3.8-2.4T-A95B 现已上线 DigitalOcean Inference Engine(推理引擎) ,并可通过 DigitalOcean 无服务器推理(Serverless Inference)直接调用。
根据官方所说,这次上线的并不是一款"小修小补"的 Qwen 模型。Qwen3.8-2.4T-A95B 采用 2.4 万亿参数 MoE(混合专家)架构,每次推理激活约 950 亿参数,重点面向长上下文、AI 编程以及 Agent 智能体等复杂工作负载。
尤其值得注意的是,它最高支持 100 万 Token 上下文 ,在代码、工具调用和智能体任务上的表现已经进入当前前沿大模型梯队,而 DigitalOcean 上的调用价格为每百万输入 Token 2 美元、输出 Token 6 美元。
单看价格,Qwen 3.8 未必是市场上最便宜的选择。但 DigitalOcean 的优势并不只是提供一个 Qwen 3.8 API,而是可以让开发者通过同一套 API 接入平台上的多个模型 。如果你的应用还需要同时使用 DeepSeek v4、Kimi K3、GLM 5.2、Claude Fable5、GPT-5.6 等不同模型,不需要分别维护多套 SDK、鉴权和调用逻辑,只需要在同一个推理接口中切换模型即可。
进一步来说,Qwen 3.8 还可以加入 DigitalOcean Inference Router(推理路由器)。对于 AI Coding、Agent 这类会频繁调用模型的应用,可以把简单分类、摘要、格式转换等任务交给成本更低的模型,而把复杂代码生成、长上下文分析和多步骤推理交给 Qwen 3.8。这样可以避免所有请求都固定使用旗舰模型,在保证复杂任务效果的同时,把整体推理成本控制在更合理的范围。
对于想尝试超大规模开源模型,但又不准备自己搭建多 GPU 推理集群的团队来说,现在不仅可以直接通过 API 使用 Qwen 3.8,也可以把它作为多模型架构中的一个高能力节点,根据实际任务灵活选择模型。
2.4 万亿参数,Qwen 3.8 更偏向复杂任务和 Agent
Qwen3.8-2.4T-A95B 是一个 Mixture-of-Experts(MoE,混合专家)模型。
它拥有约 2.4 万亿总参数 ,但在处理一次请求时并不会把全部参数都激活,而是根据任务选择其中约 950 亿参数参与计算。
这种设计的意义在于:模型可以继续扩大整体参数规模和知识容量,同时避免每生成一个 Token 都执行完整的 2.4 万亿参数计算。
相比把所有任务都交给一个稠密大模型,MoE 架构更适合在模型能力与推理成本之间寻找平衡。
而从 Qwen 3.8 的能力侧重点来看,它显然也不是主要面向普通聊天场景,而是进一步瞄准了目前大模型最重要的几个生产级方向:
- AI 编程与代码 Agent
- 长文档与大型代码库分析
- 多步骤复杂推理
- 工具调用
- Agent 智能体工作流
- 企业级自动化任务
换句话说,如果你的业务只是简单摘要、分类或者客服问答,未必需要每个请求都使用这样的大模型。
但如果任务开始涉及理解整个代码仓库、操作终端、调用工具、持续执行几十甚至上百步任务,Qwen 3.8 这种模型的优势就会更加明显。
最高 100 万 Token 上下文,可以一次读入更大的代码库和文档
Qwen3.8-2.4T-A95B 最值得关注的一项能力,是最高 100 万 Token 的上下文窗口。
对于普通聊天应用来说,几十万甚至 100 万 Token 可能显得有些过剩,但对于 AI Coding 和 Agent 场景,这类长上下文正在变得越来越重要。
例如,让一个代码 Agent 修复 Bug 时,它需要理解的内容可能不只是一个源代码文件,而是:
- 整个代码仓库
- README 和技术文档
- API 定义
- 数据库 Schema
- Git 历史
- 测试代码
- 错误日志
- 用户提出的修改要求
过去比较常见的方法,是先通过 RAG、代码索引或者分块检索,从代码库中挑选部分内容发送给模型。
这种架构仍然非常重要,但检索本身也可能漏掉真正关键的上下文。
更大的上下文窗口意味着,在一些任务中可以直接把更多相关代码、文档和历史记录放进一次推理,让模型在更完整的信息环境下进行判断。
类似的优势也适用于合同分析、科研论文、企业知识库、日志分析以及大型技术文档处理。
AI 编程和 Agent 能力进入第一梯队
根据 Qwen 官方公布的 benchmark,Qwen3.8-2.4T-A95B 在多项 Agent 和代码相关测试中已经具备很强的竞争力。
其中几个比较值得关注的数据包括:
| Benchmark | Qwen3.8-2.4T-A95B |
|---|---|
| PaperBench | 93.0 |
| IFBench | 82.8 |
| Terminal-Bench 2.1 | 86.6 |
| SWE-bench Pro | 67.7 |
其中 Terminal-Bench 2.1 主要测试模型在真实终端环境中完成复杂任务的能力。
Qwen 3.8 获得 86.6 分,高于 Claude Opus 4.8 / Fable 5 的 84.6,不过仍低于 GPT-5.6 Sol 的 88.8。
这意味着,在 Shell 命令执行、环境操作以及 Agent 自动化任务上,Qwen 3.8 已经进入当前顶级模型的竞争区间。
当然,这并不意味着 Qwen 3.8 在所有编程测试上都已经领先闭源模型。
例如在更强调真实软件工程问题解决能力的 SWE-bench Pro 中,Qwen 3.8 得分为 67.7,而 Fable 5 为 80.0。
因此,更准确的理解应该是:
Qwen 3.8 并不是简单地"全面超过某个闭源模型",而是在部分 Agent、长上下文和工具使用任务上已经具备非常强的竞争力,同时价格明显更低。
对于生产环境来说,这其实比单纯比较一个综合跑分更加重要。
每百万输入 Token 2 美元,输出仅 6 美元
大模型真正进入生产环境之后,性能只是问题的一半,另一半往往是成本。
目前 Qwen3.8-2.4T-A95B 在 DigitalOcean 无服务器推理上的价格为:
| 模型 | 输入 / 百万 Token | 输出 / 百万 Token |
|---|---|---|
| Qwen3.8-2.4T-A95B | 2 美元 | 6 美元 |
| Claude Fable 5 | 10 美元 | 50 美元 |
也就是说,在公开价格下,Qwen 3.8:
输入 Token 价格约为 Fable 5 的 1/5,输出 Token 价格约为其 12%。
对于普通聊天任务,这种价格差距可能只是每次请求几分钱甚至更低。
但在 Agent 场景中,情况会完全不同。
一个 Agent 为了完成任务,可能连续运行几十次甚至几百次模型调用,还会反复读取代码、工具结果和历史上下文。
一旦请求规模扩大到每天数百万、数千万甚至更多 Token,模型之间几倍的单价差异最终就会变成非常明显的基础设施成本。
因此,Qwen 3.8 比较适合一种很现实的需求:
希望获得接近前沿模型的 Agent 和代码能力,同时不希望所有请求都按照顶级闭源模型的价格计费。
在 DigitalOcean 上,不需要自己部署 2.4 万亿参数模型
2.4 万亿参数听起来很强,但另一个问题也随之而来:
自己部署到底需要多少 GPU?
这种规模的模型已经明显不是租一两张 GPU 就能轻松处理的模型。
除了模型权重之外,生产级部署还需要考虑 KV Cache、并发请求、推理框架、跨 GPU 通信、量化方式、显存利用率以及高可用等问题。
而且,把模型"加载起来"和真正提供稳定的生产级 API,也是完全不同的两件事。
DigitalOcean 这次为 Qwen3.8-2.4T-A95B 提供的是无服务器推理。
开发者不需要:
- 自己采购或租用多张 GPU
- 部署和维护推理框架
- 配置多 GPU 并行
- 处理模型更新
- 管理推理集群扩缩容
- 为 GPU 空闲时间持续付费
直接通过 API 调用即可,并按照实际消耗的 Token 计费。
对于还处于测试、产品早期或者请求量波动比较明显的团队来说,这通常比一开始就维持一个大型 GPU 集群更加灵活。
DigitalOcean 中国区企业用户 如果需要测试 Qwen 3.8、评估 Token 成本、迁移现有 OpenAI API 应用,或者规划 Serverless Inference、Inference Router 与 GPU 部署方案,也可以联系 DigitalOcean 中国区战略合作伙伴卓普云 AI Droplet获取中文技术支持。