上周技术群里有人问了一个问题:开源模型和闭源旗舰的差距,到底还有多大?底下立刻吵成一团。有人搬出 Kimi K3 的 2.8 万亿参数,说开源早就追上了;也有人冷笑一声:跑分归跑分,真拿去改生产代码,还是差那么一口气。
8 月 12 日,阿里把 Qwen3.8-2.4T-A95B 的权重放了出来,这场争论有了新的论据。这是 Qwen 系列首次把 Max 级旗舰开源------2.4T 总参数、95B 激活参数、262K 原生上下文,OpenRouter 上 7 家供应商同步上架,输入 2 美元、输出 6 美元每百万 token。消息出来的那天我扫了一眼官方基准表,本来准备随手转发一句"又一个刷榜的",结果盯着表格看了十分钟------这不像是一次普通的例行发布。
这篇文章不喊"谁赢谁输"的口号。我把官方公布的 20 多项基准数据全部摊开,把 Qwen3.8-2.4T-A95B 和 Kimi K3、DeepSeek V4 Pro 放进同一张规格表,再和 GPT-5.6 Sol、Fable 5、Opus 4.8 三个闭源旗舰逐项对比,最后给出接入和选型的完整路径。2.4T 的开源旗舰到底兑现了多少,数据说了算。
一、核心指标总览:先看规格,再看分数
先澄清一个容易混淆的点:这次开源的是权重版,官方基准表用的是托管版 Qwen3.8-Max 的口径。两者是同一个模型的两种形态------开源权重是纯文本版、强制思考模式、262K 原生上下文(可扩展到约 1M);托管版多了视觉输入、非思考模式和内置工具。跑分数据两者同源,可以放心参考。
规格对比总表:
| 规格 | Qwen3.8-2.4T-A95B | Kimi K3 | DeepSeek V4 Pro |
|---|---|---|---|
| 总参数 | 2.4T | 2.8T | 1.6T |
| 激活参数 | 95B | 约 50B | 未公开 |
| 架构 | MoE(Gated DeltaNet 混合注意力) | MoE(KDA 混合注意力) | MoE |
| 上下文窗口 | 262K 原生,可扩至约 1M | 100 万 token | 100 万 token |
| 权重开放 | ✅ 2026-08-12 | ✅ 2026-07-27 | ✅ 已开放 |
| API 参考价 | 2 / 6 每 1M token | 国产 API 中定价偏高 | 高峰时段输出 12 元/M |
| 多模态 | 权重版纯文本(托管版支持视觉) | 原生视觉理解 | 文本为主 |
6 项核心基准总表(对比闭源旗舰,官方口径):
| 基准 | Qwen3.8-2.4T-A95B | GPT-5.6 Sol | Fable 5 | Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 | 84.6 | 84.6 |
| SWE-bench Pro | 67.7 | 64.6 | 80.0 | 69.2 |
| DeepSWE 1.1 | 56.6 | 73.0 | 70.0 | 59.0 |
| PaperBench | 93.0 | 90.5 | 88.8 | 80.3 |
| IFBench | 82.8 | 72.7 | 63.5 | 62.2 |
| WideSearch | 81.9 | --- | 81.2 | 72.9 |
这张表的信息量很大,先说结论:8 项对比里(加上 FrontierSWE 73.5 和 OneMillion-Bench 52.5),Qwen 在 6 项上领先或追平了闭源旗舰,其中 PaperBench、IFBench、FrontierSWE、WideSearch 四项是全场最高。但它不是全面压制------SWE-bench Pro 输给 Fable 5 一截,DeepSWE 1.1 更是明显短板。这正好回答了开篇的问题:开源旗舰和闭源旗舰的差距,已经从"全面落后"变成了"各有胜负"。
再看开源三强的定位,这一代的分化很有意思:
- Kimi K3(2.8T):全球参数规模最大的开源模型,主打"规模即正义",原生视觉理解 + 100 万上下文,7 月底开放权重后一直是开源阵营的门面。
- Qwen3.8-2.4T-A95B(2.4T):阿里首次把 Max 级旗舰开源,主打"旗舰能力 + 高效推理"------95B 激活参数意味着每次生成只付 95B 的计算成本,这是它和 K3 最本质的区别。
- DeepSeek V4 Pro(1.6T):走的是"极致性价比"路线,V4 Flash 只有 284B 总参、13B 激活,输出价是开源阵营的地板,适合高频低成本的场景。
三者不是替代关系,是三种不同的工程取舍:要规模选 K3,要旗舰能力选 Qwen,要便宜选 DeepSeek。后面选型建议还会展开。
二、维度一:编程与 Agent 能力拆解
编程是开源模型最敏感的战场,我把 5 个编程相关基准单独拎出来看。
编程基准子表:
| 基准 | Qwen3.8-2.4T-A95B | GPT-5.6 Sol | Fable 5 | Opus 4.8 | Qwen3.7-Max(上代) |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 | 84.6 | 84.6 | 74.5 |
| SWE-bench Pro | 67.7 | 64.6 | 80.0 | 69.2 | 60.6 |
| DeepSWE 1.1 | 56.6 | 73.0 | 70.0 | 59.0 | 21.6 |
| PaperBench | 93.0 | 90.5 | 88.8 | 80.3 | 64.8 |
| FrontierSWE | 73.5 | --- | 88.8 | 70.0 | 40.7 |
Terminal Bench 2.1(86.6):这是衡量终端 Agent 真实干活能力的基准,测试模型在命令行环境里自主完成编码任务。Qwen 拿到 86.6,压过 Fable 5 和 Opus 4.8 的 84.6,只比 GPT-5.6 Sol 的 88.8 低 2.2 分。对用 Claude Code、Codex 这类终端 Agent 的开发者来说,这个分数意味着开源模型已经具备"改得动生产仓库"的实战能力。
SWE-bench Pro(67.7):真实 GitHub issue 修复,含多文件改动。这里有个反直觉的结果:Qwen 的 67.7 高于 GPT-5.6 Sol 的 64.6,却低于 Fable 5 的 80.0。也就是说"头部闭源"在不同基准上并不一致,选型时盯着单一榜单很容易踩坑。
DeepSWE 1.1(56.6):最难看的一项。闭源三强都在 59-73 之间,Qwen 只有 56.6。官方把这项列为待改进方向,如果团队的主要场景是超长时程的自主开发任务,这里要打个问号。
PaperBench(93.0):全场最高,比 GPT-5.6 Sol 的 90.5 还高 2.5 分。这项基准要求模型复现顶会论文的实验,是研究向开发者的刚需场景。开源模型在科研复现上拿到这个分数,含金量不低。
FrontierSWE(73.5):高于 Opus 4.8 的 70.0,仅次于 Fable 5 的 88.8。这是 MEAN@5 口径的官方榜单数据,反映多轮尝试下的成功率。
官方还公布了三项自家口径的基准,虽然"自己出题自己考"要打个折扣,但和闭源跑在同一套流程里,仍有参考价值:QwenSWEBench 80.7(高于 GPT-5.6 Sol 的 73.5)、QwenQoderBench 58.4(高于 GPT-5.6 Sol 的 53.8)、QwenReactBench 1724(React 组件生成,双语 Elo 分)。特别是 QwenSWEBench 用的就是 Claude Code 同款评测流程,对比口径相对干净。
再补一个容易被忽略的视角:代际跃升。对比上代 Qwen3.7-Max,Terminal Bench 从 74.5 涨到 86.6(+12.1),DeepSWE 从 21.6 涨到 56.6(约 2.6 倍),FrontierSWE 从 40.7 涨到 73.5(接近翻倍)。一个版本把和顶级闭源模型的差距压缩了两年,这才是这次发布真正值得关注的地方。
三、维度二:通用 Agent 与长上下文拆解
如果说编程是开源模型的"正面战场",通用 Agent 和长上下文就是它过去最露怯的地方------上下文一长,开源模型检索就飘。这一代专门补了这块。
通用 Agent / 长上下文子表:
| 基准 | Qwen3.8-2.4T-A95B | GPT-5.6 Sol | Fable 5 | Opus 4.8 |
|---|---|---|---|---|
| CoWorkBench | 74.8 | 71.5 | 75.9 | 72.3 |
| WorkSpaceBench | 67.7 | 65.6 | 68.7 | 66.8 |
| JobBench | 53.4 | 45.4 | 57.4 | 48.4 |
| SkillsBench | 70.2 | 73.5 | 70.9 | 65.1 |
| Agents' Last Exam(Pass/Score) | 27.0 / 52.4 | 30.6 / 53.6 | --- | 27.0 / 45.1 |
| MRCR v2 256K(8-needle) | 92.9 | 93.8 | --- | 83.2 |
| OneMillion-Bench | 52.5 | 53.8 | 55.9 | 41.8 |
| LongBench v2 | 66.3 | 67.1 | --- | 69.1 |
几个值得注意的点:
CoWorkBench(74.8):长时程协作任务,横跨 CS、金融、法律、医疗四个领域。Qwen 高过 GPT-5.6 Sol 的 71.5,只比 Fable 5 低 1.1 分。这类"挂机干一天的活"的场景,正是 Agent 落地最需要的。
JobBench(53.4):模拟真实岗位任务的基准,Qwen 的 53.4 明显高过 GPT-5.6 Sol 的 45.4。如果你在做招聘筛选、简历解析、工单处理这类场景,这个分数有参考价值。
MRCR v2 256K(92.9):256K 上下文里的"大海捞针"式检索,Qwen 拿到 92.9,和 GPT-5.6 Sol 的 93.8 只差 0.9 分,远高于 Opus 4.8 的 83.2。长文档、知识库问答是开源模型的老大难,这个分数说明架构升级是动真格的。
专业领域能力:这代还顺手拿下了几个垂直基准的高分------PLawBench 73.2(法律,高于闭源三强)、PRBench-Finance 58.3(金融)、HealthBench 60.2(医疗)。GPQA Diamond 92.6 和闭源旗舰基本持平。不过在 HLE(人类最后考试)这类超高难度推理基准上,43.6 分仍低于 Opus 4.8 的 45.7 和 Fable 5 的 53.3------科研攻坚场景开源模型仍然吃力,选型时心里要有数。
Agents' Last Exam(27.0/52.4):最新最难的 Agent 综合考试,Qwen 的 score 52.4 和 GPT-5.6 Sol 的 53.6 几乎贴脸。
Toolathlon Verified(72.5) :工具调用准确率,Qwen 72.5 略低于闭源三强(74.9-77.9),属于"能用但还不是强项"的水平。Automation-Bench(27.3) :600 项自动化任务,和 GPT-5.6 Sol 的 29.7 差距很小,但和 Fable 5 的 29.1 同一档。WideSearch(81.9):深度搜索场景,和 Fable 5 的 81.2 基本打平------这代模型在"联网查资料再回答"的 Agent 场景里已经不掉队了。
长上下文能追上来,靠的是架构换血:Qwen3.8 的 92 层里,采用 Gated DeltaNet 线性注意力与 Gated Attention 按 3:1 交替排布。线性注意力让长序列的计算成本大幅下降,周期性插入的全注意力又保住了检索精度------"要效率也要准头"的路子,和 Kimi K3 的 KDA 混合注意力思路异曲同工,这已经是新一代长上下文模型的标配打法了。
四、维度三:成本、部署与架构
跑分归跑分,接入才是开发者的日常。这一节把成本账、部署账和架构账算清楚。
1. API 成本:2 美元起的开源旗舰
OpenRouter 上 7 家供应商同步提供 qwen/qwen3.8-2.4t-a95b,基础价统一为输入 2 / 输出 6 每百万 token,缓存读取 $0.20:
| 供应商 | 输入 /M | 输出 /M | 缓存读 /M | 延迟 | 吞吐 |
|---|---|---|---|---|---|
| DigitalOcean | $2.00 | $6.00 | $0.20 | 1.06s | 60 tps |
| Modal | $2.00 | $6.00 | $0.25 | 1.03s | 193 tps |
| SiliconFlow | $2.00 | $6.00 | $0.25 | 1.55s | 51 tps |
| Alibaba Cloud Int. | $2.00 | $6.00 | $0.25 | 1.29s | 54 tps |
| DeepInfra | $2.00 | $6.00 | $0.20 | 0.72s | 44 tps |
| Together | $2.50 | $6.25 | $0.50 | 3.34s | 80 tps |
| Venice | $2.50 | $7.50 | $0.31 | 1.07s | 93 tps |
最便宜的 5 家都是 2/6,赶吞吐选 Modal(193 tps),赶延迟选 DeepInfra(0.72s)。阿里云国际版是唯一支持 5 分钟缓存持久化的(创建 2.50 / 读取 0.17 每百万 token),长上下文场景能省不少。
一个具体的成本量级:假设每天 1000 次请求,平均每次输入 5K token、输出 2K token,一个月就是约 150M 输入 + 60M 输出。按 OpenRouter 基准价算:150 × 2 + 60 × 6 = 660/月。同样的请求量,如果一半命中缓存,缓存读取 0.20/M,还能再省下约 $100+。这个量级和闭源旗舰 API 的账单放在一起,差价在数倍到十几倍之间------对个人开发者和中小团队来说,这是实打实的现金流差异。
接入示例,OpenAI 兼容协议,换 base_url 和 model 就行:
bash
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer <YOUR_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen3.8-2.4t-a95b",
"messages": [{"role": "user", "content": "用 Python 写一个带超时重试的 HTTP 客户端"}],
"reasoning_effort": "medium"
}'
Python SDK 写法:
python
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="<YOUR_API_KEY>",
)
resp = client.chat.completions.create(
model="qwen/qwen3.8-2.4t-a95b",
messages=[{"role": "user", "content": "重构这段代码,拆成三个函数并补类型注解"}],
reasoning_effort="medium", # xhigh / medium / low,控制推理深度与成本
)
print(resp.choices[0].message.content)
reasoning_effort 是这代新增的调节旋钮:xhigh 给复杂任务,low 给批量简单请求,成本差距可以到数倍。官方还强调权重版强制思考模式------每个回答都先走推理再输出,不要试图关掉它,这是模型设计的一部分。
接入路径上还有一条容易被忽略的对比:OpenRouter vs QwenCloud。OpenRouter 的好处是 7 家供应商自动容灾、OpenAI 兼容协议零改造,缺点是不提供官方托管版的完整能力;QwenCloud 的托管版 Qwen3.8-Max 才是"满血形态"------1M 上下文默认、视觉输入、非思考模式、内置工具,但各家云厂商的转售价和限流策略各不相同。实际项目中常见的组合是:开发调试用 OpenRouter(便宜、灵活),生产环境按地域和合规要求选 QwenCloud 或国内云厂商的转售入口。
2. 自托管:先算显存账再动手
权重版走 vLLM / SGLang 标准栈,但 2.4T 参数不是闹着玩的:
bash
# 2.4T 权重共 213 个 safetensors 分片,FP16 全量约 4.8TB 显存
# 多节点部署示例(vLLM)
python3 -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen3.8-2.4T-A95B \
--tensor-parallel-size 8 \
--max-model-len 262144 \
--gpu-memory-utilization 0.92
95B 激活参数意味着每次前向的计算量只相当于一个 95B 稠密模型,但 2.4T 的专家权重必须全部驻留内存------推理成本低、内存账本大,这就是 MoE 的宿命。单卡用户直接放弃,四卡 80G 也勉强,现实路径是云厂商的多节点推理或者直接走 API。个人开发者想本地玩,还是老老实实用 27B 那个 Apache 2.0 的小兄弟。
还有个容易被忽略的坑:开源权重版是纯文本 + 强制思考 + 262K 原生上下文,要视觉输入、非思考模式、1M 上下文和内置工具,得用托管版 Qwen3.8-Max(QwenCloud 或各家云厂商转售)。协议上 2.4T 用的是自定义 Qwen3.8-Max License,不是 Apache 2.0------商用前把条款过一遍,别默认它能随便改。
五、选型建议与趋势观察
把前面的数据收拢成场景化的选择:
- 要最快用上:OpenRouter 换 model 名就行,5 家供应商同价 2/6,自动容灾路由。
- 要视觉 + 非思考 + 内置工具:上托管版 Qwen3.8-Max,权重版给不了这些。
- 预算敏感、高频调用:DeepSeek V4 Flash 的输出价仍是开源阵营的地板,这类场景别硬上 2.4T。
- 长文档、知识库、百万级上下文:262K 原生 + MRCR 92.9 是这代的核心卖点,值得重点试。
- 要自托管、要微调:2.4T 权重开放是真福音,但先确认手里有多节点集群(约 4.8TB 显存),否则 API 更现实。
- 极限编程 Agent:Terminal Bench 88.8 的 GPT-5.6 Sol 仍是天花板,但你要为那 2.2 分付出数倍价格。
如果决定试,落地检查清单按这个顺序走:
- 先在 OpenRouter 用自己项目的 20-30 个真实问题跑一轮对比,重点看代码改动是否可合并,别只看跑分;
- 长文档场景单独测一次 200K+ 上下文的检索准确率(MRCR 92.9 是纸面数据,你的文档格式才是真实考场);
- 需要视觉或工具调用的功能,直接上托管版 Qwen3.8-Max,不要在权重版上硬等;
- 商用前把 Qwen3.8-Max License 的条款逐条过一遍,尤其是"自定义协议"里关于再分发和商用部署的边界;
- 上线前排一次高峰压测,7 家供应商的限流和延迟差异不小,容灾路由要提前配好。
趋势观察,五条:
- 开源旗舰从"差一档"变成"同台竞技":PaperBench 93.0、IFBench 82.8 两项反超闭源,Kimi K3 之后不到一个月 Qwen 2.4T 跟上,开源阵营的追赶速度肉眼可见。
- 线性注意力混合架构成为长上下文新路线:Gated DeltaNet 按 3:1 与全注意力交替,和 K3 的 KDA 殊途同归------堆全注意力已经卷不动了。
- 评价口径从"总参数"转向"激活参数 × 推理成本":2.4T 总参、95B 激活,每次生成只付 95B 的计算量,参数竞赛正在被成本竞赛取代。
- 开源协议出现分化:27B 是 Apache 2.0,2.4T 是自定义 License,商用前逐字核对条款正在成为标配动作。
- 自托管门槛依然高企:权重开放 ≠ 人人能跑,2.4T 全量驻留内存的物理约束决定了云 API 才是主流路径,本地部署的舞台留给 27B 级别。
一句话总结这次横评:Qwen3.8-2.4T-A95B 不是"又一个开源大模型",它是开源阵营首次带着完整的旗舰级基准表站到闭源面前------有赢有输,但差距已经缩小到"按场景选型"而不是"按阵营选型"的程度。接下来就看各家 API 供应商的降价速度了。
延伸阅读:
Qwen3.8-Max 接入踩坑实录:3 个隐蔽坑让成本翻 3 倍------模型名迁移、隐式缓存、榜单口径
📌 系列文章
- GLM-5.3 vs Fable 5 vs GPT-5.6 Sol:6 项基准横评,743B 国产编程模型的正面硬刚
- 阿里 Qwen3.8-Max 预览版从零上手指南:2.4T 参数旗舰模型的 5 种接入方式与边界实测
- Muse Glimmer vs Qwen 3.6 vs Gemma 4:30B 本地 Agent 三强横评,24 项基准
- Qwen3.8-27B 本地部署踩坑实录:5 个坑,16G 显存用户先别急
测了 3 款开源旗舰才发现差距这么大。关注我 👆 第一时间获取更多AI工具深度横评。