中国大模型“八周五连发“:开源与低成本重写全球选型

一、为什么这件事值得在 8 月 5 日这天关注

如果你最近在选型大模型,大概会有一种"追不动"的感觉:上个月还在比参数,这个月又冒出好几个新名字。据《21 世纪经济报道》2026-08-05 的梳理,从 7 月到 8 月初的约八周时间里,阿里巴巴 Qwen3.8-Max、月之暗面 Kimi K3、深度求索 DeepSeek V4、智谱 Z.ai GLM-5.2、字节跳动 Seedance 2.5 五款国产前沿模型密集亮相,被市场称为"八周五模型"。

这背后的真实问题不是"又多了几个模型",而是选型逻辑变了:单纯堆参数的竞争正在让位于成本、本地化部署和 Agent 能力。本文用一份可追溯的发布清单和一张规格图,把这个变化讲清楚,并给出开发者能直接落地的三条选型建议。

二、八周五模型:一份可追溯的发布清单

按公开报道,这五款模型的关键事实如下(参数与榜单以各厂商官方发布为准):

  • Qwen3.8-Max(阿里巴巴):2026-08-03 发布,总参数 2.4 万亿、激活约 950 亿,支持 100 万 Token 上下文,采用稀疏 MoE 与混合注意力;在 Text Arena 排名第五、Vision Arena 排名第二、CodeArena 排名第四。来源:Alibaba Cloud 官方发布、第一财经。
  • Kimi K3(月之暗面):约 7 月下旬发布,总参数约 2.8 万亿,刷新开源模型规模纪录。来源:公开报道聚合。
  • DeepSeek V4(深度求索):V4-Pro 与 V4-Flash 双模型,MIT 许可证开源,支持 100 万 Token 上下文;预览期始于 2026-04-24,正式版于 8 月初推出。来源:公开报道。
  • GLM-5.2(智谱 Z.ai:MIT 许可证开源,据独立观察在部分基准上超越 GPT-5.5;GLM-5.5 预计 8 月发布。来源:公开报道。
  • Seedance 2.5(字节跳动):视频 / 多模态方向的前沿模型,已纳入"八周五模型"行列。来源:《21 世纪经济报道》。

下面用一张时间线把发布节奏可视化:

图1:2026 年 7---8 月国产前沿大模型发布时间线(日期为公开报道近似窗口,精确发布日期以各厂商官方为准;本图为示意性时间线,非精确排期)。

五款模型的规格与开源状态,集中对比如下:

图2:"八周五模型"关键规格与开源状态一览(数据来自各厂商官方发布与公开报道,详见文末来源;未公开项标注"---",本图为信息图而非性能跑分)。

三、Qwen3.8-Max:把"旗舰级"首次交给开源

在五款模型里,Qwen3.8-Max 最值得单独展开,因为它做了一个此前 Qwen-Max 系列没做过的决定:首次开源 Max 级旗舰权重。据第一财经 2026-08-04 报道,Qwen3.8-Max 的模型权重预计于下周正式开源,这也是 Qwen-Max 级别旗舰模型首次对外开放权重,同时开源的还有 Qwen3.8-27B。

从工程视角看,它的几个数字是有信息量的:

  • 2.4 万亿总参数,但只激活 950 亿:靠稀疏 MoE + 混合注意力,把"脑容量"和"推理成本"拆开了。对开发者而言,这意味着你为每次请求实际付费的是激活参数,而不是总参数。
  • 100 万 Token 上下文:按官方说法,单次可分析 200 页以上文档或约 100 小时视频。
  • 榜单位置:Text Arena 第 5、Vision Arena 第 2、CodeArena 第 4(来源:Alibaba Cloud 官方发布与公开报道)。

成本侧也有一个可对照的数字:据第一财经报道,Qwen3.8-Max 每百万输出 Token 成本约 6 美元,而文中对比的标杆模型(Fable 5)约 50 美元。这是单源报道,建议发布前再核对一次价格页面,但它已经说明趋势------旗舰模型的价差正在被快速压缩。

四、OpenRouter 榜单:中国模型包揽调用量前五

参数归参数,真正说明问题的是"大家实际在用哪个"。据央视财经、OpenRouter 与界面新闻 2026-08-02 的报道,在全球多模型聚合平台 OpenRouter 的最新一周榜单中,调用量前五名均为中国公司研发的模型:小米 MiMo-V2.5 以单周约 10.5 万亿 Token 居首,其后依次为 DeepSeek V4-Flash、腾讯混元 3、智谱 GLM-5.2、DeepSeek V4-Pro;中国模型整体调用份额约 63.5%。

另有"AI 开发者日报(0805)"提到,DeepSeek V4 Flash 正式版发布后流量暴涨,OpenRouter 单周调用量超过 7.22 万亿 Token。这两组数字来自不同日期的快照,说明低成本 + 开源权重 + Agent 能力是这一轮采用率上升的核心原因,而非单纯的性能领先。

五、对开发者的三点可落地启示

结合上面的事实,选型时可以少看"参数海报",多看三个维度:

  1. 看单位任务成本,不看总参数。 MoE 的激活参数决定你的推理账单。API 报价、上下文长度和输出长度,比"2.4 万亿"这种总数更影响月底账单。
  2. 优先能本地化部署的开源权重。 MIT / Apache 2.0 等开源许可证允许自托管,能规避数据出境与供应商锁定,也便于跨多云、异构硬件部署。
  3. 把 Agent 能力当硬指标。 长周期任务执行、工具调用、记忆与自愈,正在取代"单次对话质量"成为新竞争焦点(Qwen3.8-Max 的"16 天自主交付一个项目"案例即属此类)。

如果你已经拿到 DashScope 的 API Key,可以用下面这段最小代码先跑通 Qwen3.8-Max 的兼容接口:

python 复制代码
# 以阿里云 DashScope 兼容 OpenAI 协议调用 Qwen3.8-Max
from openai import OpenAI

client = OpenAI(
    api_key="你的DashScope_API_Key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

resp = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "用一句话解释稀疏 MoE 为什么能降低推理成本。"}],
)
print(resp.choices[0].message.content)

本地部署则可以用 vLLM 直接加载开源权重(以 Qwen3.8-27B 为例,权重开源后可用):

bash 复制代码
# 本地用 vLLM 拉起开源权重(示例命令,实际模型名以官方仓库为准)
vllm serve Qwen/Qwen3.8-27B --tensor-parallel-size 2 --max-model-len 131072

六、局限与诚实说明

  • 部分模型的精确发布日期为公开报道的近似窗口(Kimi K3、GLM-5.2、Seedance 2.5、DeepSeek V4 正式版),请以各厂商官方公告为准。
  • "每百万输出 Token 约 6 美元 vs 约 50 美元"为第一财经单源报道;Token 调用量为聚合平台不同日期的快照,会随时间和优惠波动。
  • 本文为技术热点梳理,不构成投资建议,也不荐股;所有数字均来自公开来源,未做独立复现。
  • 本流程仅产出本地草稿,未登录或操作 CSDN,发布请作者本人确认。

主要来源:Alibaba Cloud 官方发布(2026-08-03)、第一财经(2026-08-04)、21 世纪经济报道(2026-08-05)、央视财经 / OpenRouter / 界面新闻(2026-08-02)、AI 开发者日报(2026-08-05)。

相关推荐
凌云拓界2 小时前
NodeVerdict:Node.js 原生诊断数据可视化工具
信息可视化·架构·typescript·开源·node.js·github·bug
龙智DevSecOps解决方案4 小时前
CI/CD | AI Agent 自主配置 TeamCity 构建链实战:从文档读取到流水线跑通全过程
ci/cd·持续集成·ai agent·teamcity
破晓单片机4 小时前
093、STM32项目分享开源:蓝牙智能晾衣架系统
stm32·单片机·嵌入式硬件·开源
勤劳X码农5 小时前
2026年配音软件技术选型:7款TTS方案从轻量到API全参数对比
开源
TunerT_TQ6 小时前
Valhalla 静态工程审阅 #021|华为MindSpore 源码证据驱动评测【大厂开源基础设施特辑】
c++·开源·github·mfc·#大模型开源·#华为开源·#深度学习
计算机魔术师15 小时前
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数
开源
冬奇Lab15 小时前
开源项目第176期:Better Harness — 不审查 diff,审查工作流本身,给 AI 编程 Agent 的五维评估框架
人工智能·开源·agent
遇码17 小时前
认识 LakeMind:一款本地优先的开源 AI 数据探索工作台
人工智能·开源