阿里通义 Qwen3.8-Flash 发布即开源:125B 参数 + MoE 模型,全新架构,更强更稳!

大家好!我是云创AI。智谱和阿里同时甩出王炸模型------重点是价格为上一个版本的1/10,实在是太香了,废话不多说,今天就来聊聊其中的号称Qwen4:Qwen3.8-Flash模型。

8月26日晚间阿里通义千问团队正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重,Next 新架构将是全新一代 Qwen4 系列模型的雏形。

这是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。它原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。

划重点,这是一个多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 它原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token。

据介绍,Qwen3.8-Flash 围绕四个方向进行了系统升级:

  • 在 Attention 方面,采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN 负责高效压缩历史信息,QSA 则通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。面对 1M token 的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。
  • 在 Residual 方面,引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,大幅降低访存开销。
  • 在 Embedding 方面,引入 51B 参数的 N-gram Embedding,利用局部上下文查表扩展模型容量。这些参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠,不长期占用 GPU 显存。
  • 在 Optimization 方面,采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了 Scaling Law。

相比于 Qwen3.7-Plus,Qwen3.8-Flash显著降低了训练与推理成本,训练开销仅约为前者的 1/9,但在编码和办公任务上却具有更强的能力。

性能与成本

相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本仅约为前者的九分之一,但在编码和办公任务上具备更强能力。

在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。

模型表现

纯文本:

多模态:

模型结构:

Base 模型表现:

Qwen3.8-Flash现已上线千问AI平台,对外提供API服务,每百万Tokens输入1元,输出3元。今晚,Qwen3.8-Flash还将首发上线"千问办公"。

我们同时发布了Qwen3.8-Flash-Next的开源权重,Next新架构将是全新一代Qwen4系列模型的雏形。我们这次提前释出结构上的改动,以便在基于此构建 Qwen4 完整模型家族之前,先让社区对其进行检验。

模型权重将在 Hugging Face 与 ModelScope 发布,默认 1M 上下文并内置官方工具的生产版本,以 Qwen3.8-Flash 的形式在千问AI平台提供服务。有关 Qwen3.8-Flash-Next 架构设计、训练方法和实验分析的更多技术细节,请参阅 GitHub 仓库中的技术报告。

可用性与定价

云创AI从官方获悉,Qwen3.8-Flash 即将上线千问 AI 平台,对外提供 API 服务,定价为每百万 Tokens 输入 1 元、输出 3 元。

模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源,同步发布 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文并内置官方工具。

Qwen3.8-Flash模型体验地址👇

技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

技术博客:https://qwen.ai/blog?id=qwen3.8-flash-next

Hugging Face:

https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe\&file=Qwen3.8-Flash-Next

ModelScope:

https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV\&file=Qwen3.8-Flash-Next

千问AI平台:

https://www.qianwenai.com/models/qwen3.8-flash

Qwen3.8-Flash总结

Qwen3.8-Flash-Next 在 Qwen3-Next 所引入的混合架构之上,沿 Attention、Residual、Embedding 与 Optimization 四个方向作了扩展。

QSA 在每一层内部将序列压缩为 micro-block,在保持精确检索能力的同时,降低了长上下文下的注意力开销与 indexing 开销。

Gated Residual 将残差流扩展为多条并行分支,并以逐元素的动态门控控制读写,在算术开销可忽略的前提下改善跨层信息传递与训练稳定性;残差状态还可以保存为 FP8,进一步降低访存量。

N-gram Embedding 以确定性寻址的查表记忆扩展容量,可以在几乎不增加每 token 计算的前提下扩展,并卸载到 host memory。

优化方面,Muon 作为主优化器使用,其中正交化精度、参数分工与融合矩阵拆分是决定性的实现选择,我们也针对新架构重新拟合了 Scaling Law。

和此前发布 Qwen3-Next 时一样,这一次我们仍然选择提前开放这些权重,希望社区能够对这一全新的架构进行测验。我们也将继续对其进行完善,并逐步向 Qwen4 演进。

参考资料:

相关推荐
浩风祭月1 天前
Claude Haiku 5.5来了:适合哪些任务?“便宜75%”为什么不是会员降价
claude·ai模型·claude code·claude haiku
长路 ㅤ   2 天前
OpenAI协议01、OpenAI底层协议快速理解
工具调用·ai模型·协议设计·流式调用·openai兼容api
浪淘沙jkp3 天前
【ComfyUI 国产模型炼丹记】第一篇:V100 16G 部署 Wan2.2:从环境配置到首次出片
文生视频·comfyui·ai模型·wan2.2·wan2.1·v100 16g
云卷云舒___________7 天前
Qwen 4首测泄露!DeepSeek V4 mini展示名为flash?蚂蚁Ling-3.1-flash同步炸场 | 10月1日 AI日报
人工智能·开源模型·deepseek·ai日报·qwen4·ling31flash·蚂蚁百灵
浅安的邂逅21 天前
260918-白帽把 OpenAI 论坛“打穿“了:攻防赛漏洞、账户被 Claude 入侵、模型偷偷掩盖不当行为
人工智能·大模型·ai编程·ai模型·行业动态
Fang_YuanAI22 天前
OST传媒提出“AIGC原生IP”:AI内容正在进入IP时代
ai·aigc·短视频·ai视频·ai模型·ai漫剧·ai短剧
浅安的邂逅1 个月前
260902-Qwen3.8-Max-0902 登顶 Code Arena WebDev:1691 分超 Opus 5
人工智能·ai模型·行业动态·产品发布/更新·模型发布/更新
prog_61031 个月前
【笔记】cllama:搜罗万象当LLM api server测qwen3.8:flash-next
笔记·大语言模型·agent·vibe-coding·qwen3.8-flash
缘友一世1 个月前
Qwen3.8-Flash-Next(Qwen4架构预览模型)
架构·llm·lrm·qwen4