阿里通义 Qwen3.8-Flash 发布即开源:125B 参数 + MoE 模型,全新架构,更强更稳!

大家好!我是云创AI。智谱和阿里同时甩出王炸模型------重点是价格为上一个版本的1/10,实在是太香了,废话不多说,今天就来聊聊其中的号称Qwen4:Qwen3.8-Flash模型。

8月26日晚间阿里通义千问团队正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重,Next 新架构将是全新一代 Qwen4 系列模型的雏形。

这是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。它原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。

划重点,这是一个多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 它原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token。

据介绍,Qwen3.8-Flash 围绕四个方向进行了系统升级:

  • 在 Attention 方面,采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN 负责高效压缩历史信息,QSA 则通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。面对 1M token 的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。
  • 在 Residual 方面,引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,大幅降低访存开销。
  • 在 Embedding 方面,引入 51B 参数的 N-gram Embedding,利用局部上下文查表扩展模型容量。这些参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠,不长期占用 GPU 显存。
  • 在 Optimization 方面,采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了 Scaling Law。

相比于 Qwen3.7-Plus,Qwen3.8-Flash显著降低了训练与推理成本,训练开销仅约为前者的 1/9,但在编码和办公任务上却具有更强的能力。

性能与成本

相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本仅约为前者的九分之一,但在编码和办公任务上具备更强能力。

在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。

模型表现

纯文本:

多模态:

模型结构:

Base 模型表现:

Qwen3.8-Flash现已上线千问AI平台,对外提供API服务,每百万Tokens输入1元,输出3元。今晚,Qwen3.8-Flash还将首发上线"千问办公"。

我们同时发布了Qwen3.8-Flash-Next的开源权重,Next新架构将是全新一代Qwen4系列模型的雏形。我们这次提前释出结构上的改动,以便在基于此构建 Qwen4 完整模型家族之前,先让社区对其进行检验。

模型权重将在 Hugging Face 与 ModelScope 发布,默认 1M 上下文并内置官方工具的生产版本,以 Qwen3.8-Flash 的形式在千问AI平台提供服务。有关 Qwen3.8-Flash-Next 架构设计、训练方法和实验分析的更多技术细节,请参阅 GitHub 仓库中的技术报告。

可用性与定价

云创AI从官方获悉,Qwen3.8-Flash 即将上线千问 AI 平台,对外提供 API 服务,定价为每百万 Tokens 输入 1 元、输出 3 元。

模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源,同步发布 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文并内置官方工具。

Qwen3.8-Flash模型体验地址👇

技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

技术博客:https://qwen.ai/blog?id=qwen3.8-flash-next

Hugging Face:

https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe\&file=Qwen3.8-Flash-Next

ModelScope:

https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV\&file=Qwen3.8-Flash-Next

千问AI平台:

https://www.qianwenai.com/models/qwen3.8-flash

Qwen3.8-Flash总结

Qwen3.8-Flash-Next 在 Qwen3-Next 所引入的混合架构之上,沿 Attention、Residual、Embedding 与 Optimization 四个方向作了扩展。

QSA 在每一层内部将序列压缩为 micro-block,在保持精确检索能力的同时,降低了长上下文下的注意力开销与 indexing 开销。

Gated Residual 将残差流扩展为多条并行分支,并以逐元素的动态门控控制读写,在算术开销可忽略的前提下改善跨层信息传递与训练稳定性;残差状态还可以保存为 FP8,进一步降低访存量。

N-gram Embedding 以确定性寻址的查表记忆扩展容量,可以在几乎不增加每 token 计算的前提下扩展,并卸载到 host memory。

优化方面,Muon 作为主优化器使用,其中正交化精度、参数分工与融合矩阵拆分是决定性的实现选择,我们也针对新架构重新拟合了 Scaling Law。

和此前发布 Qwen3-Next 时一样,这一次我们仍然选择提前开放这些权重,希望社区能够对这一全新的架构进行测验。我们也将继续对其进行完善,并逐步向 Qwen4 演进。

参考资料:

相关推荐
缘友一世4 天前
Qwen3.8-Flash-Next(Qwen4架构预览模型)
架构·llm·lrm·qwen4
四六的六22 天前
端侧模型多端部署实战:从格式转换到灰度发布,Web 和移动端统一部署流水线
前端·人工智能·大模型·ai编程·ai模型·ai产品·端侧ai
馒头吃馒头24 天前
阿里 Qwen3.8‑Max 正式发布:旗舰模型预告开源,核心能力迭代梳理
国产大模型·阿里千问·阿里qwen3.8‑max
云卷云舒___________1 个月前
Claude Opus 5下周发布,阿里推出Qwen-Audio-3.0-Realtime实时语音对话模型,千问集成苹果智能 | 7月15日 AI日报
ai·anthropic·ai日报·苹果智能·阿里千问·claudeopus5·qwenaudio
名不经传的养虾人4 个月前
什么是API中转站?开发者如何通过API网关低成本调用GPT/Claude/Gemini
ai编程·ai模型·token中转站·ai账单·省钱
庄小焱4 个月前
【AI模型】——RAG格式集成
大模型·rag·ai模型·模型结果格式化
庄小焱4 个月前
【AI模型】——基于知识图谱的RAG
人工智能·大模型·知识图谱·rag·ai模型·ai系统
庄小焱4 个月前
【AI模型】——RAG检索优化
ai·rag·ai模型·rag检索优化
庄小焱4 个月前
【AI模型】——RAG技术简介与实战示例
大模型·rag·ai模型·ai系统·ai算法