Qwen3.8-Flash-Next(Qwen4架构预览模型)

Qwen3.8-Flash-Next:这台「Qwen4 架构预览机」,到底在预告什么?

文章目录

  • [Qwen3.8-Flash-Next:这台「Qwen4 架构预览机」,到底在预告什么?](#Qwen3.8-Flash-Next:这台「Qwen4 架构预览机」,到底在预告什么?)
    • [0. 一个值得停下来想的问题](#0. 一个值得停下来想的问题)
    • [1. 先建立三个基础概念](#1. 先建立三个基础概念)
    • [2. 一张表看懂核心规格](#2. 一张表看懂核心规格)
    • [3. 第一条稀疏轴:超级稀疏 MoE(算力稀疏)](#3. 第一条稀疏轴:超级稀疏 MoE(算力稀疏))
    • [4. 第二条稀疏轴:51B「条件记忆」(最容易误读的点)](#4. 第二条稀疏轴:51B「条件记忆」(最容易误读的点))
      • [4.1 一图理解:查表 vs 计算](#4.1 一图理解:查表 vs 计算)
      • [4.2 为什么叫「条件记忆」?和 MoE 什么关系?](#4.2 为什么叫「条件记忆」?和 MoE 什么关系?)
      • [4.3 扩容却不增算力](#4.3 扩容却不增算力)
      • [4.4 这张表放哪?------显存外(off-accelerator)](#4.4 这张表放哪?——显存外(off-accelerator))
    • [5. 第三条创新:QSA 稀疏注意力(长上下文的救星)](#5. 第三条创新:QSA 稀疏注意力(长上下文的救星))
      • [5.1 痛点:全注意力太贵](#5.1 痛点:全注意力太贵)
      • [5.2 QSA 的思路:不是选 token,而是选「块」](#5.2 QSA 的思路:不是选 token,而是选「块」)
      • [5.3 QSA 的训练:两阶段"蒸馏"](#5.3 QSA 的训练:两阶段"蒸馏")
      • [5.4 效果到底如何?](#5.4 效果到底如何?)
    • [6. 第四条:GDN 混合层(长短兼顾)](#6. 第四条:GDN 混合层(长短兼顾))
      • [6.1 为什么不能全是注意力?](#6.1 为什么不能全是注意力?)
      • [6.2 GDN 是什么?](#6.2 GDN 是什么?)
      • [6.3 3:1 的黄金比例](#6.3 3:1 的黄金比例)
    • [7. 架构全景图:把 48 层拼起来](#7. 架构全景图:把 48 层拼起来)
    • [8. 训练配方:为什么说"只花约 1/9 的训练成本"?](#8. 训练配方:为什么说"只花约 1/9 的训练成本"?)
      • [8.1 优化器分而治之:Muon + AdamW](#8.1 优化器分而治之:Muon + AdamW)
      • [8.2 重标定「缩放法则」,扔掉 batch warmup](#8.2 重标定「缩放法则」,扔掉 batch warmup)
      • [8.3 训练稳定性:能扛住"压力测试"](#8.3 训练稳定性:能扛住"压力测试")
    • [9. 它到底能拿来干嘛?](#9. 它到底能拿来干嘛?)
    • [10. 和 Qwen3.8-27B 怎么选?](#10. 和 Qwen3.8-27B 怎么选?)
    • [11. 部署预告:为什么它是"大内存 AI 神机"的甜点模型?](#11. 部署预告:为什么它是"大内存 AI 神机"的甜点模型?)
    • [12. 结语:它意味着什么?](#12. 结语:它意味着什么?)

0. 一个值得停下来想的问题

  • 这几年大模型一直在「变大」:参数从几十亿涨到几千亿、甚至几万亿。按常理,模型越大,跑一次花的算力越多、速度越慢、成本越高。但2026年8月底,Qwen 团队放出的一台新模型,却讲了一个相反的故事:**参数巨大,但跑起来飞快、成本极低。**它就是 Qwen3.8-Flash-Next

  • 它真正的身份,不是一台普通的「Flash 小模型」,而是官方定位的------「Qwen4 架构的预览机」(experimental preview of the architecture that will underpin Qwen4)。

  • Qwen4 家族还没正式发布,Qwen 先把它的"骨架"提前开源出来,让社区先把推理框架、量化、应用准备好。等 Qwen4 真来了,生态已经就位。这种「先给架构、后给家族」的打法,Qwen 在 Qwen3-Next 时期就成功玩过一次。

  • 本篇就带你拆解:这台「预览机」到底牛在哪,它身上的四项架构创新分别是什么,以及------它凭什么能做到「又大又便宜」。

1. 先建立三个基础概念

  • 要看懂 Flash-Next,得先分清三个常被混为一谈的词:参数量、激活参数、FLOPs
概念 通俗理解 它决定了什么
参数量 (Total Params) 模型「脑容量」,背下来的知识总量 存储占用(显存/内存)> 模型有多大
激活参数 (Active Params) 每次处理一个 token,真正「醒过来」参与计算的参数 单步计算量、速度 > 推理快不快
FLOPs 一次推理总共做的乘加运算次数 理论算力成本、耗电
  • 关键点 :对传统"稠密模型"(Dense)来说,参数量 = 激活参数 ,每一次推理,整个模型所有参数都被调用一遍,所以模型越大越慢。而"稀疏模型"的想法是平时把大部分参数"睡"在硬盘/内存里,每次只唤醒一小部分干活。 这样一来,可以把参数量堆得很大(容量大、懂得多),但每次只激活一小部分(算得少、跑得快)。 最主流的稀疏方法是 MoE(Mixture-of-Experts,混合专家)

MoE 是什么? 想象一家大公司,里面分成几百个"专家团队",每个团队擅长不同领域。来了一个任务,不是让所有人一起上,而是由一个"路由器"快速判断该找哪些专家,只让少数几个团队干活,其余继续休息。于是公司人再多,干起活来也只花几个人的力气。这就是 MoE:参数量很大,但每步只激活少数"专家"。

  • Qwen3.8-Flash-Next 正是在这条路上走到极致,并且在此基础上又加了三样新东西。

2. 一张表看懂核心规格

先给结论表(官方模型卡数据):

项目 数值 说明
主模型参数量 125B 能力底子
每 token 激活参数 6B 只唤醒一小部分
额外 N-gram 嵌入表 ~51B 参数 放显存外的"条件记忆"(下文详讲)
MTP 层参数 4B 多 token 预测
隐藏层维度 2560
词表 248,320 (padded)
层数 48 12 × (3 层 GDN → 1 层 QSA) 的混合结构
专家数 512 (10 路由 + 1 共享) 超级稀疏 MoE
原生上下文 262,144 (256K) 可扩到 1,000,000 (1M)
类型 多模态 MoE 图文视频通吃
推理框架 Transformers / vLLM / SGLang / TokenSpeed
许可 Qwen Community License 1.0 可商用,超阈值需单独协议
  • 几个数字值得停下来感受一下:125B 的"大脑",每步只叫醒 6B,也就是说,真正干活的只有 6B 量级,但容量却是 125B。这就是「又大又便宜」的第一层奥秘。

和同门兄弟比一比 (激活稀疏度一目了然):

模型 总参数 每 token 激活
Qwen3.8-27B 27.8B 27.8B(全激活·稠密)
Qwen3-Next-80B-A3B 80B 3B
Qwen3.8-Flash-Next 125B 仅 ~6B
Qwen3.8-Max 2.4T 95B
  • 注意Qwen3.8-27B:它总参数和激活参数一样,是典型的稠密模型;而 Flash-Next 用 125B 的容量,只付出 6B 的激活代价。

为什么叫「Flash」? 官方的「Flash」不是说"这个模型更小、容量更少",而是说它缩减的是各种成本 :每 token 的计算成本、注意力的成本、记忆查表的成本、以及训练的成本。追求的是「高参数容量 + 低激活 + 稀疏注意力 + 条件记忆 + 高吞吐」------要的是"闪电般的快",而不是"身材小"。

3. 第一条稀疏轴:超级稀疏 MoE(算力稀疏)

Flash-Next 的 MoE 设计是 512 个专家,每次路由选 10 个 + 1 个共享专家

  • 10 个路由专家 = 每步动态挑选的"主力团队"
  • 1 个共享专家 = 每步都参战的"常驻团队",保证基础能力不丢
    把 512 个专家里一次只召 11 个,稀疏度极高,单步计算量被压得很低。这是第一条"稀疏轴"------它稀释的是"算力"。

4. 第二条稀疏轴:51B「条件记忆」(最容易误读的点)

  • 这是整个模型最容易被误读的地方。预发布时大家看到数字「~51B 额外记忆参数」,第一反应都是:哦,模型是不是 125B + 51B = 176B,那不是更大了吗? 错。这 51B 不是普通参数,而是「条件记忆」(Conditional Memory)。

4.1 一图理解:查表 vs 计算

  • 普通参数要靠(矩阵乘法)才能用,每次用都要花 FLOPs。

而这 51B 是一条查表(lookup)记忆:

  • 训练时,把语料里高频出现的 n-gram(连续的几个词) 预先算好向量(embedding),存进一张表。
  • 推理时,遇到某个 n-gram,直接从表里取(查表) 出对应向量,和当前 token 的表示"融合"一下。
  • 查找是 O(1) 的------不管表多大,查一个键的时间都一样,几乎不需要算力。

什么是 n-gram? 就是"连续 n 个词"。比如 "Qwen" 这个 unigram(1-gram)、"Qwen 模型" 这个 bigram(2-gram)、"Qwen 模型很" 这个 trigram(3-gram)。高频 n-gram 往往承载常识、固定搭配、专有名词------属于"背下来比现算更快"的那类知识。
什么是 embedding(词向量)? 把每个词映射成一串数字(向量),让语义相近的词在向量空间里靠得近。比如"猫"和"狗"的向量会比较接近。模型主要就是在这些向量上做运算。

4.2 为什么叫「条件记忆」?和 MoE 什么关系?

这里要引入一个很漂亮的对称:

  • MoE = 条件计算(conditional computation):根据输入决定"让谁算"。
  • N-gram / Engram = 条件记忆(conditional memory):根据输入决定"查哪条记忆"。

MoE 稀释算力 (少算),Engram 稀释存储的读取成本(少算,直接查)。这两条正交(互相独立)的"稀疏轴"叠在一起,是这套架构很有含金量的一点。

4.3 扩容却不增算力

  • 最妙的地方:给这张表加容量,几乎不增加推理的 FLOPs。 因为表再大,查一次还是 O(1)。这就是为什么官方敢说 Flash-Next「扩容却不增算力」:126B 里,真正每步要算的只有 6B 的 MoE 激活部分 + 查表。

4.4 这张表放哪?------显存外(off-accelerator)

  • 因为查表不需要常驻在 GPU 里算,官方把它设计成可以放在显存之外 (系统内存,甚至 SSD),按需异步取回(host-memory prefetching)。这直接把它变成了「大内存 AI PC / 服务器」的宠儿------你不需要巨大的显存来装它。

  • Flash-Next 的 n-gram 表规模:2000 万条(bigram/trigram) ,每条约一个 2560 维向量,加起来 ≈ 51B 参数 。官方技术报告还专门研究了"表放在第几层最好""词汇表多大最好",最终选放在第 2 层(可以在计算第一层的同时,异步预取,隐藏延迟),并权衡出一个性价比合适的表大小。

  • 得益于 n-gram 表稀疏访问的特性,做量化后可以更省。社区测算:在 4-bit 量化下,125B 主权重约 58GiB,51B n-gram 表约 23.7GiB。

这一条轴,正是来自 DeepSeek 的 Engram / SCONE 路线。它们把"高频 n-gram 预计算 + 查表取回"这条技术路线发扬光大,Flash-Next 把它拿来作为 MoE 之外的第二条稀疏轴。

5. 第三条创新:QSA 稀疏注意力(长上下文的救星)

5.1 痛点:全注意力太贵

  • 讲 QSA 之前,先讲一个几乎所有长上下文模型都要面对的问题。
  • 标准的 自注意力(Self-Attention) 机制,让每个 token 都能"看"到前面所有 token,从而精准捕捉依赖关系。它的代价是:计算量随序列长度呈 O(N²) 增长 ------上下文从 32K 涨到 1M(约 32 倍),注意力计算量要爆炸成平方级(约 1000 倍)。同时,它还要把每个 token 的 Key/Value 都存下来作为 KV Cache,序列越长,缓存越大,直到撑爆显存。
  • 什么是 KV Cache? 生成长文时,模型每出一个字都要"回头"看前面所有的字。为了不重算,它把每个历史 token 的 key(查找键)和 value(内容值)缓存起来。序列越长,缓存越庞大。

一句话:长上下文是刚需(读长文档、改大代码库),但全注意力让它在成本上不可承受。

5.2 QSA 的思路:不是选 token,而是选「块」

  • 已有很多"稀疏注意力"方案,思路通常是:不是让每个 query 看全部历史,而是让一个轻量级的索引器(indexer) 先扫一遍,挑出最重要的那些 token,核心注意力只在这些 token 上算,从而把 O(N²) 压下来。

  • QSA( Q wen S parse A ttention)是这条路线上的改进,但它有一个关键不同------它在"微块"(micro-block)级别选,而不是单个 token。

  • 索引器先把长序列压缩成若干个微块 ,逐块打分、选出最重要的若干块(预算:512 块 或 2048 token)。核心计算只在选出的 上展开。这样做的收益:计算量直接从 O(N²) 降到 O(N²/r) 附近(r 是压缩倍数),而且索引器的成本本身也和序列长度相关,长序列时收益更明显 。官方技术报告里,微观层(组)级实测:在 1M 上下文下,QSA 比稠密注意力 prefill 快 7.6 倍、decode 快 4.9 倍

5.3 QSA 的训练:两阶段"蒸馏"

QSA 不是一拍脑袋设计出来的,它是在持续预训练(CPT)阶段,通过两阶段蒸馏教出来的:

  1. 阶段一:稠密蒸馏(Dense Distillation) ------ 先用一个"全注意力老师"生成完整的注意力分布,让轻量索引器学习去模仿它(哪块重要),约 1000 步。
  2. 阶段二:稀疏训练(Sparse Training) ------ 索引器学会以后,让整个主干网络在它的指导下,只对选出的块做核心注意力,并继续做 KL 蒸馏校准,直到网络适应这种稀疏模式。

5.4 效果到底如何?

技术报告里最惊艳的实验,是长上下文的检索能力(RULER / MRCR 测试,可以理解为"在超长文本里捞针"):

测试 全注意力基线 加 QSA
RULER(1M 处) 70.16 80.93
MRCR(1M 处) 28.64 93.00
  • 在有 QSA 的情况下,长上下文检索能力不但没降,反而大幅提升。 原因很有意思:QSA 的"块级压缩"反而成了一种天然的"注意力正则",让模型在极长的上下文里更容易聚焦到关键信息,而不是被海量无关内容分散。

6. 第四条:GDN 混合层(长短兼顾)

6.1 为什么不能全是注意力?

  • 上一节说了全注意力"贵"的缺点。那干脆全换掉注意力好不好?也不行------线性注意力类机制虽然便宜,但"精准回溯某一条具体信息"的能力差 。就像一个人记性好,能把文章大意记住,但你要他精准复述某行某句,他可能就抓瞎了。所以现在的共识是混着来:大部分层用便宜的机制处理长上下文(记"大意"),少数层保留全注意力(做"精准检索")。

6.2 GDN 是什么?

  • GDN(Gated DeltaNet,门控 Delta 网络) 是 Qwen 用的线性注意力层 。它的谱系来自 DeltaNet 和 Mamba-2。与传统注意力相比,核心区别是:
    • 传统注意力:KV Cache 随序列变长而膨胀 + 计算量 O(N²)。
    • GDN:维护一个固定大小的"循环状态"(fixed-size recurrent state) ,用一套学习到的门控规则 不断更新它。状态大小是固定的,不随序列增长。

于是长上下文对它来说几乎不增加成本。它通过"擦除改写"(erase-and-write)的门控机制,把新信息写进状态、把过时信息擦掉,实现高效的在线记忆。

打个比方:全注意力像"每次回答问题都翻遍全档案",精准但慢、占地方;GDN 像"边听边记课堂笔记",越记越顺手、不占地方,但笔记只能记重点,细节可能丢。

6.3 3:1 的黄金比例

  • Qwen 的混合方案不是随便混,而是有讲究的:在 Flash-Next 的 48 层里,每 4 层里有 3 层是 GDN、1 层是全注意力(实现为 QSA)。即结构是:
bash 复制代码
12 × [ 3 × ( Gated DeltaNet → MoE ) → 1 × ( Qwen Sparse Attention → MoE ) ]
  • 这个 3:1 的比例,Qwen 从 Qwen3-Next 一路验证过来,是目前在"效率"和"精准检索"之间找到的均衡点。官方技术报告也做了消融实验:相比被它替代的全注意力 Transformer 基线和滑动窗口注意力(SWA)基线,GDN 混合在 9 个基准里的 8 个都更优。

7. 架构全景图:把 48 层拼起来

  • 把上面四条创新合起来,就是 Flash-Next 的完整骨架。官方架构图非常清晰,拆解如下:
bash 复制代码
输入 Token
   │
   ▼
[词表嵌入 Vocabulary Embedding]──────────────►[ N-gram 嵌入层(仅第 2 层) ]
   │                                                     │
   │  (12 个"混合块",每个块 = 3 层 GDN + 1 层 QSA,共 48 层)
   ▼
┌─────────────────────────────────────────────┐
│  GDN 层  →  MoE                             │  ← 3 层(便宜,记大意)
│  GDN 层  →  MoE                             │
│  GDN 层  →  MoE                             │
│  QSA 层  →  MoE                             │  ← 1 层(精准检索)
│                                             │
│  (每层内部:门控残差 GR 读取 → 注意力/MoE → GR 写回) │
└─────────────────────────────────────────────┘
   │
   ▼
[ GR Read ] → [预测头 Prediction Head]
   │
   ▼
[MTP 模块(多 token 预测)]  ← 复用 QSA 的索引,加速解码

几个细节值得注意:

  • 每层内部的「门控残差」(Gated Residual, GR) :这是让这么深的网络能稳定训练的关键。它把残差流"加宽"成 4 条分支 ,通过一个逐元素、数据依赖的"读门" 和一个逐分支的"写门" 来精细控制信息流动。相当于把原来单一的"传送带"拓宽成 4 条,再装上闸门。带来的好处是:表达能力更细腻,同时保持训练稳定、推理开销极低。技术报告还发现,这些分支里有一条专门负责"跨层长距离传信息",其余几条负责局部------各司其职。

  • MTP(Multi-Token Prediction,多 token 预测) :解码时不止预测下一个 token,而是同时预测后面几个,能显著提升吞吐。Flash-Next 让 MTP 模块复用 QSA 算好的索引,进一步省掉额外开销。

  • 「GR Read → 预测头」:注意整个模型在输出层前,还有一个 GR Read 做最后的信息汇聚。


8. 训练配方:为什么说"只花约 1/9 的训练成本"?

官方的一层宣言是:Flash-Next 用约 1/3 的训练 token、约 1/9 的训练 FLOPs,达到上一代 397B-A17B 模型的质量。这不只是架构的功劳,还有一套"量身定制"的训练配方。

技术报告里把架构、效率、优化视为一个相互耦合的系统,重点讲了训练相关的三个创新:

8.1 优化器分而治之:Muon + AdamW

传统上大家基本都用 AdamW。但 Flash-Next 用了一个 矩阵级优化器 Muon ,并且按权重类别分别处理:

  • 用 Muon:注意力层的 q/k/v、输出投影,GDN 的输入/输出投影,MoE 路由与共享专家的 fc1/fc2,以及 n-gram 层的 key/value 投影------这些是"真正做线性映射"的二维权重。
  • 用 AdamW:输入词嵌入、输出头,MoE 路由器,门控残差的两个低秩投影,以及 n-gram 表的行(且这里关闭权重衰减)。

为什么要拆开?技术报告发现:Muon 对"等距正交化"更友好,但对某些权重(比如嵌入、MoE 路由器)会放大训练早期波动、甚至把路由器搞塌,所以这些留在表现更稳健的 AdamW 上。

8.2 重标定「缩放法则」,扔掉 batch warmup

以往共识:训大模型要"小 batch 起步、逐步加大"(batch-size warmup)。但技术报告发现,换用 Muon + 新架构后,这条经验不成立了。他们重新拟合了缩放法则(scaling law) ,发现最优的 batch size 和 学习率都要显著上调,而且学习率随模型变大的衰减更慢。于是:

  • 直接用目标 batch size 起步,不做 warmup。 测试表明,做 warmup 反而让损失略高,还要多花 18.8% 的优化器步数。更优的超参数让训练更高效、更稳,收敛更快。

8.3 训练稳定性:能扛住"压力测试"

大模型训练最怕"突然损失爆炸、梯度崩掉"。技术报告专门做了 stress test(压力测试):把学习率拉到最优值的 2 倍、4 倍,看谁能扛住。

结果:Qwen3.5 的老配方 + 新架构在 2× 学习率下就开始崩(10k 步内 loss spike),而 Muon + 门控残差(GR)的新配方在 4× 学习率下依然稳如磐石 。技术上,GR 显著降低了梯度范数尖峰和激活离群值(outlier)的频率与幅度;配合 Muon 的等距正交化,让训练极度稳定------全程不需依赖 qk-clip / SWIGL 这类额外的剪切技巧

9. 它到底能拿来干嘛?

官方模型卡给了一些典型场景,结合评测数据这里归纳为几类(注意:以下基准分均为官方自报,尚未被第三方独立复现,应视为"宣称"而非"定论"):

  1. Agentic Coding(智能体编程) :复杂代码库、Repo 级任务。SWE-bench Pro 62.5SWE-bench Multilingual 81.0DeepSWE 1.1 58.7,在多语言软件工程上明显优于同门 27B 稠密版。
  2. 长程任务(Long-horizon):超长文档、多步推理。原生 256K、可扩 1M 的窗口,配合稀疏注意力与 GDN,长上下文是它的主场。
  3. 多模态创作 :文本 + 图片 + 视频统一理解。模型卡里有大量视觉-语言基准(如 MathVision 90.6 / 95.7RealWorldQA 88.5LVBench 76.6AndroidWorld 84.5OSWorld 2.0 等),在移动端/计算机操作、体感、视频理解等任务上表现突出。
  4. 本地私有化 :因为 n-gram 记忆放显存外 + 只有 6B 激活,它天然适合"大内存 + 中低显存"的 AI 工作站/个人设备,数据不出门。
  • 对比一下同门标杆:
指标 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus(397B) DeepSeek-V4-Flash-0731
激活参数 6B 27B 17B 13B
SWE-bench Pro 62.5 61.7 55.8 56.0
GPQA Diamond 91.7 89.2 90.3 90.8
LiveCodeBench v6 91.9 90.3 89.6 90.6
CoWorkBench(长程办公) 73.9 70.7 65.1 45.1
JobBench 55.7 33.4 27.6 41.3

可以看到:在很多任务上,Flash-Next 用 6B 激活,不只碾压 27B 稠密版,甚至在不少 agentic / 长程任务上超过了体量 3 倍多的 397B 版 ,并在部分指标上与 DeepSeek-V4-Flash 打个平手或反超。但也正如技术报告所说,它"领先的是 8/14 个预训练基准,其余约落后 2.6 分"------并非全面碾压,而是有强有弱。

10. 和 Qwen3.8-27B 怎么选?

这是社区最常问的"灵魂拷问"。它们是两种不同的东西,不是替代关系。

维度 Qwen3.8-27B Qwen3.8-Flash-Next
结构 稠密,结构成熟 全新稀疏架构,Qwen4 预览
生态/框架 生态马上好、量化成熟 推理框架在追赶,新
内存需求 低、容易部署 总容量大,但靠 n-gram 放显存外缓解
单 token 算力 27B 全激活,可预测 6B 激活,通常更快
长上下文 可能更强
Agentic 编程 可能更强
大内存设备 一般 非常友好

一句话:27B 是"当下就能稳妥用"的东西,而 Flash-Next 是"为下一代架构铺路、值得提前研究"的东西。 急着上线、要稳定,选 27B;想拥抱 Qwen4 趋势、手上有大内存设备、做长上下文/agentic 场景的先锋实践者,可以盯 Flash-Next。

11. 部署预告:为什么它是"大内存 AI 神机"的甜点模型?

  • Flash-Next 的一个核心设计目标就是**"异构内存推理"**:把模型不同部分放到不同层级的内存里,按需取用。

    • GPU 显存:活跃计算的部分、高频权重、KV Cache。
    • 系统内存(System RAM):大部分 MoE 权重 + n-gram 记忆表。
    • NVMe SSD:冷数据 / 长尾 memory。
  • 配合社区测算(4-bit 下主权重约 58GiB + n-gram 表约 23.7GiB),它不需要超大显存,而是需要"大内存 + 中低显存"的组合------比如 128GB 内存的 AI 工作站、统一内存的 Mac,都很有戏。这也让它成为「大内存 AI PC」概念的甜点模型。

12. 结语:它意味着什么?

  • Qwen3.8-Flash-Next 最大的意义,不在于它这个"个体"有多强,而在于它是一份关于 Qwen4 的"答卷" 。它把四样东西同时搬了出来:
    1. 超级稀疏 MoE(算力稀疏)------ 125B 容量 / 6B 激活;
    2. N-gram 条件记忆(存储稀疏)------ 扩容不增算力,还能放显存外;
    3. QSA 稀疏注意力 ------ 让 256K / 1M 长上下文真正可用;
    4. GDN 混合层 + 门控残差 ------ 长短兼顾、又稳又省。

它的口号是"Towards Ultimate Cost-Efficiency(追求极致成本效率) "。用 1/3 的 token、1/9 的 FLOPs 拿到上一代 397B 的质量,这背后不是某单个花哨技巧,而是一条"架构 + 效率 + 优化"三位一体、被系统性验证过的路线

对于一个写代码、做应用、跑本地模型的你来说,真正值得做的准备工作是:提前理解并接纳这套"稀疏化 + 记忆化 + 长上下文"的范式,而不是只盯着一张基准表。

Qwen4 家族,大概率就长在这个骨架上。

附:术语小抄(TL;DR)

术语 一句话解释
MoE 分专家的稀疏模型,每步只叫醒少数专家干活
激活参数 每处理一个 token 真正参与计算的参数,决定速度
FLOPs 一次推理的总乘加运算量,决定算力成本
n-gram 连续 n 个词,高频 n-gram 承载常识、固定搭配
Embedding 把词映射成向量,语义相近则向量靠近
条件记忆 按需"查表取回"的记忆(MoE 之外的第二种稀疏轴)
KV Cache 生成长文时缓存的历史 key/value,序列越长越占显存
自注意力 标准机制,精确检索但 O(N²) 且缓存大
QSA Qwen 稀疏注意力:在"微块"级选重要内容,压成本
GDN Gated DeltaNet,线性注意力,固定大小循环状态,长上下文便宜
门控残差 (GR) 加宽残差流、加读写门,让深网络稳且细腻
MTP 多 token 预测,解码一次出多个 token,提吞吐
异构内存推理 把模型不同部分放显存/内存/SSD 分层,省显存

参考资料

  • 官方模型卡 :ModelScope Qwen/Qwen3.8-Flash-Next
  • 官方技术报告:《On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability》(Qwen Team, 2026-08)
  • 官方架构图 :Qwen3.8-Flash-Next/architecture.png
  • 社区分析:OrcaRouter《Qwen3.8-Flash-Next Is Out: Qwen4 Architecture Confirmed》、NVIDIA DGX Spark 论坛讨论等
相关推荐
m0_587383001 小时前
课程培训系统开发实战:从技术选型到核心模块设计
java·spring boot·架构·系统架构
insertYam1 小时前
[hadoop高可用架构]
大数据·hadoop·架构
ZGIAI10 小时前
ZGI Workflow 并发控制:保护下游接口
人工智能·架构
ZGIAI10 小时前
知识库有结果,不等于召回率合格
人工智能·架构
老郑聊AI业财智造12 小时前
从“数字影子”到“智能共生体”:数字孪生的架构演进与产业落地全景剖析
架构
网安蟹佬霸12 小时前
WAF绕过技术实战:从规则检测到编码绕过全指南(2026最新版,附Payload集与自动化脚本)
运维·安全·网络安全·架构·自动化·网安
国科安芯13 小时前
轨道供电韧性:ASP4644四通道降压架构在低轨卫星平台电源管理中的适用性分析
运维·网络·数据库·嵌入式硬件·架构·状态模式·低轨卫星星座
云上工程笔记14 小时前
RDMA 高速互联 GPU 云怎么选:多卡训练、分布式训练与 RoCE/InfiniBand 架构对比
架构·云计算·gpu算力
这个DBA有点耶15 小时前
GaussDB和金仓KingbaseES本质差异:技术路线、Oracle兼容度、适用场景全解析
数据库·oracle·架构