Qwen3.8-Flash-Next:这台「Qwen4 架构预览机」,到底在预告什么?
文章目录
- [Qwen3.8-Flash-Next:这台「Qwen4 架构预览机」,到底在预告什么?](#Qwen3.8-Flash-Next:这台「Qwen4 架构预览机」,到底在预告什么?)
-
- [0. 一个值得停下来想的问题](#0. 一个值得停下来想的问题)
- [1. 先建立三个基础概念](#1. 先建立三个基础概念)
- [2. 一张表看懂核心规格](#2. 一张表看懂核心规格)
- [3. 第一条稀疏轴:超级稀疏 MoE(算力稀疏)](#3. 第一条稀疏轴:超级稀疏 MoE(算力稀疏))
- [4. 第二条稀疏轴:51B「条件记忆」(最容易误读的点)](#4. 第二条稀疏轴:51B「条件记忆」(最容易误读的点))
-
- [4.1 一图理解:查表 vs 计算](#4.1 一图理解:查表 vs 计算)
- [4.2 为什么叫「条件记忆」?和 MoE 什么关系?](#4.2 为什么叫「条件记忆」?和 MoE 什么关系?)
- [4.3 扩容却不增算力](#4.3 扩容却不增算力)
- [4.4 这张表放哪?------显存外(off-accelerator)](#4.4 这张表放哪?——显存外(off-accelerator))
- [5. 第三条创新:QSA 稀疏注意力(长上下文的救星)](#5. 第三条创新:QSA 稀疏注意力(长上下文的救星))
-
- [5.1 痛点:全注意力太贵](#5.1 痛点:全注意力太贵)
- [5.2 QSA 的思路:不是选 token,而是选「块」](#5.2 QSA 的思路:不是选 token,而是选「块」)
- [5.3 QSA 的训练:两阶段"蒸馏"](#5.3 QSA 的训练:两阶段"蒸馏")
- [5.4 效果到底如何?](#5.4 效果到底如何?)
- [6. 第四条:GDN 混合层(长短兼顾)](#6. 第四条:GDN 混合层(长短兼顾))
-
- [6.1 为什么不能全是注意力?](#6.1 为什么不能全是注意力?)
- [6.2 GDN 是什么?](#6.2 GDN 是什么?)
- [6.3 3:1 的黄金比例](#6.3 3:1 的黄金比例)
- [7. 架构全景图:把 48 层拼起来](#7. 架构全景图:把 48 层拼起来)
- [8. 训练配方:为什么说"只花约 1/9 的训练成本"?](#8. 训练配方:为什么说"只花约 1/9 的训练成本"?)
-
- [8.1 优化器分而治之:Muon + AdamW](#8.1 优化器分而治之:Muon + AdamW)
- [8.2 重标定「缩放法则」,扔掉 batch warmup](#8.2 重标定「缩放法则」,扔掉 batch warmup)
- [8.3 训练稳定性:能扛住"压力测试"](#8.3 训练稳定性:能扛住"压力测试")
- [9. 它到底能拿来干嘛?](#9. 它到底能拿来干嘛?)
- [10. 和 Qwen3.8-27B 怎么选?](#10. 和 Qwen3.8-27B 怎么选?)
- [11. 部署预告:为什么它是"大内存 AI 神机"的甜点模型?](#11. 部署预告:为什么它是"大内存 AI 神机"的甜点模型?)
- [12. 结语:它意味着什么?](#12. 结语:它意味着什么?)
0. 一个值得停下来想的问题
-
这几年大模型一直在「变大」:参数从几十亿涨到几千亿、甚至几万亿。按常理,模型越大,跑一次花的算力越多、速度越慢、成本越高。但2026年8月底,Qwen 团队放出的一台新模型,却讲了一个相反的故事:**参数巨大,但跑起来飞快、成本极低。**它就是
Qwen3.8-Flash-Next。 -
它真正的身份,不是一台普通的「Flash 小模型」,而是官方定位的------「Qwen4 架构的预览机」(experimental preview of the architecture that will underpin Qwen4)。
-
Qwen4 家族还没正式发布,Qwen 先把它的"骨架"提前开源出来,让社区先把推理框架、量化、应用准备好。等 Qwen4 真来了,生态已经就位。这种「先给架构、后给家族」的打法,Qwen 在 Qwen3-Next 时期就成功玩过一次。
-
本篇就带你拆解:这台「预览机」到底牛在哪,它身上的四项架构创新分别是什么,以及------它凭什么能做到「又大又便宜」。
1. 先建立三个基础概念
- 要看懂 Flash-Next,得先分清三个常被混为一谈的词:参数量、激活参数、FLOPs。
| 概念 | 通俗理解 | 它决定了什么 |
|---|---|---|
| 参数量 (Total Params) | 模型「脑容量」,背下来的知识总量 | 存储占用(显存/内存)> 模型有多大 |
| 激活参数 (Active Params) | 每次处理一个 token,真正「醒过来」参与计算的参数 | 单步计算量、速度 > 推理快不快 |
| FLOPs | 一次推理总共做的乘加运算次数 | 理论算力成本、耗电 |
- 关键点 :对传统"稠密模型"(Dense)来说,参数量 = 激活参数 ,每一次推理,整个模型所有参数都被调用一遍,所以模型越大越慢。而"稀疏模型"的想法是平时把大部分参数"睡"在硬盘/内存里,每次只唤醒一小部分干活。 这样一来,可以把参数量堆得很大(容量大、懂得多),但每次只激活一小部分(算得少、跑得快)。 最主流的稀疏方法是 MoE(Mixture-of-Experts,混合专家)。
MoE 是什么? 想象一家大公司,里面分成几百个"专家团队",每个团队擅长不同领域。来了一个任务,不是让所有人一起上,而是由一个"路由器"快速判断该找哪些专家,只让少数几个团队干活,其余继续休息。于是公司人再多,干起活来也只花几个人的力气。这就是 MoE:参数量很大,但每步只激活少数"专家"。
- Qwen3.8-Flash-Next 正是在这条路上走到极致,并且在此基础上又加了三样新东西。
2. 一张表看懂核心规格
先给结论表(官方模型卡数据):
| 项目 | 数值 | 说明 |
|---|---|---|
| 主模型参数量 | 125B | 能力底子 |
| 每 token 激活参数 | 6B | 只唤醒一小部分 |
| 额外 N-gram 嵌入表 | ~51B 参数 | 放显存外的"条件记忆"(下文详讲) |
| MTP 层参数 | 4B | 多 token 预测 |
| 隐藏层维度 | 2560 | |
| 词表 | 248,320 (padded) | |
| 层数 | 48 | 12 × (3 层 GDN → 1 层 QSA) 的混合结构 |
| 专家数 | 512 (10 路由 + 1 共享) | 超级稀疏 MoE |
| 原生上下文 | 262,144 (256K) | 可扩到 1,000,000 (1M) |
| 类型 | 多模态 MoE | 图文视频通吃 |
| 推理框架 | Transformers / vLLM / SGLang / TokenSpeed | |
| 许可 | Qwen Community License 1.0 | 可商用,超阈值需单独协议 |
- 几个数字值得停下来感受一下:125B 的"大脑",每步只叫醒 6B,也就是说,真正干活的只有 6B 量级,但容量却是 125B。这就是「又大又便宜」的第一层奥秘。
和同门兄弟比一比 (激活稀疏度一目了然):
| 模型 | 总参数 | 每 token 激活 |
|---|---|---|
| Qwen3.8-27B | 27.8B | 27.8B(全激活·稠密) |
| Qwen3-Next-80B-A3B | 80B | 3B |
| Qwen3.8-Flash-Next | 125B | 仅 ~6B |
| Qwen3.8-Max | 2.4T | 95B |
- 注意Qwen3.8-27B:它总参数和激活参数一样,是典型的稠密模型;而 Flash-Next 用 125B 的容量,只付出 6B 的激活代价。
为什么叫「Flash」? 官方的「Flash」不是说"这个模型更小、容量更少",而是说它缩减的是各种成本 :每 token 的计算成本、注意力的成本、记忆查表的成本、以及训练的成本。追求的是「高参数容量 + 低激活 + 稀疏注意力 + 条件记忆 + 高吞吐」------要的是"闪电般的快",而不是"身材小"。
3. 第一条稀疏轴:超级稀疏 MoE(算力稀疏)
Flash-Next 的 MoE 设计是 512 个专家,每次路由选 10 个 + 1 个共享专家。
- 10 个路由专家 = 每步动态挑选的"主力团队"
- 1 个共享专家 = 每步都参战的"常驻团队",保证基础能力不丢
把 512 个专家里一次只召 11 个,稀疏度极高,单步计算量被压得很低。这是第一条"稀疏轴"------它稀释的是"算力"。
4. 第二条稀疏轴:51B「条件记忆」(最容易误读的点)
- 这是整个模型最容易被误读的地方。预发布时大家看到数字「~51B 额外记忆参数」,第一反应都是:哦,模型是不是 125B + 51B = 176B,那不是更大了吗? 错。这 51B 不是普通参数,而是「条件记忆」(Conditional Memory)。
4.1 一图理解:查表 vs 计算
- 普通参数要靠算(矩阵乘法)才能用,每次用都要花 FLOPs。
而这 51B 是一条查表(lookup)记忆:
- 训练时,把语料里高频出现的 n-gram(连续的几个词) 预先算好向量(embedding),存进一张表。
- 推理时,遇到某个 n-gram,直接从表里取(查表) 出对应向量,和当前 token 的表示"融合"一下。
- 查找是 O(1) 的------不管表多大,查一个键的时间都一样,几乎不需要算力。
什么是 n-gram? 就是"连续 n 个词"。比如 "Qwen" 这个 unigram(1-gram)、"Qwen 模型" 这个 bigram(2-gram)、"Qwen 模型很" 这个 trigram(3-gram)。高频 n-gram 往往承载常识、固定搭配、专有名词------属于"背下来比现算更快"的那类知识。
什么是 embedding(词向量)? 把每个词映射成一串数字(向量),让语义相近的词在向量空间里靠得近。比如"猫"和"狗"的向量会比较接近。模型主要就是在这些向量上做运算。
4.2 为什么叫「条件记忆」?和 MoE 什么关系?
这里要引入一个很漂亮的对称:
- MoE = 条件计算(conditional computation):根据输入决定"让谁算"。
- N-gram / Engram = 条件记忆(conditional memory):根据输入决定"查哪条记忆"。
MoE 稀释算力 (少算),Engram 稀释存储的读取成本(少算,直接查)。这两条正交(互相独立)的"稀疏轴"叠在一起,是这套架构很有含金量的一点。
4.3 扩容却不增算力
- 最妙的地方:给这张表加容量,几乎不增加推理的 FLOPs。 因为表再大,查一次还是 O(1)。这就是为什么官方敢说 Flash-Next「扩容却不增算力」:126B 里,真正每步要算的只有 6B 的 MoE 激活部分 + 查表。
4.4 这张表放哪?------显存外(off-accelerator)
-
因为查表不需要常驻在 GPU 里算,官方把它设计成可以放在显存之外 (系统内存,甚至 SSD),按需异步取回(host-memory prefetching)。这直接把它变成了「大内存 AI PC / 服务器」的宠儿------你不需要巨大的显存来装它。
-
Flash-Next 的 n-gram 表规模:2000 万条(bigram/trigram) ,每条约一个 2560 维向量,加起来 ≈ 51B 参数 。官方技术报告还专门研究了"表放在第几层最好""词汇表多大最好",最终选放在第 2 层(可以在计算第一层的同时,异步预取,隐藏延迟),并权衡出一个性价比合适的表大小。
-
得益于 n-gram 表稀疏访问的特性,做量化后可以更省。社区测算:在 4-bit 量化下,125B 主权重约 58GiB,51B n-gram 表约 23.7GiB。
这一条轴,正是来自 DeepSeek 的 Engram / SCONE 路线。它们把"高频 n-gram 预计算 + 查表取回"这条技术路线发扬光大,Flash-Next 把它拿来作为 MoE 之外的第二条稀疏轴。
5. 第三条创新:QSA 稀疏注意力(长上下文的救星)
5.1 痛点:全注意力太贵
- 讲 QSA 之前,先讲一个几乎所有长上下文模型都要面对的问题。
- 标准的 自注意力(Self-Attention) 机制,让每个 token 都能"看"到前面所有 token,从而精准捕捉依赖关系。它的代价是:计算量随序列长度呈 O(N²) 增长 ------上下文从 32K 涨到 1M(约 32 倍),注意力计算量要爆炸成平方级(约 1000 倍)。同时,它还要把每个 token 的 Key/Value 都存下来作为 KV Cache,序列越长,缓存越大,直到撑爆显存。
- 什么是 KV Cache? 生成长文时,模型每出一个字都要"回头"看前面所有的字。为了不重算,它把每个历史 token 的 key(查找键)和 value(内容值)缓存起来。序列越长,缓存越庞大。
一句话:长上下文是刚需(读长文档、改大代码库),但全注意力让它在成本上不可承受。
5.2 QSA 的思路:不是选 token,而是选「块」
-
已有很多"稀疏注意力"方案,思路通常是:不是让每个 query 看全部历史,而是让一个轻量级的索引器(indexer) 先扫一遍,挑出最重要的那些 token,核心注意力只在这些 token 上算,从而把 O(N²) 压下来。
-
QSA( Q wen S parse A ttention)是这条路线上的改进,但它有一个关键不同------它在"微块"(micro-block)级别选,而不是单个 token。
-
索引器先把长序列压缩成若干个微块 ,逐块打分、选出最重要的若干块(预算:
512 块 或 2048 token)。核心计算只在选出的块 上展开。这样做的收益:计算量直接从 O(N²) 降到 O(N²/r) 附近(r 是压缩倍数),而且索引器的成本本身也和序列长度相关,长序列时收益更明显 。官方技术报告里,微观层(组)级实测:在 1M 上下文下,QSA 比稠密注意力 prefill 快 7.6 倍、decode 快 4.9 倍。
5.3 QSA 的训练:两阶段"蒸馏"
QSA 不是一拍脑袋设计出来的,它是在持续预训练(CPT)阶段,通过两阶段蒸馏教出来的:
- 阶段一:稠密蒸馏(Dense Distillation) ------ 先用一个"全注意力老师"生成完整的注意力分布,让轻量索引器学习去模仿它(哪块重要),约 1000 步。
- 阶段二:稀疏训练(Sparse Training) ------ 索引器学会以后,让整个主干网络在它的指导下,只对选出的块做核心注意力,并继续做 KL 蒸馏校准,直到网络适应这种稀疏模式。
5.4 效果到底如何?
技术报告里最惊艳的实验,是长上下文的检索能力(RULER / MRCR 测试,可以理解为"在超长文本里捞针"):
| 测试 | 全注意力基线 | 加 QSA |
|---|---|---|
| RULER(1M 处) | 70.16 | 80.93 |
| MRCR(1M 处) | 28.64 | 93.00 |
- 在有 QSA 的情况下,长上下文检索能力不但没降,反而大幅提升。 原因很有意思:QSA 的"块级压缩"反而成了一种天然的"注意力正则",让模型在极长的上下文里更容易聚焦到关键信息,而不是被海量无关内容分散。
6. 第四条:GDN 混合层(长短兼顾)
6.1 为什么不能全是注意力?
- 上一节说了全注意力"贵"的缺点。那干脆全换掉注意力好不好?也不行------线性注意力类机制虽然便宜,但"精准回溯某一条具体信息"的能力差 。就像一个人记性好,能把文章大意记住,但你要他精准复述某行某句,他可能就抓瞎了。所以现在的共识是混着来:大部分层用便宜的机制处理长上下文(记"大意"),少数层保留全注意力(做"精准检索")。
6.2 GDN 是什么?
- GDN(Gated DeltaNet,门控 Delta 网络) 是 Qwen 用的线性注意力层 。它的谱系来自 DeltaNet 和 Mamba-2。与传统注意力相比,核心区别是:
- 传统注意力:KV Cache 随序列变长而膨胀 + 计算量 O(N²)。
- GDN:维护一个固定大小的"循环状态"(fixed-size recurrent state) ,用一套学习到的门控规则 不断更新它。状态大小是固定的,不随序列增长。
于是长上下文对它来说几乎不增加成本。它通过"擦除改写"(erase-and-write)的门控机制,把新信息写进状态、把过时信息擦掉,实现高效的在线记忆。
打个比方:全注意力像"每次回答问题都翻遍全档案",精准但慢、占地方;GDN 像"边听边记课堂笔记",越记越顺手、不占地方,但笔记只能记重点,细节可能丢。
6.3 3:1 的黄金比例
- Qwen 的混合方案不是随便混,而是有讲究的:在 Flash-Next 的 48 层里,每 4 层里有 3 层是 GDN、1 层是全注意力(实现为 QSA)。即结构是:
bash
12 × [ 3 × ( Gated DeltaNet → MoE ) → 1 × ( Qwen Sparse Attention → MoE ) ]
- 这个 3:1 的比例,Qwen 从 Qwen3-Next 一路验证过来,是目前在"效率"和"精准检索"之间找到的均衡点。官方技术报告也做了消融实验:相比被它替代的全注意力 Transformer 基线和滑动窗口注意力(SWA)基线,GDN 混合在 9 个基准里的 8 个都更优。
7. 架构全景图:把 48 层拼起来

- 把上面四条创新合起来,就是 Flash-Next 的完整骨架。官方架构图非常清晰,拆解如下:
bash
输入 Token
│
▼
[词表嵌入 Vocabulary Embedding]──────────────►[ N-gram 嵌入层(仅第 2 层) ]
│ │
│ (12 个"混合块",每个块 = 3 层 GDN + 1 层 QSA,共 48 层)
▼
┌─────────────────────────────────────────────┐
│ GDN 层 → MoE │ ← 3 层(便宜,记大意)
│ GDN 层 → MoE │
│ GDN 层 → MoE │
│ QSA 层 → MoE │ ← 1 层(精准检索)
│ │
│ (每层内部:门控残差 GR 读取 → 注意力/MoE → GR 写回) │
└─────────────────────────────────────────────┘
│
▼
[ GR Read ] → [预测头 Prediction Head]
│
▼
[MTP 模块(多 token 预测)] ← 复用 QSA 的索引,加速解码
几个细节值得注意:
-
每层内部的「门控残差」(Gated Residual, GR) :这是让这么深的网络能稳定训练的关键。它把残差流"加宽"成 4 条分支 ,通过一个逐元素、数据依赖的"读门" 和一个逐分支的"写门" 来精细控制信息流动。相当于把原来单一的"传送带"拓宽成 4 条,再装上闸门。带来的好处是:表达能力更细腻,同时保持训练稳定、推理开销极低。技术报告还发现,这些分支里有一条专门负责"跨层长距离传信息",其余几条负责局部------各司其职。
-
MTP(Multi-Token Prediction,多 token 预测) :解码时不止预测下一个 token,而是同时预测后面几个,能显著提升吞吐。Flash-Next 让 MTP 模块复用 QSA 算好的索引,进一步省掉额外开销。
-
「GR Read → 预测头」:注意整个模型在输出层前,还有一个 GR Read 做最后的信息汇聚。
8. 训练配方:为什么说"只花约 1/9 的训练成本"?
官方的一层宣言是:Flash-Next 用约 1/3 的训练 token、约 1/9 的训练 FLOPs,达到上一代 397B-A17B 模型的质量。这不只是架构的功劳,还有一套"量身定制"的训练配方。
技术报告里把架构、效率、优化视为一个相互耦合的系统,重点讲了训练相关的三个创新:
8.1 优化器分而治之:Muon + AdamW
传统上大家基本都用 AdamW。但 Flash-Next 用了一个 矩阵级优化器 Muon ,并且按权重类别分别处理:
- 用 Muon:注意力层的 q/k/v、输出投影,GDN 的输入/输出投影,MoE 路由与共享专家的 fc1/fc2,以及 n-gram 层的 key/value 投影------这些是"真正做线性映射"的二维权重。
- 用 AdamW:输入词嵌入、输出头,MoE 路由器,门控残差的两个低秩投影,以及 n-gram 表的行(且这里关闭权重衰减)。
为什么要拆开?技术报告发现:Muon 对"等距正交化"更友好,但对某些权重(比如嵌入、MoE 路由器)会放大训练早期波动、甚至把路由器搞塌,所以这些留在表现更稳健的 AdamW 上。
8.2 重标定「缩放法则」,扔掉 batch warmup
以往共识:训大模型要"小 batch 起步、逐步加大"(batch-size warmup)。但技术报告发现,换用 Muon + 新架构后,这条经验不成立了。他们重新拟合了缩放法则(scaling law) ,发现最优的 batch size 和 学习率都要显著上调,而且学习率随模型变大的衰减更慢。于是:
- 直接用目标 batch size 起步,不做 warmup。 测试表明,做 warmup 反而让损失略高,还要多花 18.8% 的优化器步数。更优的超参数让训练更高效、更稳,收敛更快。
8.3 训练稳定性:能扛住"压力测试"
大模型训练最怕"突然损失爆炸、梯度崩掉"。技术报告专门做了 stress test(压力测试):把学习率拉到最优值的 2 倍、4 倍,看谁能扛住。
结果:Qwen3.5 的老配方 + 新架构在 2× 学习率下就开始崩(10k 步内 loss spike),而 Muon + 门控残差(GR)的新配方在 4× 学习率下依然稳如磐石 。技术上,GR 显著降低了梯度范数尖峰和激活离群值(outlier)的频率与幅度;配合 Muon 的等距正交化,让训练极度稳定------全程不需依赖 qk-clip / SWIGL 这类额外的剪切技巧。
9. 它到底能拿来干嘛?
官方模型卡给了一些典型场景,结合评测数据这里归纳为几类(注意:以下基准分均为官方自报,尚未被第三方独立复现,应视为"宣称"而非"定论"):
- Agentic Coding(智能体编程) :复杂代码库、Repo 级任务。
SWE-bench Pro 62.5、SWE-bench Multilingual 81.0、DeepSWE 1.1 58.7,在多语言软件工程上明显优于同门 27B 稠密版。 - 长程任务(Long-horizon):超长文档、多步推理。原生 256K、可扩 1M 的窗口,配合稀疏注意力与 GDN,长上下文是它的主场。
- 多模态创作 :文本 + 图片 + 视频统一理解。模型卡里有大量视觉-语言基准(如
MathVision 90.6 / 95.7、RealWorldQA 88.5、LVBench 76.6、AndroidWorld 84.5、OSWorld 2.0等),在移动端/计算机操作、体感、视频理解等任务上表现突出。 - 本地私有化 :因为 n-gram 记忆放显存外 + 只有 6B 激活,它天然适合"大内存 + 中低显存"的 AI 工作站/个人设备,数据不出门。
- 对比一下同门标杆:
| 指标 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus(397B) | DeepSeek-V4-Flash-0731 |
|---|---|---|---|---|
| 激活参数 | 6B | 27B | 17B | 13B |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 |
| CoWorkBench(长程办公) | 73.9 | 70.7 | 65.1 | 45.1 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 |
可以看到:在很多任务上,Flash-Next 用 6B 激活,不只碾压 27B 稠密版,甚至在不少 agentic / 长程任务上超过了体量 3 倍多的 397B 版 ,并在部分指标上与 DeepSeek-V4-Flash 打个平手或反超。但也正如技术报告所说,它"领先的是 8/14 个预训练基准,其余约落后 2.6 分"------并非全面碾压,而是有强有弱。
10. 和 Qwen3.8-27B 怎么选?
这是社区最常问的"灵魂拷问"。它们是两种不同的东西,不是替代关系。
| 维度 | Qwen3.8-27B | Qwen3.8-Flash-Next |
|---|---|---|
| 结构 | 稠密,结构成熟 | 全新稀疏架构,Qwen4 预览 |
| 生态/框架 | 生态马上好、量化成熟 | 推理框架在追赶,新 |
| 内存需求 | 低、容易部署 | 总容量大,但靠 n-gram 放显存外缓解 |
| 单 token 算力 | 27B 全激活,可预测 | 6B 激活,通常更快 |
| 长上下文 | 好 | 可能更强 |
| Agentic 编程 | 强 | 可能更强 |
| 大内存设备 | 一般 | 非常友好 |
一句话:27B 是"当下就能稳妥用"的东西,而 Flash-Next 是"为下一代架构铺路、值得提前研究"的东西。 急着上线、要稳定,选 27B;想拥抱 Qwen4 趋势、手上有大内存设备、做长上下文/agentic 场景的先锋实践者,可以盯 Flash-Next。
11. 部署预告:为什么它是"大内存 AI 神机"的甜点模型?
-
Flash-Next 的一个核心设计目标就是**"异构内存推理"**:把模型不同部分放到不同层级的内存里,按需取用。
- GPU 显存:活跃计算的部分、高频权重、KV Cache。
- 系统内存(System RAM):大部分 MoE 权重 + n-gram 记忆表。
- NVMe SSD:冷数据 / 长尾 memory。
-
配合社区测算(4-bit 下主权重约 58GiB + n-gram 表约 23.7GiB),它不需要超大显存,而是需要"大内存 + 中低显存"的组合------比如 128GB 内存的 AI 工作站、统一内存的 Mac,都很有戏。这也让它成为「大内存 AI PC」概念的甜点模型。
12. 结语:它意味着什么?
- Qwen3.8-Flash-Next 最大的意义,不在于它这个"个体"有多强,而在于它是一份关于 Qwen4 的"答卷" 。它把四样东西同时搬了出来:
- 超级稀疏 MoE(算力稀疏)------ 125B 容量 / 6B 激活;
- N-gram 条件记忆(存储稀疏)------ 扩容不增算力,还能放显存外;
- QSA 稀疏注意力 ------ 让 256K / 1M 长上下文真正可用;
- GDN 混合层 + 门控残差 ------ 长短兼顾、又稳又省。
它的口号是"Towards Ultimate Cost-Efficiency(追求极致成本效率) "。用 1/3 的 token、1/9 的 FLOPs 拿到上一代 397B 的质量,这背后不是某单个花哨技巧,而是一条"架构 + 效率 + 优化"三位一体、被系统性验证过的路线。
对于一个写代码、做应用、跑本地模型的你来说,真正值得做的准备工作是:提前理解并接纳这套"稀疏化 + 记忆化 + 长上下文"的范式,而不是只盯着一张基准表。
Qwen4 家族,大概率就长在这个骨架上。
附:术语小抄(TL;DR)
| 术语 | 一句话解释 |
|---|---|
| MoE | 分专家的稀疏模型,每步只叫醒少数专家干活 |
| 激活参数 | 每处理一个 token 真正参与计算的参数,决定速度 |
| FLOPs | 一次推理的总乘加运算量,决定算力成本 |
| n-gram | 连续 n 个词,高频 n-gram 承载常识、固定搭配 |
| Embedding | 把词映射成向量,语义相近则向量靠近 |
| 条件记忆 | 按需"查表取回"的记忆(MoE 之外的第二种稀疏轴) |
| KV Cache | 生成长文时缓存的历史 key/value,序列越长越占显存 |
| 自注意力 | 标准机制,精确检索但 O(N²) 且缓存大 |
| QSA | Qwen 稀疏注意力:在"微块"级选重要内容,压成本 |
| GDN | Gated DeltaNet,线性注意力,固定大小循环状态,长上下文便宜 |
| 门控残差 (GR) | 加宽残差流、加读写门,让深网络稳且细腻 |
| MTP | 多 token 预测,解码一次出多个 token,提吞吐 |
| 异构内存推理 | 把模型不同部分放显存/内存/SSD 分层,省显存 |
参考资料
- 官方模型卡 :ModelScope Qwen/Qwen3.8-Flash-Next
- 官方技术报告:《On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability》(Qwen Team, 2026-08)
- 官方架构图 :
Qwen3.8-Flash-Next/architecture.png - 社区分析:OrcaRouter《Qwen3.8-Flash-Next Is Out: Qwen4 Architecture Confirmed》、NVIDIA DGX Spark 论坛讨论等