Qwen3.8-Flash 发布:6B 激活、百万上下文,Qwen4 架构提前亮相
Qwen 又上新了。

这次发布的是多模态 MoE 模型 Qwen3.8-Flash ,同时开放了 Qwen3.8-Flash-Next 的模型权重。
表面上看,这是一次常规的 Flash 系列更新。
但从官方给出的定位来看,这次发布显然不只是换了一个模型版本号。
因为 Qwen3.8-Flash-Next 还是 Qwen4 架构的一次早期预览。
换句话说,Qwen4 还没有正式发布,但下一代模型准备采用什么架构、重点优化什么方向,这次已经提前露出了一部分。
先把两个名字捋清楚
这次发布里有两个容易混在一起的名字。
一个是 Qwen3.8-Flash-Next。
它更像是面向开发者和研究社区的架构预览版,已经开放模型权重,可以通过 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等框架部署。
另一个是 Qwen3.8-Flash。
它是在 Flash-Next 基础上进一步产品化的正式版本,会增加默认百万上下文、官方内置工具等能力,并通过 QwenCloud API 提供服务。
简单理解就是:
Flash-Next 负责开放权重和展示新架构,Flash 负责真正进入生产环境。
125B 参数,每次只激活 6B
Qwen3.8-Flash-Next 采用的是 MoE 架构。
模型主干参数为 125B ,另外还有 51B 的 N-gram Embedding 参数 和 4B 的 MTP 参数 ,但在处理每个 Token 时,实际只激活大约 6B 参数 。

这也是这次模型最值得关注的地方之一。
总参数不小,但不是每次推理都让全部参数一起工作。
可以把它理解成一个规模很大的专家团队。模型内部一共有大量专家,每次任务只调用其中一小部分,既保留了大模型的容量,又尽量控制推理成本。
其中,Qwen3.8-Flash-Next 共设置了 512 个专家,每次会激活 10 个路由专家和 1 个共享专家。
而新增的 N-gram Embedding,则可以理解成一种更低成本的"短语记忆"。
它会通过 bigram、trigram 等短词组组合,补充模型对局部语言模式的表示能力。相比单纯扩大主干模型,这种方式增加的计算量更低,也更适合在显存受限的设备上进行扩展。
官方给出的说法是,Qwen3.8-Flash 的训练成本只有 Qwen3.7-Plus 的约 1/9。
模型名字里的 Flash,重点也很明确:不只是追求快,更重要的是把训练和推理成本压下来。
真正更新的,是底层架构
参数之外,这次更值得看的其实是架构。

Qwen3.8-Flash-Next 引入了四项主要变化:
Gated DeltaNet 与 Qwen Sparse Attention 混合注意力、Gated Residual、N-gram Embedding,以及重新设计的训练方案。
这些名字看起来有点复杂,但目标其实很统一:
让模型在处理长上下文、Agent 任务和多模态任务时,速度更快,成本更低,同时保持训练稳定。
其中,Qwen Sparse Attention 不再逐个选择 Token,而是按照更小的文本块进行筛选和计算。
这样做的好处是,当上下文越来越长时,模型不需要反复处理所有历史内容,可以明显降低长上下文带来的延迟。
Gated Residual 则是在残差连接中加入门控机制,让不同层之间的信息流动更加可控。
训练方面,Qwen3.8-Flash-Next 针对不同类型的参数,分别使用 Muon 和 AdamW 优化器,同时取消传统的 Batch Size Warmup,直接使用目标批次规模进行训练,以减少整体训练步数。fileciteturn0file0L154-L167
这些设计不会直接出现在普通用户的聊天界面里。
但它们会影响模型能不能处理更长的任务,能不能连续调用更多工具,以及在大量请求下还能不能保持较低成本。
这也是为什么官方把它称为 Qwen4 架构的提前预览。
重点已经从聊天转向 Agent
从官方公布的评测项目来看,Qwen3.8-Flash-Next 的重点已经不只是问答和聊天。
它明显在向 Coding Agent、办公 Agent 和工具调用 Agent 倾斜。

在代码能力上:
- DeepSWE 1.1 得分 58.7
- SWE-bench Pro 得分 62.5
- SWE-bench Multilingual 得分 81.0
- LiveCodeBench v6 得分 91.9
在长任务和工具调用上:
- CoWorkBench 得分 73.9
- JobBench 得分 55.7
- Toolathlon Verified 得分 73.5
其中,CoWorkBench 主要测试长周期办公和生产力任务,覆盖计算机、金融、法律、医疗等多个领域。
也就是说,它考察的不是模型回答一个问题的能力,而是模型能不能持续完成一串步骤,处理中间文件,调用工具,并最终交付结果。fileciteturn0file0L260-L359
从这组评测的选择也能看出,Qwen 接下来押注的方向很明确:
模型不只是陪用户聊天,而是要真正进入代码仓库、浏览器、办公软件和业务流程里干活。
多模态也没有落下
Qwen3.8-Flash-Next 本身是一款带视觉编码器的多模态模型,可以处理文本、图片和视频输入。

在官方公布的多模态评测中:
- AndroidWorld 得分 84.5
- RealWorldQA 得分 88.5
- 长视频理解 LVBench 得分 76.6
- 视觉网页开发 Vision2Web 得分 64.0
- MathVision 在开启计算工具后得分 95.7
此外,它在 ClawEval-MM 中测试了多模态工具调用,在 OSWorld 2.0 中测试了电脑操作能力,在 RecreationBench 中测试了跨桌面、移动端和网页的应用复现能力。fileciteturn0file0L362-L443
这意味着它的多模态能力,不只是"看懂一张图片"。
更重要的是让模型根据屏幕内容继续操作,例如识别界面、理解任务、点击应用、调用工具,再根据执行结果调整下一步动作。
这类能力,正是视觉 Agent 和 Computer Use Agent 的基础。
原生 262K,可扩展到百万上下文
Qwen3.8-Flash-Next 原生支持 262,144 Token 的上下文长度。
通过 YaRN,可以进一步扩展到 100 万 Token 。
不过这里也要区分一下。
开放权重的 Flash-Next 原生上下文是 262K,需要通过配置扩展到 1M;后续上线 QwenCloud 的生产版 Qwen3.8-Flash,则会默认提供百万上下文。
在 config.json 文件中,将 text_config 中的 rope_parameters 字段修改为:
{
"mrope_interleaved": true,
"mrope_section": [
11,
11,
10
],
"rope_type": "yarn",
"rope_theta": 10000000,
"partial_rotary_factor": 0.25,
"factor": 4.0,
"original_max_position_embeddings": 262144
}
对于 vLLM,可使用:
bash
VLLM_USE_MODELSCOPE=true VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1000000
对于普通聊天来说,百万上下文不一定每次都用得上。
但对于代码仓库分析、长视频理解、多文档研究和长周期 Agent 任务来说,上下文容量越大,模型越容易保留完整任务状态,也能减少频繁压缩和丢失信息的问题。
API 价格也很激进
按照官方公告,Qwen3.8-Flash 的生产版本将很快通过 QwenCloud API 上线。
价格为:
每百万输入 Token 0.16 美元,每百万输出 Token 0.47 美元。
这个价格确实很有 Flash 的味道。
尤其是在 Agent 场景里,一次任务可能包含多轮推理、工具返回、代码文件和历史轨迹,Token 消耗通常比普通聊天高得多。
如果模型能力能够接近官方评测数据,那么低价、长上下文和较小激活参数放在一起,会让它在代码 Agent、办公 Agent 和批量推理场景中很有竞争力。
开发者侧也做了不少准备
Qwen3.8-Flash-Next 默认会先进行思考,再生成最终回答。
开发者可以通过 enable_thinking 控制是否开启思考,通过 reasoning_effort 调整推理强度,还可以使用 preserve_thinking,决定是否保留多轮任务中的历史思考内容。
bash
from openai import OpenAI
# Configured by environment variables
client = OpenAI()
messages = [
{"role": "user", "content": "Write a Python function to merge two sorted linked lists."},
]
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next-FP8",
messages=messages,
extra_body={
"chat_template_kwargs": {
"enable_thinking": True, # on by default
"preserve_thinking": True, # on by default
},
},
reasoning_effort="xhigh", # xhigh by default; supported levels are xhigh, medium, and low
stream=True,
stream_options={"include_usage": True},
)
reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
if not chunk.choices:
print("\nUsage:")
print(chunk.usage)
continue
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
if not is_answering:
print(delta.reasoning_content, end="", flush=True)
reasoning_content += delta.reasoning_content
elif hasattr(delta, "reasoning") and delta.reasoning is not None:
if not is_answering:
print(delta.reasoning, end="", flush=True)
reasoning_content += delta.reasoning
if hasattr(delta, "content") and delta.content:
if not is_answering:
print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
is_answering = True
print(delta.content, end="", flush=True)
answer_content += delta.content
messages.append({
"role": "assistant",
"content": answer_content,
"reasoning_content": reasoning_content,
"reasoning": reasoning_content,
})
官方特别提到,在多轮 Agent 任务中,降低单轮推理强度并不一定会让整个任务更快。
因为单轮虽然节省了一些时间,但如果分析不充分,就可能带来更多失败和重试,最终反而消耗更多 Token。
这点其实很符合现在 Agent 产品的实际情况。
真正需要优化的,不只是模型每一轮回复有多快,而是整个任务能不能少走弯路、少返工,并稳定完成。
最后
整体来看,Qwen3.8-Flash-Next 并不是一次单纯的模型参数升级。
它更像是 Qwen 在正式进入 Qwen4 之前,对下一代架构的一次公开预演。
125B 主干参数,每个 Token 只激活 6B;原生 262K 上下文,可扩展到 1M;同时覆盖代码、办公、工具调用、图片和视频任务。
这些变化放在一起,指向的是同一个目标:
让大模型能够以更低的成本,持续完成更长、更复杂的真实任务。
当然,官方跑分只是第一步。
代码 Agent 是否稳定、百万上下文是否真的好用、多模态操作会不会频繁出错,还需要后续在真实任务里继续测试。
但至少从这次发布来看,Qwen4 的方向已经比较清楚了。
不是只继续堆参数。
而是把架构、成本、长上下文和 Agent 能力,一起往前推。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧。
如果想第一时间收到推送,也可以给个星标⭐~