就在上周 DeepSeek-V4-pro 、Grok 4.6 、DeepSeek Harness、GLM 5.3 相继炸场的时候,Qwen 3.8 迎来了开放权重的时刻。
就在大家相继追捧 DeepSeek 、GLM 的时候,Qwen 也迎来了属于它的时刻。
Qwen 3.8 的反响,出乎预料的好。

已经在 Hugging Face 上,可以看到 Qwen-3.8-2.4T 和 Qwen-3.8-27B 了。

然后 unsloth 又给大家提供了一下本地部署的方法。

这次还真不是理论上可以本地跑,而是真的能跑。
根据 Unsloth 的 Qwen3.8 本地部署文档显示,Qwen 3.8-27B 的 4-bit 量化版本,17~19GB 总内存就能启动。RTX 4090、RTX 5080,或者 24GB 统一内存的 Mac。

换句话说,这次的本地,真的是普通人电脑上的本地。
是不是听着很爽?
但我把文件大小看了一遍,发现 17GB 这个说法还是得加一句说明。。。Unsloth 推荐的 UD-Q4_K_XL 文件本身就有 17.9GB,视觉投影文件 mmproj 还要大约 0.93GB。模型加载之后,系统、上下文和 KV Cache 也得继续吃内存。
所以 17GB 是能跑的底线,24GB 才是我觉得比较靠谱的起点。
先来信息平权一下。
这次 Qwen 3.8 开放了两个体量完全不同的模型。
Qwen3.8-27B 是 27B Dense 模型,原生支持图片和视频,默认开启思考,原生上下文 262,144 tokens,还能通过 YaRN 扩到约 1M。
它也是大多数人应该下载的版本。

Qwen3.8-2.4T-A95B 则有 2.4T 总参数,每次激活 95B。它是纯文本、强制思考的模型,离普通电脑还有亿点点距离。
咱们先把 27B 搞明白。
Qwen3.8 27B 这次真不是陪跑
Qwen3.8-27B 的参数量没有变得特别夸张,提升主要出现在 Coding、Agent 和电脑操作上。
官方表格里,Terminal Bench 2.1 从 Qwen3.6-27B 的 63.4 涨到了 73.0。SWE-bench Pro 从 53.5 涨到 61.7,超过 Qwen3.7-Plus 的 57.6,也超过表里 Opus4.6 Max 的 53.4。
DeepSWE 1.1 更夸张,从 13.3 涨到了 42.2。Qwen 自己的 QwenSWEBench 则从 49.3 涨到了 79.0。

图源:Qwen 官方模型卡
长任务也有提升。CoWorkBench 是 70.7,Qwen3.7-Plus 是 65.1,表里的 Opus4.6 Max 是 68.2。LiveCodeBench v6 做到了 90.3,高于 Qwen3.7-Plus 的 89.6 和 Opus4.6 Max 的 88.8。
Terminal Bench 2.1 还是 Opus4.6 Max 的 78.2 更高。GPQA Diamond 上,Qwen3.8-27B 的 89.2 也低于 Qwen3.7-Plus 的 90.3 和 Opus4.6 Max 的 91.3。HLE 是 30.8,距离 Opus4.6 Max 的 40.0 还有差距。
所以这次提升的方向很明确:Qwen3.8-27B 把一个本地 27B 模型的代码执行、长任务和 Agent 能力往前推了一大截。
多模态部分更能解释它为什么反响这么好。
OSWorld-Verified 从 63.9 涨到 84.3,WebArena-Verified 从 48.8 涨到 64.8。AndroidWorld 是 81.9,Vision2Web 是 62.9,SWE-MM 是 38.6。
这些测试看的已经不只是识图问答了。它要看屏幕、操作电脑、使用浏览器,再把一个软件任务做完。

图源:Qwen 官方模型卡
这些数字来自 Qwen 官方模型卡。QwenSWEBench 和 CoWorkBench 还是 Qwen 自己的内部评测;SWE-bench Pro 除了 Opus4.6 Max 使用官方分数,其余模型都由 Qwen 用 Claude Code harness 重新跑了一遍。
可以说,你本地跑了一个 Qwen 3.8 27B ,你将拥有一个 Opus 4.6。
本地部署最容易忽略的就是这一步。
大家看到 27B 能压到 9GB,第一反应都是这么小,那我是不是随便跑了。
Unsloth 这次使用 Dynamic V3.0 GGUF,目前还是 Preview。
Unsloth 公布的 top-1 和 KLD 分析里,9GB 的 IQ2_XXS 比 54.7GB 的 BF16 小了 83.5%,能力保留为 82.5%。
这个数字能用,但损失也是显而易见的
拿来尝鲜没问题,复杂代码、长 Agent 和工具调用,我不会把 2-bit 当主力模型。
版本
文件大小参考
目前能确认的质量数据
我会怎么选
IQ2_XXS
约 9.0GB
Unsloth 测得 82.5% 保留
小内存尝鲜
UD-Q3_K_XL
约 13.4GB
完整分项仍待公布
16GB 机器的起点
UD-Q4_K_XL
约 17.9GB
完整分项仍待公布
24GB 机器优先
NVFP4
约 23.4GB
top-1 保留 92%~97%
Blackwell GPU
BF16
约 54.7GB
原始精度
64GB 统一内存、80GB 显卡或多卡
NVFP4 的数据更漂亮。
Unsloth 的测试里,它比 BF16 快大约 1.5 倍,top-1 保留在 92%~97% 之间。代码数据是 96.68%,中文是 93.55%,聊天是 92.15%。

代价是:NVFP4 需要 Blackwell。RTX 4090、3090 这些卡跑不了,至少得是 RTX 5090、DGX Spark、B200 或 B300 这一代。
Unsloth 给出了配置表。这里的总内存,是系统 RAM 加显存,或者 Mac 的统一内存。
量化版本
建议总内存
怎么选
2-bit
11~13GB
能跑,质量损失更明显
3-bit
13~16GB
16GB 机器从这里开始
4-bit
17~19GB
24GB 机器优先选它
6-bit
24GB
需要给系统和上下文继续留空间
8-bit
31GB
48GB 以上更合适
BF16
56GB
原始精度,工作站路线
量化这个词听着挺复杂,其实只要记住一句话:位数越低,占用越小,质量损失通常也越明显。
所以
- 16GB 机器,选
UD-Q3_K_XL,文件大约 13.4GB。 - 24GB 机器,选
UD-Q4_K_XL,文件大约 17.9GB。 - 32GB 机器,还是建议先跑 Q4,把空间留给系统和上下文。
- 48GB~64GB 机器,可以考虑
UD-Q8_K_XL,文件大约 31.5GB。
还有一个坑。
256K 是模型支持的上限,不是第一次启动就必须拉满。上下文越长,KV Cache 越大,第一次读完提示词的时间也越长。
第一次统一从 32K 开始。模型、速度和内存都正常了,再往 64K、128K 加。
省事儿的做法:Unsloth Desktop / Studio
如果不想碰编译参数,可以直接下载 Unsloth Desktop。
它支持 macOS、Windows 和 Linux。

打开 Model hub,搜索 Qwen3.8-27B,再按自己的内存选量化版本即可。
Unsloth 会自动处理大部分推理参数,也会识别多张 GPU。显存放不下时,它还能把一部分权重增加到系统内存中。
Thinking、Preserved Thinking、Web Search、Code Execution 和工具调用也都加进去了。
这对本地 Agent 挺重要,省得模型跑起来了,工具又接不上。。。

图源:Unsloth;Dynamic 4-bit Qwen3.8-27B 在 Unsloth Desktop 中运行
喜欢浏览器界面的,也可以手动装 Unsloth Studio。
Mac、Linux 和 WSL 打开终端:
arduino
curl -fsSL https://unsloth.ai/install.sh | sh
unsloth studio -p 8888
Windows 用 PowerShell:
arduino
irm https://unsloth.ai/install.ps1 | iex
unsloth studio -p 8888
然后在浏览器打开:
arduino
http://127.0.0.1:8888
第一次启动会让你创建密码。进入 Model hub,搜索 Qwen3.8-27B-GGUF,24GB 机器选 Q4,16GB 机器先选 Q3。
如果只在自己电脑上用,启动命令里不要加 -H 0.0.0.0。这个参数会把服务开放给同一网络里的其他设备,公网千万别这么干。
如果想接自己的工具,就用 llama.cpp
已经在用 llama.cpp 的小伙伴,先把版本更新到最新,再从 Hugging Face 下载 Unsloth 的 GGUF。
24GB 机器直接下 4-bit:
css
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-27B-GGUF \
--local-dir unsloth/Qwen3.8-27B-GGUF \
--include "*UD-Q4_K_XL*"
然后启动:
css
./llama.cpp/llama-cli \
--model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \
--ctx-size 32768 \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0
16GB 机器把下载规则和模型名里的 UD-Q4_K_XL 换成 UD-Q3_K_XL。
Mac 编译 llama.cpp 时关闭 CUDA 就行,Metal 默认开启。NVIDIA 走 CUDA,AMD 可以走 HIP 或 Vulkan。
如果要把它接给 OpenCode、Open WebUI 或自己的程序,把 llama-cli 换成 llama-server,再让客户端访问本机的 OpenAI 兼容接口。
Qwen3.8 默认开启思考。复杂代码和 Agent 任务先用官方推荐参数:
ini
temperature = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0
context = 32768 起步
普通聊天不想等它想半天,可以关闭思考:
json
--chat-template-kwargs '{"enable_thinking":false}'
非思考模式的推荐参数是 temperature=0.7、top_p=0.80、top_k=20、presence_penalty=1.5。
如果要看图,记得再下载同一个 GGUF 仓库里的 mmproj-F16.gguf,启动时加上 --mmproj mmproj-F16.gguf。只下语言模型文件,没有图片能力。
Ollama 和 LM Studio,更适合不想折腾命令的人
Ollama 已经上架了官方 Qwen3.8 模型。默认就是 27B,模型大约 18GB,标注支持 256K 上下文、图片、工具调用和思考模式。
安装好 Ollama 之后,一行命令:
arduino
ollama run qwen3.8
Apple Silicon 还可以试 MLX 版本:
arduino
ollama run qwen3.8:27b-mlx
LM Studio 的做法也很简单。
进入 Discover,把 Unsloth 的 GGUF 仓库地址贴进去,再选 Q3、Q4 或 Q8。

它适合想自己调显存卸载比例、上下文和采样参数的人。
需要本地 API 时,在 Developer 页面启动 Server,就能给其他工具使用。
这两条路线的区别很简单:Ollama 适合一条命令跑起来,LM Studio 适合一边看界面一边调参数。
给团队使用的话,用 vLLM 和 SGLang
一个人用的话,llama.cpp 足够了。如果设计几个人同时调用,vLLM 和 SGLang 更合适。
Qwen 官方已经给出了 vLLM recipe 和 SGLang cookbook 。它们支持连续批处理、Prefix Cache、多 GPU 和 OpenAI 兼容 API,主要解决并发和吞吐。
如果你有至少 24GB 显存的 Blackwell GPU,比如 RTX 5090、DGX Spark、B200 或 B300,可以用 Unsloth 的 NVFP4 权重。文件大约 23.4GB,Unsloth 给出的速度比 BF16 快约 1.5 倍。当前文档要求 vLLM>=0.25.0。

vLLM:
vllm serve unsloth/Qwen3.8-27B-NVFP4
需要 MTP 推测解码,再加:
css
vllm serve unsloth/Qwen3.8-27B-NVFP4 \
--speculative-config '{"method":"mtp","num_speculative_tokens":2}'
SGLang:
css
python -m sglang.launch_server \
--model-path unsloth/Qwen3.8-27B-NVFP4 \
--speculative-algorithm NEXTN \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4
老款 NVIDIA 显卡别下 NVFP4。RTX 4090、3090 这类 24GB 卡,继续用 GGUF + llama.cpp 更省事。官方 FP8 权重约 30.9GB,更适合 48GB 显卡或多卡服务器。
工具调用还要开对应的 parser。vLLM 的 Qwen3.8 recipe 使用 --enable-auto-tool-choice --tool-call-parser qwen3_coder。
至于 2.4T,自己玩就别考虑了
Unsloth 也把 Qwen3.8-2.4T-A95B 做成了 GGUF。

官方 BF16 权重要 4.9TB,Q8 约 2.6TB。Unsloth 新做的 Dynamic 1-bit 版本压到了 397GB,已经缩小了 91%。
然后呢?
最小的 397GB 版本,仍然建议准备至少 450GB RAM。纯 CPU 可以启动,速度就别想太多了。生产部署更夸张,TokenSpeed 的参考配置已经是 16 张 GPU、两个 8 卡节点。
所以 2.4T 的开放,主要方便量化团队、推理框架和有服务器的企业。
普通用户直接跑 27B,反而还有视觉和非思考模式,体验更完整。
所以本地跑 Qwen3.8 这件事确实能行。
16GB 可以尝鲜,24GB 已经能认真用,32GB 压力更小。
我上次写 DeepSeek-V4-Flash 本地部署的时候还得从 110GB 起步;这次 Qwen3.8-27B 的 4-bit 只有 17.9GB。
像我这种 32G 丐版内存的 Mac,这回终于不用再等等了。。。
马上部署一下,跟大家来个实际反馈。
今天多多少少得说一句,阿里牛逼了。
参考资料: