本地跑一个 Qwen 3.8,你将拥有一个 Opus 4.6

就在上周 DeepSeek-V4-pro 、Grok 4.6 、DeepSeek Harness、GLM 5.3 相继炸场的时候,Qwen 3.8 迎来了开放权重的时刻。

就在大家相继追捧 DeepSeek 、GLM 的时候,Qwen 也迎来了属于它的时刻。

Qwen 3.8 的反响,出乎预料的好

已经在 Hugging Face 上,可以看到 Qwen-3.8-2.4T 和 Qwen-3.8-27B 了。

然后 unsloth 又给大家提供了一下本地部署的方法。

这次还真不是理论上可以本地跑,而是真的能跑。

根据 Unsloth 的 Qwen3.8 本地部署文档显示,Qwen 3.8-27B 的 4-bit 量化版本,17~19GB 总内存就能启动。RTX 4090、RTX 5080,或者 24GB 统一内存的 Mac。

换句话说,这次的本地,真的是普通人电脑上的本地。

是不是听着很爽?

但我把文件大小看了一遍,发现 17GB 这个说法还是得加一句说明。。。Unsloth 推荐的 UD-Q4_K_XL 文件本身就有 17.9GB,视觉投影文件 mmproj 还要大约 0.93GB。模型加载之后,系统、上下文和 KV Cache 也得继续吃内存。

所以 17GB 是能跑的底线,24GB 才是我觉得比较靠谱的起点。

先来信息平权一下。

这次 Qwen 3.8 开放了两个体量完全不同的模型。

Qwen3.8-27B 是 27B Dense 模型,原生支持图片和视频,默认开启思考,原生上下文 262,144 tokens,还能通过 YaRN 扩到约 1M。

它也是大多数人应该下载的版本。

Qwen3.8-2.4T-A95B 则有 2.4T 总参数,每次激活 95B。它是纯文本、强制思考的模型,离普通电脑还有亿点点距离。

咱们先把 27B 搞明白。

Qwen3.8 27B 这次真不是陪跑

Qwen3.8-27B 的参数量没有变得特别夸张,提升主要出现在 Coding、Agent 和电脑操作上。

官方表格里,Terminal Bench 2.1 从 Qwen3.6-27B 的 63.4 涨到了 73.0。SWE-bench Pro 从 53.5 涨到 61.7,超过 Qwen3.7-Plus 的 57.6,也超过表里 Opus4.6 Max 的 53.4。

DeepSWE 1.1 更夸张,从 13.3 涨到了 42.2。Qwen 自己的 QwenSWEBench 则从 49.3 涨到了 79.0。

图源:Qwen 官方模型卡

长任务也有提升。CoWorkBench 是 70.7,Qwen3.7-Plus 是 65.1,表里的 Opus4.6 Max 是 68.2。LiveCodeBench v6 做到了 90.3,高于 Qwen3.7-Plus 的 89.6 和 Opus4.6 Max 的 88.8。

Terminal Bench 2.1 还是 Opus4.6 Max 的 78.2 更高。GPQA Diamond 上,Qwen3.8-27B 的 89.2 也低于 Qwen3.7-Plus 的 90.3 和 Opus4.6 Max 的 91.3。HLE 是 30.8,距离 Opus4.6 Max 的 40.0 还有差距。

所以这次提升的方向很明确:Qwen3.8-27B 把一个本地 27B 模型的代码执行、长任务和 Agent 能力往前推了一大截。

多模态部分更能解释它为什么反响这么好。

OSWorld-Verified 从 63.9 涨到 84.3,WebArena-Verified 从 48.8 涨到 64.8。AndroidWorld 是 81.9,Vision2Web 是 62.9,SWE-MM 是 38.6。

这些测试看的已经不只是识图问答了。它要看屏幕、操作电脑、使用浏览器,再把一个软件任务做完。

图源:Qwen 官方模型卡

这些数字来自 Qwen 官方模型卡。QwenSWEBench 和 CoWorkBench 还是 Qwen 自己的内部评测;SWE-bench Pro 除了 Opus4.6 Max 使用官方分数,其余模型都由 Qwen 用 Claude Code harness 重新跑了一遍。

可以说,你本地跑了一个 Qwen 3.8 27B ,你将拥有一个 Opus 4.6。

本地部署最容易忽略的就是这一步。

大家看到 27B 能压到 9GB,第一反应都是这么小,那我是不是随便跑了。

Unsloth 这次使用 Dynamic V3.0 GGUF,目前还是 Preview。

Unsloth 公布的 top-1 和 KLD 分析里,9GB 的 IQ2_XXS 比 54.7GB 的 BF16 小了 83.5%,能力保留为 82.5%。

这个数字能用,但损失也是显而易见的

拿来尝鲜没问题,复杂代码、长 Agent 和工具调用,我不会把 2-bit 当主力模型。

版本

文件大小参考

目前能确认的质量数据

我会怎么选

IQ2_XXS

约 9.0GB

Unsloth 测得 82.5% 保留

小内存尝鲜

UD-Q3_K_XL

约 13.4GB

完整分项仍待公布

16GB 机器的起点

UD-Q4_K_XL

约 17.9GB

完整分项仍待公布

24GB 机器优先

NVFP4

约 23.4GB

top-1 保留 92%~97%

Blackwell GPU

BF16

约 54.7GB

原始精度

64GB 统一内存、80GB 显卡或多卡

NVFP4 的数据更漂亮。

Unsloth 的测试里,它比 BF16 快大约 1.5 倍,top-1 保留在 92%~97% 之间。代码数据是 96.68%,中文是 93.55%,聊天是 92.15%。

代价是:NVFP4 需要 Blackwell。RTX 4090、3090 这些卡跑不了,至少得是 RTX 5090、DGX Spark、B200 或 B300 这一代。

Unsloth 给出了配置表。这里的总内存,是系统 RAM 加显存,或者 Mac 的统一内存。

量化版本

建议总内存

怎么选

2-bit

11~13GB

能跑,质量损失更明显

3-bit

13~16GB

16GB 机器从这里开始

4-bit

17~19GB

24GB 机器优先选它

6-bit

24GB

需要给系统和上下文继续留空间

8-bit

31GB

48GB 以上更合适

BF16

56GB

原始精度,工作站路线

量化这个词听着挺复杂,其实只要记住一句话:位数越低,占用越小,质量损失通常也越明显。

所以

  • 16GB 机器,选 UD-Q3_K_XL,文件大约 13.4GB。
  • 24GB 机器,选 UD-Q4_K_XL,文件大约 17.9GB。
  • 32GB 机器,还是建议先跑 Q4,把空间留给系统和上下文。
  • 48GB~64GB 机器,可以考虑 UD-Q8_K_XL,文件大约 31.5GB。

还有一个坑。

256K 是模型支持的上限,不是第一次启动就必须拉满。上下文越长,KV Cache 越大,第一次读完提示词的时间也越长。

第一次统一从 32K 开始。模型、速度和内存都正常了,再往 64K、128K 加。

省事儿的做法:Unsloth Desktop / Studio

如果不想碰编译参数,可以直接下载 Unsloth Desktop。

它支持 macOS、Windows 和 Linux。

打开 Model hub,搜索 Qwen3.8-27B,再按自己的内存选量化版本即可。

Unsloth 会自动处理大部分推理参数,也会识别多张 GPU。显存放不下时,它还能把一部分权重增加到系统内存中。

Thinking、Preserved Thinking、Web Search、Code Execution 和工具调用也都加进去了。

这对本地 Agent 挺重要,省得模型跑起来了,工具又接不上。。。

图源:Unsloth;Dynamic 4-bit Qwen3.8-27B 在 Unsloth Desktop 中运行

喜欢浏览器界面的,也可以手动装 Unsloth Studio。

Mac、Linux 和 WSL 打开终端:

arduino 复制代码
curl -fsSL https://unsloth.ai/install.sh | sh
unsloth studio -p 8888

Windows 用 PowerShell:

arduino 复制代码
irm https://unsloth.ai/install.ps1 | iex
unsloth studio -p 8888

然后在浏览器打开:

arduino 复制代码
http://127.0.0.1:8888

第一次启动会让你创建密码。进入 Model hub,搜索 Qwen3.8-27B-GGUF,24GB 机器选 Q4,16GB 机器先选 Q3。

如果只在自己电脑上用,启动命令里不要加 -H 0.0.0.0。这个参数会把服务开放给同一网络里的其他设备,公网千万别这么干。

如果想接自己的工具,就用 llama.cpp

已经在用 llama.cpp 的小伙伴,先把版本更新到最新,再从 Hugging Face 下载 Unsloth 的 GGUF。

24GB 机器直接下 4-bit:

css 复制代码
pip install -U "huggingface_hub[cli]"

hf download unsloth/Qwen3.8-27B-GGUF \
  --local-dir unsloth/Qwen3.8-27B-GGUF \
  --include "*UD-Q4_K_XL*"

然后启动:

css 复制代码
./llama.cpp/llama-cli \
  --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \
  --ctx-size 32768 \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.0

16GB 机器把下载规则和模型名里的 UD-Q4_K_XL 换成 UD-Q3_K_XL

Mac 编译 llama.cpp 时关闭 CUDA 就行,Metal 默认开启。NVIDIA 走 CUDA,AMD 可以走 HIP 或 Vulkan。

如果要把它接给 OpenCode、Open WebUI 或自己的程序,把 llama-cli 换成 llama-server,再让客户端访问本机的 OpenAI 兼容接口。

Qwen3.8 默认开启思考。复杂代码和 Agent 任务先用官方推荐参数:

ini 复制代码
temperature = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0
context = 32768 起步

普通聊天不想等它想半天,可以关闭思考:

json 复制代码
--chat-template-kwargs '{"enable_thinking":false}'

非思考模式的推荐参数是 temperature=0.7top_p=0.80top_k=20presence_penalty=1.5

如果要看图,记得再下载同一个 GGUF 仓库里的 mmproj-F16.gguf,启动时加上 --mmproj mmproj-F16.gguf。只下语言模型文件,没有图片能力。

Ollama 和 LM Studio,更适合不想折腾命令的人

Ollama 已经上架了官方 Qwen3.8 模型。默认就是 27B,模型大约 18GB,标注支持 256K 上下文、图片、工具调用和思考模式。

安装好 Ollama 之后,一行命令:

arduino 复制代码
ollama run qwen3.8

Apple Silicon 还可以试 MLX 版本:

arduino 复制代码
ollama run qwen3.8:27b-mlx

LM Studio 的做法也很简单。

进入 Discover,把 Unsloth 的 GGUF 仓库地址贴进去,再选 Q3、Q4 或 Q8。

它适合想自己调显存卸载比例、上下文和采样参数的人。

需要本地 API 时,在 Developer 页面启动 Server,就能给其他工具使用。

这两条路线的区别很简单:Ollama 适合一条命令跑起来,LM Studio 适合一边看界面一边调参数。

给团队使用的话,用 vLLM 和 SGLang

一个人用的话,llama.cpp 足够了。如果设计几个人同时调用,vLLM 和 SGLang 更合适。

Qwen 官方已经给出了 vLLM recipe 和 SGLang cookbook 。它们支持连续批处理、Prefix Cache、多 GPU 和 OpenAI 兼容 API,主要解决并发和吞吐。

如果你有至少 24GB 显存的 Blackwell GPU,比如 RTX 5090、DGX Spark、B200 或 B300,可以用 Unsloth 的 NVFP4 权重。文件大约 23.4GB,Unsloth 给出的速度比 BF16 快约 1.5 倍。当前文档要求 vLLM>=0.25.0

vLLM:

复制代码
vllm serve unsloth/Qwen3.8-27B-NVFP4

需要 MTP 推测解码,再加:

css 复制代码
vllm serve unsloth/Qwen3.8-27B-NVFP4 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":2}'

SGLang:

css 复制代码
python -m sglang.launch_server \
  --model-path unsloth/Qwen3.8-27B-NVFP4 \
  --speculative-algorithm NEXTN \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4

老款 NVIDIA 显卡别下 NVFP4。RTX 4090、3090 这类 24GB 卡,继续用 GGUF + llama.cpp 更省事。官方 FP8 权重约 30.9GB,更适合 48GB 显卡或多卡服务器。

工具调用还要开对应的 parser。vLLM 的 Qwen3.8 recipe 使用 --enable-auto-tool-choice --tool-call-parser qwen3_coder

至于 2.4T,自己玩就别考虑了

Unsloth 也把 Qwen3.8-2.4T-A95B 做成了 GGUF。

官方 BF16 权重要 4.9TB,Q8 约 2.6TB。Unsloth 新做的 Dynamic 1-bit 版本压到了 397GB,已经缩小了 91%。

然后呢?

最小的 397GB 版本,仍然建议准备至少 450GB RAM。纯 CPU 可以启动,速度就别想太多了。生产部署更夸张,TokenSpeed 的参考配置已经是 16 张 GPU、两个 8 卡节点。

所以 2.4T 的开放,主要方便量化团队、推理框架和有服务器的企业。

普通用户直接跑 27B,反而还有视觉和非思考模式,体验更完整。

所以本地跑 Qwen3.8 这件事确实能行。

16GB 可以尝鲜,24GB 已经能认真用,32GB 压力更小。

我上次写 DeepSeek-V4-Flash 本地部署的时候还得从 110GB 起步;这次 Qwen3.8-27B 的 4-bit 只有 17.9GB。

像我这种 32G 丐版内存的 Mac,这回终于不用再等等了。。。

马上部署一下,跟大家来个实际反馈

今天多多少少得说一句,阿里牛逼了。

参考资料:

相关推荐
aidesignplus1 小时前
Anthropic 最新发布《2026 Agentic Coding Trends Report》粗浅解析
人工智能
能源革命1 小时前
AI日报 2026-08-15
人工智能
Uncommon.1 小时前
使用Pytorch自动计算梯度
人工智能·pytorch·python
安逸sgr1 小时前
循环神经网络 RNN、LSTM、GRU 是什么?为什么能处理序列?
人工智能·ai·大模型·agent·智能体
猿小猴子2 小时前
主流 AGENT 实战教程「OpenCodex」与「ChatGPT Work」与「Codex Record & Replay」介绍
人工智能·ai·chatgpt·codex·minimax·deepseek·opencodex
shdwak....sad2 小时前
版本管理&迁移kali-vmware&知识库
人工智能·网络安全
凤山老林2 小时前
高保真集成测试:Spring Boot 结合 Testcontainers 的工程落地
spring boot·后端·集成测试
步行cgn2 小时前
MyBatis <trim> 标签完全解析:动态 SQL 的终极武器
后端
XPoet2 小时前
AI 编程工程化:实战——从 0 到 1 搭建 AI 编程工作流
前端·后端·ai编程