对于开源AI领域而言,这又是表现极佳的一个月。Qwen3.8-27B 、DeepSeek-V4-Flash-0731 和 Poolside 的 Laguna S 2.1 这三款模型相继发布,共同重塑了本地智能体(local-agent)的技术栈格局。
说明:GLM-5.3 也在本月发布,根据智谱(Zhipu)官方数据,其性能处于 Fable 5 级别,且优于 Kimi K3。由于它无法在个人设备上本地运行,因此我们未将其纳入此次直接对比。DeepSeek V4 Pro 未出现在此列表中也是出于同样的原因。本期内容聚焦于那些用户可以实际下载并在本地离线部署的模型。
简而言之:Qwen3.8-27B 堪称"巨兽"级模型。它是目前能在单张 24GB 消费级 GPU 上运行的最强模型,也是这三款模型中唯一具备视觉能力的。
背景:Qwen 发布前一周的情况
在 Qwen3.8 发布的五天前,业界的焦点是 Meta 发布的 Muse Glimmer(8 月 10 日发布,300 亿参数,采用 Apache 2.0 协议)。它在大多数智能体(agentic)基准测试中击败了 Qwen3.6-27B 和 Gemma 4-31B,具体成绩为:MCP Atlas 75.5、DeepSearch QA 74.6、Gaia2 43.3 和 AIME 2026 94.7。不过,这些优势既微弱又不均衡:Qwen3.6-27B 仍在 OSWorld-Verified(75.6 对 65.9)、TerminalBench 2.1(60.7)和 SWE-Bench Verified(77.2)等测试中保持领先。
Qwen 3.8 的胜利绝非微弱优势。它在那些通常会导致本地智能体"翻车"的场景中取得了胜利。
NVIDIA 的 Nemotron 3 系列是另一个参照对象,但其表现并不理想。在开放权重模型排行榜上,Nemotron 3 Ultra 的排名在 48 位左右,而 Qwen 排名在 52 位左右------要知道,Nemotron 可是晚了六个月发布,且背后拥有远超对手的算力支持。Nemotron 真正的亮点在于吞吐量(NVIDIA 声称在高并发服务场景下,其吞吐量是 Qwen3.5-122B 的 7.5 倍),而非模型能力本身。
写代码 / 智能体(Agentic)
| 测试基准 | Qwen 27B | Laguna S | DeepSeek | 优势方 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 73.0 | 70.2 | 82.7 | DeepSeek |
| DeepSWE 42.2¹ | 40.4 | 54.4 | DeepSeek | |
| SWE-bench Pro | 61.7 | 59.4 --- | Qwen | |
| NL2Repo | 42.3 | --- | 54.2 | DeepSeek |
| Toolathlon Verified | --- | 49.7 | 70.3 | DeepSeek |
| Agents' Last Exam 20.4 (Pass@1) | --- | 25.2 | DeepSeek² |
所有数据均由厂商根据官方模型卡(model cards)和发布公告提供。
¹ Qwen 将其运行版本标记为 DeepSWE 1.1,因此这三个 DeepSWE 数值所采用的评估设置未必完全一致。
² 不同厂商在智能体(Agent)基准测试中使用了各异的测试框架与辅助架构。趋势走向具有参考意义,但具体的数值差值(如"两点差距")则不具备可比性。
Terminal-Bench的结果是有趣的
- DeepSeek 0731:82.7
- Qwen3.8-27B:73.0
- Laguna S 2.1:70.2
DeepSeek 的表现比 Qwen 高出 9.7 分,比 Laguna 高出 12.5 分。相比之下,Qwen 仅领先 Laguna 2.8 分------这个数字值得深思,因为这两者在本质上截然不同:Qwen 是一个 270 亿(27B)参数的稠密模型(dense model),而 Laguna 则是总参数量 1180 亿(118B)、激活参数量约 80 亿(8B)的混合专家模型(MoE)。Laguna 原本就以其激活参数规模著称,而 Qwen 仅凭小得多的模型体量,就几乎抹平了这一优势差距。
DeepSeek 的性能跃升也呈现出一种独特的现象。V4-Flash-Preview 版本在 Terminal-Bench 2.1 上的得分为 61.8 分;而采用相同架构和参数规模(总参数 284B,激活参数 13B,上下文窗口 1M)的 0731 版本,得分则高达 82.7 分。两者唯一的区别在于重新进行了后训练(post-training)。DeepSeek 官方表示,0731 版本将全面取代预览版,而促成这一更迭的主要原因在于其在智能体(agentic)能力方面的显著提升。
这也应当让你对这些绝对数值持一定的怀疑态度。仅凭后训练就能带来 21 分的提升,且该数据基于尚未公开的内部评测集得出------这类结果在经过独立第三方评估时,通常会出现缩水。
Qwen3.8-27B:独具特色的表现
| 测试基准 | 得分 |
|---|---|
| Terminal-Bench 2.1 | 73.0 |
| SWE-bench Pro | 61.7 |
| NL2Repo | 42.3 |
| DeepSWE 1.1 | 42.2 |
| QwenSWEBench | 79.0 |
| LiveCodeBench v6 | 90.3 |
| GPQA Diamond | 89.2 |
| HLE | 30.8 |
| IFBench | 79.5 |
| CoWorkBench | 70.7 |
与同等标称稠密参数量的前代产品相比:
| 测试基准 | Qwen 3.6 | Qwen 3.8 | 差值 |
|---|---|---|---|
| Terminal-Bench 2.1 | 63.4 | 73.0 | +9.6 |
| SWE-bench Pro | 53.5 | 61.7 | +8.2 |
| DeepSWE | 13.3 | 42.2 | +28.9 |
| OSWorld-Verified | 63.9 | 84.3 | +20.4 |
DeepSWE 这一行并非笔误。无论 Qwen 在智能体(agentic)导向的后训练阶段进行了何种调整,其变化幅度都相当巨大。
这是竞争对手所不具备的特性:
**Qwen3.8-27B 具备原生多模态能力。**模型卡片显示其支持图像和视频输入(与文本输入并列),并将其描述为一款配备视觉编码器的 270 亿参数(27B)因果语言模型。以下是其在智能体视觉任务中的表现:
| 测试基准 | 得分 |
|---|---|
| OSWorld-Verified | 84.3 |
| AndroidWorld | 81.9 |
| WebArena-Verified | 64.8 |
| Vision2Web | 62.9 |
| SWE-MM | 38.6 |
Laguna S 2.1 的模态类型为"文本到文本"(text-to-text)。DeepSeek V4 Flash 0731 则作为文本生成模型发布。如果你的智能体(agent)需要查看屏幕内容------而任何浏览器或桌面端智能体最终都免不了这一步------那么在这一量级(参数规模)的模型中,目前只有一个理想选择。
性能:测试基准表格中往往被忽略的一面
"单位参数的能力"只是本地模型考量因素的一半;另一半则是内存带宽,它决定了这些模型中究竟哪一个能在你的设备上真正运行。
Qwen3.8-27B 规格概览(277.8 亿参数,262,144 token 原生上下文长度,Apache 2.0 协议):
| 量化 | 显存(VRAM) |
|---|---|
| BF16 | ~54 GB |
| FP8 | ~27 GB |
| Q6_K (近乎无损) | ~21 GB |
| Q4_K_M | ~16 GB |
| Q3_K_M / IQ3 | ~13 GB |
24 GB 是起步的最低配置要求。若想真正利用长上下文长度,32--48 GB 才是舒适的配置范围------毕竟在 262K 的上下文窗口下,KV 缓存占用的显存绝非可以忽略不计的"零头"。
**稠密(Dense)模型在带宽充足时速度极快,但在带宽受限时则表现糟糕。**在 RTX 5090 上,4-bit 量化的 27B 稠密模型堪称理想之选:权重能完全装入显存,带宽也足够,且能实现交互式响应速度。而在 DGX Spark (GB10) 上,同一模型则受限于显存带宽------虽然统一内存能轻松容纳模型,但稠密模型推理需要在生成每个 token 时读取所有参数,而该硬件的数据传输速度跟不上这一需求。这是 Spark 众所周知的性能瓶颈,而这正是 Laguna 的 ~8B 激活参数 MoE 模型胜出的原因:它在生成每个 token 时只需读取一小部分权重,且 Poolside 特意将其 NVFP4 版本设计为适配单台 Spark。
**当前的硬件市场状况也无助于缓解这一局面。**8 月份,RTX 5090 在美国的售价中位数达到了约 4,700 美元,比 1,999 美元的建议零售价(MSRP)高出约 135%,这主要是由显存短缺而非游戏需求驱动的。一款能在单张 32 GB 显卡上出色运行的模型,显然无法让这种过热的市场行情降温。
根据你手头的硬件配置给出的建议:
**单张 5090(或任何 24--32 GB 消费级 GPU)→ Qwen3.8-27B。**这是在显存限制内能力最强的模型,且附带视觉理解功能。显存紧张时选 Q4_K_M,有余量时选 Q6_K。
**单台 DGX Spark → 追求吞吐量选 Laguna S 2.1;若需视觉功能则选 Qwen3.8-27B。**Laguna 的 MoE 架构非常契合 Spark 的带宽特性,且 Poolside 专门针对该设备优化了 NVFP4 版本。仅在任务涉及截图分析时运行 Qwen,且需做好速度较慢的心理准备。
多台 DGX / 专业本地集群 → DeepSeek V4 Flash 0731;若能接受非本地回退方案(即部分请求转由云端处理),也可选择 GLM 5.3。 0731 无疑是目前最强大的纯文本/代码智能体(Agent)模型。
有一点需要坦诚说明:
本期报告中的各项数据均由厂商自行提供,且部分数据源自尚未公开的评测基准。其中,Qwen 运行 DeepSWE 所使用的版本,与 DeepSeek 和 Poolside 所使用的版本明显不同。在独立的评测结果出炉之前,建议将这些排名仅视为参考趋势,并将分数差距视为统计噪声。后续,我们将基于"固定版智能体 Web 评测套件"重新评估这些模型;在该套件中,所有模型将面对相同的浏览器状态、统一的 41 种工具接口规范以及相同的提示词(prompt)。
原文地址:What are the best new models to run on an RTX 5090, DGX Spark, and other machines?