【译】适合在RTX 5090、DGX Spark或类似机器上可运行的最佳新模型是什么?

对于开源AI领域而言,这又是表现极佳的一个月。Qwen3.8-27BDeepSeek-V4-Flash-0731 和 Poolside 的 Laguna S 2.1 这三款模型相继发布,共同重塑了本地智能体(local-agent)的技术栈格局。

说明:GLM-5.3 也在本月发布,根据智谱(Zhipu)官方数据,其性能处于 Fable 5 级别,且优于 Kimi K3。由于它无法在个人设备上本地运行,因此我们未将其纳入此次直接对比。DeepSeek V4 Pro 未出现在此列表中也是出于同样的原因。本期内容聚焦于那些用户可以实际下载并在本地离线部署的模型。

简而言之:Qwen3.8-27B 堪称"巨兽"级模型。它是目前能在单张 24GB 消费级 GPU 上运行的最强模型,也是这三款模型中唯一具备视觉能力的。


背景:Qwen 发布前一周的情况

在 Qwen3.8 发布的五天前,业界的焦点是 Meta 发布的 Muse Glimmer(8 月 10 日发布,300 亿参数,采用 Apache 2.0 协议)。它在大多数智能体(agentic)基准测试中击败了 Qwen3.6-27B 和 Gemma 4-31B,具体成绩为:MCP Atlas 75.5、DeepSearch QA 74.6、Gaia2 43.3 和 AIME 2026 94.7。不过,这些优势既微弱又不均衡:Qwen3.6-27B 仍在 OSWorld-Verified(75.6 对 65.9)、TerminalBench 2.1(60.7)和 SWE-Bench Verified(77.2)等测试中保持领先。

Qwen 3.8 的胜利绝非微弱优势。它在那些通常会导致本地智能体"翻车"的场景中取得了胜利。

NVIDIA 的 Nemotron 3 系列是另一个参照对象,但其表现并不理想。在开放权重模型排行榜上,Nemotron 3 Ultra 的排名在 48 位左右,而 Qwen 排名在 52 位左右------要知道,Nemotron 可是晚了六个月发布,且背后拥有远超对手的算力支持。Nemotron 真正的亮点在于吞吐量(NVIDIA 声称在高并发服务场景下,其吞吐量是 Qwen3.5-122B 的 7.5 倍),而非模型能力本身。


写代码 / 智能体(Agentic)

测试基准 Qwen 27B Laguna S DeepSeek 优势方
Terminal-Bench 2.1 73.0 70.2 82.7 DeepSeek
DeepSWE 42.2¹ 40.4 54.4 DeepSeek
SWE-bench Pro 61.7 59.4 --- Qwen
NL2Repo 42.3 --- 54.2 DeepSeek
Toolathlon Verified --- 49.7 70.3 DeepSeek
Agents' Last Exam 20.4 (Pass@1) --- 25.2 DeepSeek²

所有数据均由厂商根据官方模型卡(model cards)和发布公告提供。

¹ Qwen 将其运行版本标记为 DeepSWE 1.1,因此这三个 DeepSWE 数值所采用的评估设置未必完全一致。

² 不同厂商在智能体(Agent)基准测试中使用了各异的测试框架与辅助架构。趋势走向具有参考意义,但具体的数值差值(如"两点差距")则不具备可比性。

Terminal-Bench的结果是有趣的

  • DeepSeek 0731:82.7
  • Qwen3.8-27B:73.0
  • Laguna S 2.1:70.2

DeepSeek 的表现比 Qwen 高出 9.7 分,比 Laguna 高出 12.5 分。相比之下,Qwen 仅领先 Laguna 2.8 分------这个数字值得深思,因为这两者在本质上截然不同:Qwen 是一个 270 亿(27B)参数的稠密模型(dense model),而 Laguna 则是总参数量 1180 亿(118B)、激活参数量约 80 亿(8B)的混合专家模型(MoE)。Laguna 原本就以其激活参数规模著称,而 Qwen 仅凭小得多的模型体量,就几乎抹平了这一优势差距。

DeepSeek 的性能跃升也呈现出一种独特的现象。V4-Flash-Preview 版本在 Terminal-Bench 2.1 上的得分为 61.8 分;而采用相同架构和参数规模(总参数 284B,激活参数 13B,上下文窗口 1M)的 0731 版本,得分则高达 82.7 分。两者唯一的区别在于重新进行了后训练(post-training)。DeepSeek 官方表示,0731 版本将全面取代预览版,而促成这一更迭的主要原因在于其在智能体(agentic)能力方面的显著提升。

这也应当让你对这些绝对数值持一定的怀疑态度。仅凭后训练就能带来 21 分的提升,且该数据基于尚未公开的内部评测集得出------这类结果在经过独立第三方评估时,通常会出现缩水。


Qwen3.8-27B:独具特色的表现

测试基准 得分
Terminal-Bench 2.1 73.0
SWE-bench Pro 61.7
NL2Repo 42.3
DeepSWE 1.1 42.2
QwenSWEBench 79.0
LiveCodeBench v6 90.3
GPQA Diamond 89.2
HLE 30.8
IFBench 79.5
CoWorkBench 70.7

与同等标称稠密参数量的前代产品相比:

测试基准 Qwen 3.6 Qwen 3.8 差值
Terminal-Bench 2.1 63.4 73.0 +9.6
SWE-bench Pro 53.5 61.7 +8.2
DeepSWE 13.3 42.2 +28.9
OSWorld-Verified 63.9 84.3 +20.4

DeepSWE 这一行并非笔误。无论 Qwen 在智能体(agentic)导向的后训练阶段进行了何种调整,其变化幅度都相当巨大。

这是竞争对手所不具备的特性:

**Qwen3.8-27B 具备原生多模态能力。**模型卡片显示其支持图像和视频输入(与文本输入并列),并将其描述为一款配备视觉编码器的 270 亿参数(27B)因果语言模型。以下是其在智能体视觉任务中的表现:

测试基准 得分
OSWorld-Verified 84.3
AndroidWorld 81.9
WebArena-Verified 64.8
Vision2Web 62.9
SWE-MM 38.6

Laguna S 2.1 的模态类型为"文本到文本"(text-to-text)。DeepSeek V4 Flash 0731 则作为文本生成模型发布。如果你的智能体(agent)需要查看屏幕内容------而任何浏览器或桌面端智能体最终都免不了这一步------那么在这一量级(参数规模)的模型中,目前只有一个理想选择。


性能:测试基准表格中往往被忽略的一面

"单位参数的能力"只是本地模型考量因素的一半;另一半则是内存带宽,它决定了这些模型中究竟哪一个能在你的设备上真正运行。

Qwen3.8-27B 规格概览(277.8 亿参数,262,144 token 原生上下文长度,Apache 2.0 协议):

量化 显存(VRAM)
BF16 ~54 GB
FP8 ~27 GB
Q6_K (近乎无损) ~21 GB
Q4_K_M ~16 GB
Q3_K_M / IQ3 ~13 GB

24 GB 是起步的最低配置要求。若想真正利用长上下文长度,32--48 GB 才是舒适的配置范围------毕竟在 262K 的上下文窗口下,KV 缓存占用的显存绝非可以忽略不计的"零头"。

**稠密(Dense)模型在带宽充足时速度极快,但在带宽受限时则表现糟糕。**在 RTX 5090 上,4-bit 量化的 27B 稠密模型堪称理想之选:权重能完全装入显存,带宽也足够,且能实现交互式响应速度。而在 DGX Spark (GB10) 上,同一模型则受限于显存带宽------虽然统一内存能轻松容纳模型,但稠密模型推理需要在生成每个 token 时读取所有参数,而该硬件的数据传输速度跟不上这一需求。这是 Spark 众所周知的性能瓶颈,而这正是 Laguna 的 ~8B 激活参数 MoE 模型胜出的原因:它在生成每个 token 时只需读取一小部分权重,且 Poolside 特意将其 NVFP4 版本设计为适配单台 Spark。

**当前的硬件市场状况也无助于缓解这一局面。**8 月份,RTX 5090 在美国的售价中位数达到了约 4,700 美元,比 1,999 美元的建议零售价(MSRP)高出约 135%,这主要是由显存短缺而非游戏需求驱动的。一款能在单张 32 GB 显卡上出色运行的模型,显然无法让这种过热的市场行情降温。


根据你手头的硬件配置给出的建议:

**单张 5090(或任何 24--32 GB 消费级 GPU)→ Qwen3.8-27B。**这是在显存限制内能力最强的模型,且附带视觉理解功能。显存紧张时选 Q4_K_M,有余量时选 Q6_K。

**单台 DGX Spark → 追求吞吐量选 Laguna S 2.1;若需视觉功能则选 Qwen3.8-27B。**Laguna 的 MoE 架构非常契合 Spark 的带宽特性,且 Poolside 专门针对该设备优化了 NVFP4 版本。仅在任务涉及截图分析时运行 Qwen,且需做好速度较慢的心理准备。

多台 DGX / 专业本地集群 → DeepSeek V4 Flash 0731;若能接受非本地回退方案(即部分请求转由云端处理),也可选择 GLM 5.3。 0731 无疑是目前最强大的纯文本/代码智能体(Agent)模型。

有一点需要坦诚说明:

本期报告中的各项数据均由厂商自行提供,且部分数据源自尚未公开的评测基准。其中,Qwen 运行 DeepSWE 所使用的版本,与 DeepSeek 和 Poolside 所使用的版本明显不同。在独立的评测结果出炉之前,建议将这些排名仅视为参考趋势,并将分数差距视为统计噪声。后续,我们将基于"固定版智能体 Web 评测套件"重新评估这些模型;在该套件中,所有模型将面对相同的浏览器状态、统一的 41 种工具接口规范以及相同的提示词(prompt)。

原文地址:What are the best new models to run on an RTX 5090, DGX Spark, and other machines?

相关推荐
caimouse1 小时前
ReactOS 窗口系统分析(31):TextOutW 文本输出全链路 — 从用户函数到显示缓冲区的旅程
网络·人工智能·计算机视觉
sunneo1 小时前
每周GitCode开源项目精选
人工智能
zhangfeng11331 小时前
HiDevLab vCANNLab(昇腾两个云端WebIDE)安装codebuddy
人工智能·ai编程·算子开发
leeyi1 小时前
Agent 间 Transfer 交接:用户在不同 Agent 间无缝切换(第93篇-E79)
人工智能·aigc·agent
很楠爱上1 小时前
从“AI 看合同”到可举证的合同决策链:CounterClause(对薄) 的架构设计与工程实践
人工智能·经验分享·python·学习·agent
Java后端的Ai之路1 小时前
02、Python普通工厂模式
开发语言·人工智能·python·设计模式·普通工厂模式
阿童木写作1 小时前
2026年8月跨境电商批量翻译工具推荐实战指南
大数据·跨境电商批量跨境翻译工具推荐
爱奥尼欧1 小时前
14.输出解析器-Pydantic与JSON
人工智能·学习·langchain·json
ReleaseU1 小时前
Claude Code 两天三版本、Cursor 把仓库搬进编辑器:AI 编程工具在卷什么?
人工智能·大模型