【首发】DGX Spark 三机互连跑 Qwen3-235B-A22B-FP8!

往期我们测试了1DGX Spark 运行 gps-oss-120b FP4 模型,近期我们的技术伙伴测试了3 台集群运行 Qwen3-235B-A22B-FP8 模型,现在来为大家带来第一手的实测性能分析。

实测视频

DGX Spark 三机互连跑 Qwen3-235B-FP8

上述视频中通过3 台 DGX Spark 互连形成环状网 ,已成功调用3台 DGX Spark 的算力,并且可以运行 Qwen3-235B-A22B-FP8 的模型。想要了解网络如何配置可私信,下面我们来看看实测数据。

测试数据(4k输入)

单用户的生成速度有8 tokens/s ,首字延迟在2s左右。

并发为2时,生成速度仍有 7.8 tokens/s ,首字延迟3.29s

此外 DGX Spark 单用户的 Prefill 能达到2000 token/s 。多用户 Prefill 最高可达 3450 token/s。可以看出 DGX Spark 的表现不错。

为什么 Prefill 那么重要?

  1. 用户体验: 在交互式应用中(如聊天机器人),Prefill 直接决定了用户从按下"发送"到看到第一个字开始出现的等待时间。这个"首字延迟"对用户体验至关重要。
  2. 处理长上下文能力: Prefill 的计算复杂度与输入序列长度的平方(在原始注意力机制下)成正比。因此当处理非常长的文档或对话历史时,Prefill 延迟会急剧增加成为系统瓶颈。优化 Prefill 性能是让模型用好长上下文的关键。
相关推荐
悟天特斯43 分钟前
智慧楼宇AI节能:从数据采集到智能决策的全链路实践
大数据·人工智能
柠檬味的Cat1 小时前
GEO优化系统哪个渠道商好
大数据·人工智能·python
CHrisFC2 小时前
环保第三方检测行业LIMS横向对比与选型指南
大数据·人工智能
老猿AI洞察3 小时前
7月25日热点:马斯克说中国AI有望成为全球领导者,这次不是客套话
大数据·人工智能
wengad3 小时前
金融文本判定指南:如何精准区分个股新闻与行业新闻
大数据·人工智能·机器学习·金融
数智化管理手记4 小时前
财务大数据怎么管住资金风险?财务大数据和财务数智化到底怎么结合?
大数据·网络·数据库·人工智能·数据挖掘
晓子文集4 小时前
Tushare接口文档:指数成分和权重(index_weight)
大数据·数据库·python·金融·量化投资
D202020205 小时前
TikTok达人履约乱象?达秘带你拆解供需权力关系错位的本质
大数据·人工智能
wuhanzhanhui6 小时前
从精密齿轮到智慧流体:2026武汉动力传动展览会,重构未来工业动力
大数据·人工智能
普马萨特7 小时前
代际更替与结构优化:中国2G/3G/4G/5G基站总量趋势深度研究
大数据