MI50运算卡使用llama.cpp的ROCm后端运行Qwen3-Coder-30B-A3B的速度测试

上一篇有写到如何为MI50编译ROCm版的llama.cpp,测试下吞吐速度:

使用到的模型是unsloth提供的Qwen3-Coder-30B-A3B-Instruct-UD-Q4_K_XL 量化版本。

测速如下:

bash 复制代码
ggml_cuda_init: GGML_CUDA_FORCE_MMQ:    no
ggml_cuda_init: GGML_CUDA_FORCE_CUBLAS: no
ggml_cuda_init: found 1 ROCm devices:
  Device 0: AMD Radeon Graphics, gfx906:sramecc-:xnack- (0x906), VMM: no, Wave Size: 64
| model                          |       size |     params | backend    | ngl |            test |                  t/s |
| ------------------------------ | ---------: | ---------: | ---------- | --: | --------------: | -------------------: |
| qwen3moe 30B.A3B Q4_K - Medium |  16.45 GiB |    30.53 B | ROCm       |  99 |           pp512 |        990.65 ± 3.12 |
| qwen3moe 30B.A3B Q4_K - Medium |  16.45 GiB |    30.53 B | ROCm       |  99 |           tg128 |         73.51 ± 0.06 |

可见在处理输入时非常快。

相关推荐
qq_4542450319 小时前
axioms prompt
人工智能·prompt
DFT计算杂谈20 小时前
扭转石墨烯中的高 Chern 数轨道磁体
人工智能
BerrySen17820 小时前
一个Java项目改成AI流程后,最难的部分完全变了
java·大数据·人工智能·可观测性·大模型应用开发·工程思维
LaughingZhu20 小时前
Product Hunt 每日热榜 | 2026-07-27
人工智能·深度学习·神经网络·搜索引擎·产品运营
水如烟20 小时前
孤能子视角:EIS是什么——回顾文明来时路,试构碳硅认知语法
人工智能
netho020 小时前
影刀多 table 组合定位,网页操作题怎么少踩坑
人工智能
核数聚20 小时前
【赛迪专访核数聚】深耕数据治理,打通数据孤岛夯实 AI 发展根基
大数据·人工智能·算法
丘丘用户思思澪20 小时前
AI Agent 工作模式完全指南:从执行逻辑到系统架构
人工智能·系统架构
无敌秋20 小时前
AI-RAN 完整详解
人工智能
新知图书20 小时前
3.2 技能的格式和工作机制(扣子编程)
人工智能·agent·ai agent·智能体