【大模型Qwen3.8 27B】llama.cpp 本地大模型部署与使用环境:Ubuntu 26.04(kernel 7.0.0-34)+ AMD Radeon RX 7900 XTX 24GB(gfx1100)+ Granite Ridge 核显 部署:llama.cpp b11227(Vulkan/RADV) + Qwen3.8-27B UD-Q4_K_M(16.46GB) 当前配置:上下文 131072(128k),KV q4_0,MTP 投机解码,显存 19.98GB(留 ~4GB 余量) 实测:prefill 387–781 tok/s,decode 37.7–72