RK3588 NPU 跑大模型实测:rknn-llm 解码 25.9 tok/s,是 llama.cpp 的 4 倍!附三天完整踩坑记录上周折腾了一件大事:手头有块 Orange Pi 5 Plus(RK3588,16GB 内存,带 6 TOPS 的 NPU),之前已经在 Jetson Orin 上跑通了 Qwen2.5,这次想看看 RK3588 这块国产芯片能不能也把大模型跑起来。而且光跑起来还不够——RK3588 上有大模型推理的两条主流路线:llama.cpp(社区 NPU fork) 和 rknn-llm(瑞芯微官方工具链),到底谁快?网上众说纷纭,干脆自己动手,同板同模型同协议测一遍。