【AI 推理】在 Rockchip NPU 上实现 MoE 大模型流式推理的技术方案SEO 摘要:本文深入探讨如何在 Rockchip NPU(以 RK3588 为例)上实现类似 turbo-fieldfare 的 MoE 大模型流式推理方案。文章详细分析了 turbo-fieldfare 的核心技术(专家流式加载、极限内存预算),调研了 Rockchip NPU 生态(rknn-llm、rknn-toolkit2、rkllama 等),并提出了完整的架构设计、模型拆分策略、关键模块实现方案及性能优化策略。目标是在资源受限的边缘设备上运行 Gemma 4 26B-A4B 等大型 MoE