WS-RPE:面向边缘物理AI实时特征值计算的硬件工作窃取调度器与冗余PE激活架构

本文被 ASAP'26 录用


摘要------边缘物理AI控制器中的实时稳定性监测需要对动态演化的系统矩阵进行超低延迟的主特征值计算。现有加速器在处理小型稀疏控制系统矩阵时存在PE利用率不足和调度灵活性差的问题。本文提出WS-RPE,一种动态分块调度架构,集成多尺寸子块并行、跨队列工作窃取和按需冗余PE激活。在Xilinx Kintex-7 FPGA上以250 MHz实现,WS-RPE相比现有幂迭代加速器获得6.24倍内核加速,将PE空闲时间降至3.15%,系统级加速达2.8倍,而LUT开销仅为40.4%。


一、引言

敏捷物理AI系统(如无人机和仿人机器人)中的实时稳定性监测,要求对动态演化的系统矩阵进行超低延迟的主特征值计算。对于线性化系统 x˙=A(t)xx˙=A(t)x,稳定性由谱半径决定,即最大特征值模。稳定性监测仅需此主特征值而非完整特征分解。然而,计算它仍是控制回路中的主要瓶颈。

在特征值算法中,幂迭代具有最低的每迭代复杂度 O(N2)O(N2),且在良态系统中10-30次迭代即可收敛。但对ARM的剖析显示,对于8×864×64 的矩阵,它仍消耗超过33%的控制回路时间。GPU因高功耗开销而不适合边缘部署,这使得FPGA加速器势在必行。

现有FPGA加速器面向密集GEMM优化,由于刚性并行性、朴素调度和数据感知能力差,在稀疏控制矩阵上表现不佳。我们提出WS-RPE,一种动态分块调度架构,集成多尺寸块并行、跨队列工作窃取和按需冗余PE激活。

二、数学背景

控制系统矩阵 A(t) 由于相邻状态间的局部耦合而呈现结构化稀疏和对角占优特性。我们采用幂迭代通过反复的矩阵-向量乘法 计算主特征值,其中 。由于每次迭代本质上是矩阵-向量乘积,计算可分解为对角块上的独立子操作,非零元集中于此。这种分块级并行性实现了流水线间的细粒度任务分发,并作为我们调度架构的基础。

图1. WS-RPE整体计算流程与块分解

三、WS-RPE架构

整体数据流如图1所示。N×N 矩阵首先被划分为不同大小的对角子块(从 2×2N×N ,步长为2)。这些块随后入队到 N/2个并行队列中,每个队列供给一条专用流水线。调度器动态地将任务分派给PE,空闲流水线从过载队列窃取工作。最后,所有流水线的部分结果被合并和重排序,产生用于下一次幂迭代的更新向量。

图2. WS-RPE微架构执行流水线

步骤①------向量初始化与块划分:迭代向量使用基向量初始化,以最大化到主特征向量的投影,减少迭代次数。随后根据矩阵的稀疏模式将其划分为对角子块;Block_Partition数组存储每个块的大小以供队列派发使用。

步骤②------带工作窃取的动态分块调度:子块与向量段一起打包成数据包,派发到 N/2N/2 个队列。硬件调度器持续监控队列深度。当某队列变空时,它从负载最重的队列中窃取最大的可用任务。被窃取的任务进行零填充以匹配目标块大小,数据包头部中的Stealing Flag确保结果返回到正确的源队列。

步骤③------PE执行与混合精度归约:每个 2×12×1 PE对其分配的子块执行矩阵-向量乘法。为平衡精度与效率,WS-RPE采用混合精度策略:乘法使用FP16以减少带宽和存储,累加使用FP32以在迭代间保持数值精度。若窃取不足以解决拥塞,则从全局池中按需激活冗余PE,为停滞的流水线创建辅助计算路径。

步骤④------结果重排序:重排序缓冲(ROB)异步跟踪子块完成状态,确保结果按序输出,并在检测到连续完成序列时批量输出结果。动态调整单元(DAU)跟踪近期迭代次数并通过指数衰减调整收敛阈值,在时间相关负载下减少8-12%的不必要迭代。

所有调度、窃取和重排序逻辑均在硬件中实现,消除了软件级内核启动和同步开销------这对满足亚毫秒级控制回路截止时间至关重要。

四、评估

我们在Xilinx Kintex-7 FPGA上以250 MHz实现WS-RPE。评估使用来自LASA数据集18×864×64 矩阵。采用两个数据集:不同维度的时序序列,以及按密度分组的矩阵(25%−100%)。

不同矩阵维度下的归一化延迟如图3(a)所示。WS-RPE在所有规模下均实现最低延迟。在 64×64 时,相比先前FPGA幂迭代4实现6.24倍加速,相比CPU实现9倍加速。并行Jacobi方法在较大规模下因通信开销扩展不佳,而T4 GPU性能受限于内核启动开销。图3(b)显示WS-RPE延迟随密度从25%到100%增加而增加。优势在低密度(25%)时最为显著,分块分区策略有效减少了冗余计算并降低了延迟;在100%密度时,WS-RPE仍与其他FPGA加速器保持竞争力。

资源利用率显示,相比静态幂迭代基线4,平均LUT增加40.4%,主要来自调度逻辑、队列和重排序缓冲。作为回报,WS-RPE实现6.24倍内核加速。工作窃取和队列逻辑仅占总功耗的13.5%,表明动态调度的能量开销极小。

五、结论

本文提出WS-RPE,一种动态分块调度架构,集成多尺寸块并行、硬件工作窃取和冗余PE激活,用于边缘特征值计算。在Kintex-7 FPGA上,WS-RPE实现6.24倍内核加速和2.8倍系统加速,而LUT开销仅为40.4%。

参考文献

1 S. M. Khansari-Zadeh and A. Billard, "Learning stable nonlinear dynamical systems with Gaussian mixture models," IEEE Trans. Robot., vol. 27, no. 5, pp. 943-957, Oct. 2011.

2 Z. Shi, Q. He, and Y. Liu, "Accelerating parallel Jacobi method for matrix eigenvalue computation in DOA estimation algorithm," IEEE Trans. Veh. Technol., vol. 69, no. 6, pp. 6275-6285, Jun. 2020.

3 A. Burger, P. Urban, J. Boubin, and G. Schiele, "An architecture for solving the eigenvalue problem on embedded FPGAs," in Proc. ARCS 2020, Cham, Switzerland: Springer, 2020, vol. 12155, pp. 28-40.

4 Zhang, M. Jin, and M. Zhang, "FPGA implementation for solving the largest eigenvalue and its corresponding eigenvector," Sci. Technol. Eng., vol. 12, no. 14, pp. 3500-3502+3519, 2012.

5 D. Yan, W. Wang, and X. Zhang, "High-performance matrix eigenvalue decomposition using the parallel Jacobi algorithm on FPGA," Circuits Syst. Signal Process., vol. 42, pp. 1573-1592, 2023.

相关推荐
起个名字好难啊这也被占用了43 分钟前
LangGraphjs可中断可恢复的AI工作流
人工智能·ai编程
@Mr_LiuYang1 小时前
状态栏动态上下文信息追加到Agent --《深入理解 AI Agent :设计原理与工程实践》实验2-8
人工智能·大模型·动态上下文·状态栏信息追加
碳基猿1 小时前
新媒体运营的终局:从“内容创作”走向“运营系统竞争”
人工智能·新媒体运营·产品运营·新媒体矩阵·多账号管理·矩阵分发·矩阵运营方法论
阿里云大数据AI技术1 小时前
阿里云 EMR Daft AI Function:用 DataFrame 表达式搞定大模型调用与多模态向量化
人工智能·spark
jerryinwuhan1 小时前
鱼苗投放检测系统设计
人工智能
阿里云大数据AI技术2 小时前
官宣|Apache Fluss 毕业成为顶级项目,湖流一体开启 Agentic Lake 全面实时化时代
人工智能·flink
敲代码的玉米C2 小时前
测试一直在写你的真实数据根
前端·人工智能·架构
烟漠河洛2 小时前
拆解跨平台统一发货架构及亚马逊MCF降本三成技术落地
架构
Mr.huang2 小时前
自注意力机制(Self‑Attention)
人工智能·深度学习