本文被 ASAP'26 录用
摘要------边缘物理AI控制器中的实时稳定性监测需要对动态演化的系统矩阵进行超低延迟的主特征值计算。现有加速器在处理小型稀疏控制系统矩阵时存在PE利用率不足和调度灵活性差的问题。本文提出WS-RPE,一种动态分块调度架构,集成多尺寸子块并行、跨队列工作窃取和按需冗余PE激活。在Xilinx Kintex-7 FPGA上以250 MHz实现,WS-RPE相比现有幂迭代加速器获得6.24倍内核加速,将PE空闲时间降至3.15%,系统级加速达2.8倍,而LUT开销仅为40.4%。
一、引言
敏捷物理AI系统(如无人机和仿人机器人)中的实时稳定性监测,要求对动态演化的系统矩阵进行超低延迟的主特征值计算。对于线性化系统 x˙=A(t)xx˙=A(t)x,稳定性由谱半径决定,即最大特征值模。稳定性监测仅需此主特征值而非完整特征分解。然而,计算它仍是控制回路中的主要瓶颈。
在特征值算法中,幂迭代具有最低的每迭代复杂度 O(N2)O(N2),且在良态系统中10-30次迭代即可收敛。但对ARM的剖析显示,对于8×8 到64×64 的矩阵,它仍消耗超过33%的控制回路时间。GPU因高功耗开销而不适合边缘部署,这使得FPGA加速器势在必行。
现有FPGA加速器面向密集GEMM优化,由于刚性并行性、朴素调度和数据感知能力差,在稀疏控制矩阵上表现不佳。我们提出WS-RPE,一种动态分块调度架构,集成多尺寸块并行、跨队列工作窃取和按需冗余PE激活。
二、数学背景
控制系统矩阵 A(t) 由于相邻状态间的局部耦合而呈现结构化稀疏和对角占优特性。我们采用幂迭代通过反复的矩阵-向量乘法 计算主特征值,其中
。由于每次迭代本质上是矩阵-向量乘积,计算可分解为对角块上的独立子操作,非零元集中于此。这种分块级并行性实现了流水线间的细粒度任务分发,并作为我们调度架构的基础。

图1. WS-RPE整体计算流程与块分解
三、WS-RPE架构
整体数据流如图1所示。N×N 矩阵首先被划分为不同大小的对角子块(从 2×2 到 N×N ,步长为2)。这些块随后入队到 N/2个并行队列中,每个队列供给一条专用流水线。调度器动态地将任务分派给PE,空闲流水线从过载队列窃取工作。最后,所有流水线的部分结果被合并和重排序,产生用于下一次幂迭代的更新向量。

图2. WS-RPE微架构执行流水线
步骤①------向量初始化与块划分:迭代向量使用基向量初始化,以最大化到主特征向量的投影,减少迭代次数。随后根据矩阵的稀疏模式将其划分为对角子块;Block_Partition数组存储每个块的大小以供队列派发使用。
步骤②------带工作窃取的动态分块调度:子块与向量段一起打包成数据包,派发到 N/2N/2 个队列。硬件调度器持续监控队列深度。当某队列变空时,它从负载最重的队列中窃取最大的可用任务。被窃取的任务进行零填充以匹配目标块大小,数据包头部中的Stealing Flag确保结果返回到正确的源队列。
步骤③------PE执行与混合精度归约:每个 2×12×1 PE对其分配的子块执行矩阵-向量乘法。为平衡精度与效率,WS-RPE采用混合精度策略:乘法使用FP16以减少带宽和存储,累加使用FP32以在迭代间保持数值精度。若窃取不足以解决拥塞,则从全局池中按需激活冗余PE,为停滞的流水线创建辅助计算路径。
步骤④------结果重排序:重排序缓冲(ROB)异步跟踪子块完成状态,确保结果按序输出,并在检测到连续完成序列时批量输出结果。动态调整单元(DAU)跟踪近期迭代次数并通过指数衰减调整收敛阈值,在时间相关负载下减少8-12%的不必要迭代。
所有调度、窃取和重排序逻辑均在硬件中实现,消除了软件级内核启动和同步开销------这对满足亚毫秒级控制回路截止时间至关重要。
四、评估
我们在Xilinx Kintex-7 FPGA上以250 MHz实现WS-RPE。评估使用来自LASA数据集1的 8×8 到 64×64 矩阵。采用两个数据集:不同维度的时序序列,以及按密度分组的矩阵(25%−100%)。

不同矩阵维度下的归一化延迟如图3(a)所示。WS-RPE在所有规模下均实现最低延迟。在 64×64 时,相比先前FPGA幂迭代4实现6.24倍加速,相比CPU实现9倍加速。并行Jacobi方法在较大规模下因通信开销扩展不佳,而T4 GPU性能受限于内核启动开销。图3(b)显示WS-RPE延迟随密度从25%到100%增加而增加。优势在低密度(25%)时最为显著,分块分区策略有效减少了冗余计算并降低了延迟;在100%密度时,WS-RPE仍与其他FPGA加速器保持竞争力。
资源利用率显示,相比静态幂迭代基线4,平均LUT增加40.4%,主要来自调度逻辑、队列和重排序缓冲。作为回报,WS-RPE实现6.24倍内核加速。工作窃取和队列逻辑仅占总功耗的13.5%,表明动态调度的能量开销极小。
五、结论
本文提出WS-RPE,一种动态分块调度架构,集成多尺寸块并行、硬件工作窃取和冗余PE激活,用于边缘特征值计算。在Kintex-7 FPGA上,WS-RPE实现6.24倍内核加速和2.8倍系统加速,而LUT开销仅为40.4%。
参考文献
1 S. M. Khansari-Zadeh and A. Billard, "Learning stable nonlinear dynamical systems with Gaussian mixture models," IEEE Trans. Robot., vol. 27, no. 5, pp. 943-957, Oct. 2011.
2 Z. Shi, Q. He, and Y. Liu, "Accelerating parallel Jacobi method for matrix eigenvalue computation in DOA estimation algorithm," IEEE Trans. Veh. Technol., vol. 69, no. 6, pp. 6275-6285, Jun. 2020.
3 A. Burger, P. Urban, J. Boubin, and G. Schiele, "An architecture for solving the eigenvalue problem on embedded FPGAs," in Proc. ARCS 2020, Cham, Switzerland: Springer, 2020, vol. 12155, pp. 28-40.
4 Zhang, M. Jin, and M. Zhang, "FPGA implementation for solving the largest eigenvalue and its corresponding eigenvector," Sci. Technol. Eng., vol. 12, no. 14, pp. 3500-3502+3519, 2012.
5 D. Yan, W. Wang, and X. Zhang, "High-performance matrix eigenvalue decomposition using the parallel Jacobi algorithm on FPGA," Circuits Syst. Signal Process., vol. 42, pp. 1573-1592, 2023.