一、FPU是什么?
FPU全称Float Point Unit(浮点运算单元),是一个独立的硬件协处理器,专门用于加速float类型(32位单精度浮点数)的加减乘除运算。
STM32F4系列基于Arm Cortex-M4内核,集成了单精度FPU(FPv4-SP),支持所有Arm单精度数据处理指令和数据类型。简单理解:没有FPU的单片机算浮点数,相当于用笔和纸一步步竖式计算;有FPU的单片机算浮点数,相当于按计算器------按一下结果就出来了。
二、没有FPU会怎样?
Cortex-M0和M3内核没有硬件FPU,处理float a = b * c;时,编译器会调用软件浮点库,用数十条甚至上百条整数指令来模拟一次浮点乘法。如果代码里有大量浮点运算------比如电机控制中的三角函数、音频处理中的FFT------CPU会被这些模拟运算拖垮。
STM32F4有了FPU之后,同样的float a = b * c;会被编译成一条VMUL.F32硬件指令,由FPU直接执行,速度提升可达5~20倍。
三、性能提升到底有多大?
根据ST官方应用笔记AN4044的数据,使用Julia集算法测试,硬件FPU相比软件浮点实现的性能对比如下:
| 缩放因子 | 硬件FPU耗时 | 软件浮点耗时 | 加速比 |
|---|---|---|---|
| 100 | 102 ms | 1291 ms | 12.7倍 |
| 350 | 171 ms | 2294 ms | 13.4倍 |
| 800 | 161 ms | 2150 ms | 13.4倍 |
| 1000 | 157 ms | 2101 ms | 13.4倍 |
在168MHz主频下做10万次float乘法,未启用FPU耗时约32ms,启用后仅需约6ms,性能提升5倍多。在FFT运算中,开启FPU后加速效果同样显著。
四、动手:开启F4的FPU
开启FPU需要两步:让编译器知道使用硬件浮点,同时让CPU真正打开FPU的"开关"。
步骤1:编译器设置
Keil MDK :打开Options for Target → Target标签 → Floating Point Hardware,选择 Single Precision。
STM32CubeIDE :右键项目 → Properties → C/C++ Build → Settings → MCU Settings,将Floating-point unit设为FPv4-SP-D16,Floating-point ABI设为Hardware implementation (-mfloat-abi=hard)。
步骤2:代码中启用FPU
FPU复位后默认是关闭的,需要在系统初始化时通过设置CPACR寄存器(协处理器访问控制寄存器)来打开:
c
#if (__FPU_PRESENT == 1) && (__FPU_USED == 1)
SCB->CPACR |= ((3UL << 10*2) | (3UL << 11*2)); // 开启CP10和CP11完全访问
#endif
这段代码通常放在system_stm32f4xx.c的SystemInit()函数中。__FPU_PRESENT和__FPU_USED这两个宏由编译器根据芯片型号和设置自动定义。
验证是否成功
进入Keil调试模式,查看地址0xE000ED88(CPACR寄存器)的值:如果为0x00F00000,说明FPU已开启。另一个简单方法:查看汇编代码中是否出现了V开头的指令(如VMUL.F32),如果有,就说明硬件浮点已生效。
五、FPU ≠ DSP库
一个常见误解是:开启了FPU,sin()、sqrt()等函数就会自动加速。 事实并非如此------标准数学库的函数可能没有针对FPU优化。要想充分发挥性能,需要使用ARM的CMSIS-DSP库,它提供了大量针对Cortex-M4优化的数学函数(FFT、FIR滤波器、矩阵运算等)。
两者的关系是:FPU是硬件,加速float基础运算;DSP库是软件库,利用FPU和SIMD指令加速特定算法。在CubeMX中通过Software Packs勾选DSP Library即可自动配置DSP库。
六、总结
| 对比项 | 无FPU(软件浮点) | 有FPU(硬件浮点) |
|---|---|---|
| 浮点乘法 | 数十条整数指令模拟 | 1条VMUL.F32指令 |
| 10万次乘法耗时 | ~32 ms | ~6 ms |
| Julia集算法 | 基准 | 快约13倍 |
| 适用场景 | 极少浮点运算 | 电机控制、音频处理、FFT |
一句话总结:STM32F4的FPU用硬件替代了软件模拟,让浮点运算从"拖后腿"变成了"加速器"。开启它只需要编译器和代码各一步,但一定要记得用DSP库才能真正释放它的全部潜力。