CUDA编程实战06:矩阵乘法优化——从朴素 GEMM 到共享内存分块系列定位:从可以亲手运行的 CUDA 程序出发,逐步建立正确性、性能分析与工程优化能力。 本篇适合:已经理解 Grid、Block、Warp、合并访问、Shared Memory 与 __syncthreads(),想把这些知识组合成第一个计算密集型算子的读者。 本篇成果:3 个可直接构建的 CUDA 程序、6 张配图、朴素 GEMM、16×16 与 32×32 Shared Tiled GEMM、2×1 寄存器分块、任意 M/N/K 边界、FP64 CPU 参考、CUDA Event 基准、有效 TFL