CUDA SGEMM 并行优化 cuda · gpu · performance · systems 从朴素矩阵乘法出发,用共享内存分块优化 SGEMM,并通过多尺寸基准测试分析吞吐、冲突和异常点。 报告记录 512×512 测试达到 999.51 GFLOPS,相对 baseline 提升 85.5%。 cuda gpu performance systems