← Projects

Project

CUDA SGEMM 并行优化

从朴素矩阵乘法出发,用共享内存分块优化 SGEMM,并通过多尺寸基准测试分析吞吐、冲突和异常点。

CUDA C++ · SGEMM · GPU Optimization · Benchmarking

Product Snapshot

Role
并行计算实现与基准测试
Users
学习 GPU 内存层级与矩阵计算优化的系统开发者。
Stage
2025.12-2026.01 完成 baseline、shared-memory tiling、256-2048 尺寸测试和报告。
Focus
CUDA 内存访问、分块策略、吞吐测量、bank conflict 与异常分析。
Validation
报告记录 512×512 测试达到 999.51 GFLOPS,相对 baseline 提升 85.5%。
Public Proof
CUDA C++ 实现、不同矩阵尺寸的基准数据和性能分析报告。

Next Step

Portfolio PDF About the Founder Email

问题

矩阵乘法适合用来理解 GPU 性能,因为算术本身简单,真正的差异来自线程组织、内存访问和数据复用。

实现

我先实现朴素 CUDA baseline,再加入 shared-memory tiling,并在 256 到 2048 的矩阵尺寸上测试。分析不仅比较 GFLOPS,也检查 bank conflict、尺寸变化和异常结果。

结果

项目报告记录,在 512×512 测试中优化版本达到 999.51 GFLOPS,相对 baseline 提升 85.5%。这个数字对应项目所用硬件与测试条件,不被外推为跨设备通用性能。

我带走的经验

性能优化需要同时保存实现、测量环境和异常解释。一个漂亮的峰值只有在基准口径可追溯时才有意义。

继续阅读

按这条手工整理的阅读路径继续往下看。


配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。