CUDA SGEMM Optimization
A progression from naive matrix multiplication to shared-memory tiled SGEMM, benchmarked across sizes with conflict and anomaly analysis.
The project report records 999.51 GFLOPS at 512×512, an 85.5% improvement over its baseline.