CUDA SGEMM Optimierung
Von naiver Matrixmultiplikation zu Shared-Memory-Tiling, ueber mehrere Groessen benchmarked und auf Konflikte sowie Anomalien geprueft.
Der Bericht dokumentiert 999,51 GFLOPS bei 512x512 und 85,5% Verbesserung gegenueber der Projekt-Baseline.