← Projects

Projekt

CUDA SGEMM Optimierung

Von naiver Matrixmultiplikation zu Shared-Memory-Tiling, ueber mehrere Groessen benchmarked und auf Konflikte sowie Anomalien geprueft.

CUDA C++ · SGEMM · GPU Optimization · Benchmarking

Product Snapshot

Role
Parallelimplementierung und Benchmarking
Users
Systementwickler, die GPU-Speicherhierarchie und Kerneloptimierung lernen.
Stage
Baseline, Shared-Memory-Tiling, Tests von 256 bis 2048 und Bericht wurden 2025.12-2026.01 abgeschlossen.
Focus
CUDA-Speicherzugriff, Tiling, Durchsatz, Bank Conflicts und Anomalien.
Validation
Der Bericht dokumentiert 999,51 GFLOPS bei 512x512 und 85,5% Verbesserung gegenueber der Projekt-Baseline.
Public Proof
CUDA-C++-Implementierung, Benchmarkdaten ueber mehrere Groessen und Performancebericht.

Next Step

Portfolio PDF About the Founder Email

Problem

Matrixmultiplikation zeigt GPU-Performance gut: Die Arithmetik ist einfach, aber Threadorganisation, Speicherzugriff und Wiederverwendung bestimmen den Durchsatz.

Umsetzung

Ich implementierte eine naive CUDA-Baseline, ergaenzte Shared-Memory-Tiling und testete Groessen von 256 bis 2048. Die Analyse verglich GFLOPS sowie Bank Conflicts, Groesseneffekte und Ausreisser.

Ergebnis

Der Bericht dokumentiert 999,51 GFLOPS fuer 512x512, 85,5% ueber der Projekt-Baseline. Das Ergebnis gilt fuer die dokumentierte Hardware und Testbedingung und wird nicht ueber Geraete hinweg verallgemeinert.

Weiterlesen

Gehe mit dieser kuratierten Lesespur weiter.


Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.