← Projects

Projekt

Advanced Distributed Data Systems Lab

Ein reproduzierbares Engineering-Portfolio ueber Hadoop, HBase, Spark, Streaming und Classification.

Hadoop · Spark · HBase · Spark Streaming · Python · Java

Product Snapshot

Role
Unabhaengige Coursework-Engineering
Stage
Code und Reports abgeschlossen; Metriken gelten nur fuer die dokumentierten Kursumgebungen.
Focus
Distributed Computing, Inverted Index, Stream Processing, HBase Versions, Performance Tuning und Behavior Prediction.
Validation
Drei-node Hadoop, Spark Search und Aggregation, HBase APIs, Social Streaming und Classification Tuning abgeschlossen.
Public Proof
Signierte Lab-Reports, Code, Run-Captures und Metriken; das Prediction Lab nutzte explizit schema-kompatible Synthetic Data.

Next Step

Portfolio PDF About the Founder Email

Warum ein gemeinsames Projekt

Die Labs bilden einen Weg von Offline Batch Processing zu Streams, Storage APIs und Model Tuning. Deshalb sind sie als ein nachvollziehbares Engineering-Portfolio zusammengefasst.

Batch und Retrieval

In einer Drei-node-Hadoop-Umgebung verarbeitete ich rund 629 Millionen Bytes: 5.022.247 Zeilen, 80.358.163 Tokens und 75.335.916 Transitions. Eine weitere MapReduce-Analyse umfasste 37.449.160 Requests.

Die Spark-Arbeit enthielt Aggregation ueber 12,6 Millionen Orders und eine THUCNews-Suchmaschine mit TF-IDF und Inverted Index.

Storage und Streaming

HBase-Labs behandelten Shell, Java API, Historical Versions und Versionsberechnungen. Spark Streaming verarbeitete 120.000 von 422.314 Social Posts mit 10.000 Records pro Sekunde, 30-Sekunden-Window und 10-Sekunden-Slide ueber 1.752 Tag-Typen.

Model und Tuning

Ein Behavior-Prediction-Lab nutzte 120.000 Training- und 100.000 Stream-Records und erzielte AUC 0,7156. Tuning reduzierte Driver-Zeit von 431 ms auf 202 ms bei gleicher Accuracy.

Da der Originaldatensatz fehlte, nutzte das Experiment schema-kompatible Synthetic Data. Diese Grenze gehoert zum Ergebnis.

Erkenntnis

Data Cutoff, Execution Environment, Metric Definition und Provenance sind Bestandteile eines Engineering-Resultats, keine Fussnoten.


Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.