Projekt
Advanced Distributed Data Systems Lab
Ein reproduzierbares Engineering-Portfolio ueber Hadoop, HBase, Spark, Streaming und Classification.
Hadoop · Spark · HBase · Spark Streaming · Python · Java
Product Snapshot
- Role
- Unabhaengige Coursework-Engineering
- Stage
- Code und Reports abgeschlossen; Metriken gelten nur fuer die dokumentierten Kursumgebungen.
- Focus
- Distributed Computing, Inverted Index, Stream Processing, HBase Versions, Performance Tuning und Behavior Prediction.
- Validation
- Drei-node Hadoop, Spark Search und Aggregation, HBase APIs, Social Streaming und Classification Tuning abgeschlossen.
- Public Proof
- Signierte Lab-Reports, Code, Run-Captures und Metriken; das Prediction Lab nutzte explizit schema-kompatible Synthetic Data.
Next Step
Warum ein gemeinsames Projekt
Die Labs bilden einen Weg von Offline Batch Processing zu Streams, Storage APIs und Model Tuning. Deshalb sind sie als ein nachvollziehbares Engineering-Portfolio zusammengefasst.
Batch und Retrieval
In einer Drei-node-Hadoop-Umgebung verarbeitete ich rund 629 Millionen Bytes: 5.022.247 Zeilen, 80.358.163 Tokens und 75.335.916 Transitions. Eine weitere MapReduce-Analyse umfasste 37.449.160 Requests.
Die Spark-Arbeit enthielt Aggregation ueber 12,6 Millionen Orders und eine THUCNews-Suchmaschine mit TF-IDF und Inverted Index.
Storage und Streaming
HBase-Labs behandelten Shell, Java API, Historical Versions und Versionsberechnungen. Spark Streaming verarbeitete 120.000 von 422.314 Social Posts mit 10.000 Records pro Sekunde, 30-Sekunden-Window und 10-Sekunden-Slide ueber 1.752 Tag-Typen.
Model und Tuning
Ein Behavior-Prediction-Lab nutzte 120.000 Training- und 100.000 Stream-Records und erzielte AUC 0,7156. Tuning reduzierte Driver-Zeit von 431 ms auf 202 ms bei gleicher Accuracy.
Da der Originaldatensatz fehlte, nutzte das Experiment schema-kompatible Synthetic Data. Diese Grenze gehoert zum Ergebnis.
Erkenntnis
Data Cutoff, Execution Environment, Metric Definition und Provenance sind Bestandteile eines Engineering-Resultats, keine Fussnoten.
Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.