Projekt
People's Daily auf Bilibili: Titel und semantische Verschiebung
Eine Studie mit 2.465 Videos und 13 Feldern zu Titelsemantik, Tags und Engagement, die schwache Modellguete offen ausweist.
Python · Web Scraping · Sentence-Transformers · scikit-learn · Communication Research
Product Snapshot
- Role
- Independent researcher
- Focus
- Drei Iterationen aus Scraping, Titel-Engagement-Analyse, semantischer Aehnlichkeit und Tag-Features.
- Validation
- Der finale Datensatz 2021.06-2023.12 enthaelt 2.465 Videos und 13 Felder; mittlere Aehnlichkeit rund 0,408, Random-Forest-Test-R² 0,028.
- Public Proof
- Notebook, finaler Datensatz und 50 zufaellige Audit-Samples; das niedrige R² bleibt sichtbar.
Next Step
Projektstart
Dieses unabhaengige Kommunikationsforschungsprojekt entwickelte sich in drei Iterationen. Untersucht wurden Titel, Semantik, Tags und Engagement bei People’s-Daily-Videos auf Bilibili.
Daten und Methode
Der finale Datensatz umfasst 2021.06-2023.12 mit 2.465 Videos und 13 Feldern sowie ein manuelles Audit von 50 Zufallssamples. Die Pipeline kombinierte jieba, Sentence-Transformers, Cosine Similarity, One-Hot-Tags, Pearson-Analyse und einen explorativen Random Forest.
Ergebnis
Die mittlere semantische Aehnlichkeit lag bei rund 0,408; Politik- und News-Tags zeigten mehr Drift. Das Random-Forest-Test-R² lag nur bei 0,028.
Die schwache Modellguete ist eine wichtige Grenze: Die vorhandenen Features erklaeren Engagement kaum; Zeitpunkt, Thema, Distribution und unbeobachteter Kontext koennen entscheidend sein.
Erkenntnis
Das Projekt praegte eine Gewohnheit, die bis zur Agent-Evaluation reicht: mit der Frage beginnen, Methoden der Erklaerung unterordnen und Unsicherheit statt einer bequemen Geschichte berichten.
Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.