← Projects

Projekt

People's Daily auf Bilibili: Titel und semantische Verschiebung

Eine Studie mit 2.465 Videos und 13 Feldern zu Titelsemantik, Tags und Engagement, die schwache Modellguete offen ausweist.

Python · Web Scraping · Sentence-Transformers · scikit-learn · Communication Research

Product Snapshot

Role
Independent researcher
Focus
Drei Iterationen aus Scraping, Titel-Engagement-Analyse, semantischer Aehnlichkeit und Tag-Features.
Validation
Der finale Datensatz 2021.06-2023.12 enthaelt 2.465 Videos und 13 Felder; mittlere Aehnlichkeit rund 0,408, Random-Forest-Test-R² 0,028.
Public Proof
Notebook, finaler Datensatz und 50 zufaellige Audit-Samples; das niedrige R² bleibt sichtbar.

Next Step

Portfolio PDF About the Founder Email

Projektstart

Dieses unabhaengige Kommunikationsforschungsprojekt entwickelte sich in drei Iterationen. Untersucht wurden Titel, Semantik, Tags und Engagement bei People’s-Daily-Videos auf Bilibili.

Daten und Methode

Der finale Datensatz umfasst 2021.06-2023.12 mit 2.465 Videos und 13 Feldern sowie ein manuelles Audit von 50 Zufallssamples. Die Pipeline kombinierte jieba, Sentence-Transformers, Cosine Similarity, One-Hot-Tags, Pearson-Analyse und einen explorativen Random Forest.

Ergebnis

Die mittlere semantische Aehnlichkeit lag bei rund 0,408; Politik- und News-Tags zeigten mehr Drift. Das Random-Forest-Test-R² lag nur bei 0,028.

Die schwache Modellguete ist eine wichtige Grenze: Die vorhandenen Features erklaeren Engagement kaum; Zeitpunkt, Thema, Distribution und unbeobachteter Kontext koennen entscheidend sein.

Erkenntnis

Das Projekt praegte eine Gewohnheit, die bis zur Agent-Evaluation reicht: mit der Frage beginnen, Methoden der Erklaerung unterordnen und Unsicherheit statt einer bequemen Geschichte berichten.

Weiterlesen

Gehe mit dieser kuratierten Lesespur weiter.


Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.