Projekt
LLM-Bewertung des Werts von E-Commerce-Reviews
Ein Vergleich von LLM- und Menschenurteilen zu Authentizitaet, Informationswert und Relevanz mit klar ausgewiesenen Evaluationsgrenzen.
Python · DeepSeek · G-EVAL · Data Quality · Human Evaluation
Product Snapshot
- Role
- Datenanalyse und Evaluationsdesign
- Users
- Forschungs- und Commerce-Teams, die wertvolle Reviews oder Trainingsdatenqualitaet bewerten.
- Stage
- Rubrik, DeepSeek/G-EVAL-Scoring, Menschenvergleich und Fehleranalyse wurden 2025.02-2025.07 abgeschlossen.
- Focus
- Authentizitaet, Informationswert, Relevanz und Uebereinstimmung mit menschlichem Urteil.
- Validation
- Drei-Achsen-Vergleich mit MSE/MAE; Projektversionen nennen 2.559 Roh- und 1.589 verarbeitete Samples.
- Public Proof
- Datensaetze, Scoring-Skripte und Berichte; die Samplezahlen gehoeren zu unterschiedlichen Prozessstufen.
Next Step
Problem
Viele Reviews bedeuten nicht automatisch wertvolle Daten. Duplikate, falsche, irrelevante oder informationsarme Texte schwaechen Analyse und Training.
Methode
Ich teilte Qualitaet in Authentizitaet, Informationswert und Relevanz, nutzte DeepSeek und G-EVAL und verglich die Ergebnisse ueber MSE, MAE und konkrete Abweichungen mit Menschenurteilen.
Sampledefinition
Berichtsversionen nennen 2.559 Roh- und 1.589 verarbeitete Samples. Sie stammen aus verschiedenen Bereinigungsstufen und werden nicht als eine einheitliche Kohorte dargestellt.
Schluss
LLMs skalieren die Vorpruefung, benoetigen aber klare Rubriken, menschliche Anker und Fehleranalyse. Bei Grenzfaellen ist der Score ein Pruefsignal, keine endgueltige Wahrheit.
Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.