← Projects

Projekt

LLM-Bewertung des Werts von E-Commerce-Reviews

Ein Vergleich von LLM- und Menschenurteilen zu Authentizitaet, Informationswert und Relevanz mit klar ausgewiesenen Evaluationsgrenzen.

Python · DeepSeek · G-EVAL · Data Quality · Human Evaluation

Product Snapshot

Role
Datenanalyse und Evaluationsdesign
Users
Forschungs- und Commerce-Teams, die wertvolle Reviews oder Trainingsdatenqualitaet bewerten.
Stage
Rubrik, DeepSeek/G-EVAL-Scoring, Menschenvergleich und Fehleranalyse wurden 2025.02-2025.07 abgeschlossen.
Focus
Authentizitaet, Informationswert, Relevanz und Uebereinstimmung mit menschlichem Urteil.
Validation
Drei-Achsen-Vergleich mit MSE/MAE; Projektversionen nennen 2.559 Roh- und 1.589 verarbeitete Samples.
Public Proof
Datensaetze, Scoring-Skripte und Berichte; die Samplezahlen gehoeren zu unterschiedlichen Prozessstufen.

Next Step

Portfolio PDF About the Founder Email

Problem

Viele Reviews bedeuten nicht automatisch wertvolle Daten. Duplikate, falsche, irrelevante oder informationsarme Texte schwaechen Analyse und Training.

Methode

Ich teilte Qualitaet in Authentizitaet, Informationswert und Relevanz, nutzte DeepSeek und G-EVAL und verglich die Ergebnisse ueber MSE, MAE und konkrete Abweichungen mit Menschenurteilen.

Sampledefinition

Berichtsversionen nennen 2.559 Roh- und 1.589 verarbeitete Samples. Sie stammen aus verschiedenen Bereinigungsstufen und werden nicht als eine einheitliche Kohorte dargestellt.

Schluss

LLMs skalieren die Vorpruefung, benoetigen aber klare Rubriken, menschliche Anker und Fehleranalyse. Bei Grenzfaellen ist der Score ein Pruefsignal, keine endgueltige Wahrheit.

Weiterlesen

Gehe mit dieser kuratierten Lesespur weiter.


Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.