← Projects

Projekt

LexMemoryBench: Langzeitgedaechtnis im Haushalt

Eine Synthetic-Data-Pipeline zur Evaluation von member- und session-uebergreifendem Memory fuer Haushaltsroboter.

Python · Typed Schemas · Prompt Engineering · Synthetic Data QA

Product Snapshot

Role
Evaluation-Pipeline Engineering / Teamprojekt
Users
Teams fuer Long-term Memory, Haushaltsrobotik und Multi-user Agents.
Stage
Die Kernpipeline laeuft; vollstaendiger Benchmark-Haystack und skalierte Evaluation sind noch in Arbeit.
Focus
Eine nachvollziehbare Kette aus Personas, QA, Evidenz, Evidenz-Sessions und Filler-Sessions.
Validation
Eine fuenfstufige typed Pipeline haelt Familienmitglieder, Memory-Fakten und Dialoge unterscheidbar und auditierbar.
Public Proof
15 zuordenbare Repository-Commits, Pipeline-Dokumentation und Stufenartefakte; das aktuelle Bundle ist kein finales Benchmark-Ergebnis.

Next Step

Portfolio PDF About the Founder Email

Mehr als das Gedaechtnis fuer eine Person

Ein Haushaltsroboter spricht getrennt mit mehreren Familienmitgliedern. Eine Aussage ist nur dann nuetzlich, wenn Sprecher, Zeitpunkt und stuetzende Evidenz korrekt gebunden bleiben.

LexMemoryBench untersucht member- und session-uebergreifendes Memory. Retrieval allein reicht nicht; Attribution und Evidenz muessen ebenfalls stimmen.

Die Pipeline

Die aktuelle Kette erzeugt Haushalts-Personas, constrained QA, minimale Evidenz, natuerliche Evidenz-Dialoge und Filler-Dialoge ohne Answer Leakage.

Typed Schemas, rohe Model Envelopes und Qualitaetspruefungen bleiben zwischen den Stufen erhalten. Fehler lassen sich dadurch auf Persona, Evidenz oder Dialoggenerierung zurueckfuehren.

Meine Rolle

Das ist ein Teamprojekt. Mein Beitrag liegt in Engineering, Schema-Constraints, Prompt-Disziplin und Dokumentation der Synthetic-Data-Pipeline. 15 Repository-Commits sind mir zuordenbar; ich beanspruche nicht den gesamten Benchmark.

Aktuelle Grenze

Die Kernpipeline laeuft und erzeugt Stufenartefakte. Ein vollstaendiger LongMemEval-artiger Haystack, skalierte Runs und finale Vergleiche fehlen noch. Deshalb zeigt diese Seite Systemassets, kein Model Ranking.

Warum das wichtig ist

Der gefaehrlichste Fehler eines Multi-user Memory ist oft nicht Vergessen, sondern die Information einer Person an eine andere weiterzugeben. Das Projekt verbindet Privacy, Evidenz-Attribution und Evaluation.


Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.