Projekt
LexMemoryBench: Langzeitgedaechtnis im Haushalt
Eine Synthetic-Data-Pipeline zur Evaluation von member- und session-uebergreifendem Memory fuer Haushaltsroboter.
Python · Typed Schemas · Prompt Engineering · Synthetic Data QA
Product Snapshot
- Role
- Evaluation-Pipeline Engineering / Teamprojekt
- Users
- Teams fuer Long-term Memory, Haushaltsrobotik und Multi-user Agents.
- Stage
- Die Kernpipeline laeuft; vollstaendiger Benchmark-Haystack und skalierte Evaluation sind noch in Arbeit.
- Focus
- Eine nachvollziehbare Kette aus Personas, QA, Evidenz, Evidenz-Sessions und Filler-Sessions.
- Validation
- Eine fuenfstufige typed Pipeline haelt Familienmitglieder, Memory-Fakten und Dialoge unterscheidbar und auditierbar.
- Public Proof
- 15 zuordenbare Repository-Commits, Pipeline-Dokumentation und Stufenartefakte; das aktuelle Bundle ist kein finales Benchmark-Ergebnis.
Next Step
Mehr als das Gedaechtnis fuer eine Person
Ein Haushaltsroboter spricht getrennt mit mehreren Familienmitgliedern. Eine Aussage ist nur dann nuetzlich, wenn Sprecher, Zeitpunkt und stuetzende Evidenz korrekt gebunden bleiben.
LexMemoryBench untersucht member- und session-uebergreifendes Memory. Retrieval allein reicht nicht; Attribution und Evidenz muessen ebenfalls stimmen.
Die Pipeline
Die aktuelle Kette erzeugt Haushalts-Personas, constrained QA, minimale Evidenz, natuerliche Evidenz-Dialoge und Filler-Dialoge ohne Answer Leakage.
Typed Schemas, rohe Model Envelopes und Qualitaetspruefungen bleiben zwischen den Stufen erhalten. Fehler lassen sich dadurch auf Persona, Evidenz oder Dialoggenerierung zurueckfuehren.
Meine Rolle
Das ist ein Teamprojekt. Mein Beitrag liegt in Engineering, Schema-Constraints, Prompt-Disziplin und Dokumentation der Synthetic-Data-Pipeline. 15 Repository-Commits sind mir zuordenbar; ich beanspruche nicht den gesamten Benchmark.
Aktuelle Grenze
Die Kernpipeline laeuft und erzeugt Stufenartefakte. Ein vollstaendiger LongMemEval-artiger Haystack, skalierte Runs und finale Vergleiche fehlen noch. Deshalb zeigt diese Seite Systemassets, kein Model Ranking.
Warum das wichtig ist
Der gefaehrlichste Fehler eines Multi-user Memory ist oft nicht Vergessen, sondern die Information einer Person an eine andere weiterzugeben. Das Projekt verbindet Privacy, Evidenz-Attribution und Evaluation.
Konfiguriere die oeffentlichen Giscus-Umgebungsvariablen, dann erscheint hier der Diskussionsbereich.