← Projects

Project

LexMemoryBench:家庭长期记忆评测

为多成员家庭机器人设计长期记忆合成数据流水线,重点评测跨成员、跨会话的信息归属与召回。

Python · Typed Schemas · Prompt Engineering · Synthetic Data QA

Product Snapshot

Role
评测流水线工程 / 团队项目
Users
研究长期记忆、家庭机器人与多用户 Agent 的团队。
Stage
核心合成数据流水线已可运行;完整 benchmark haystack 与规模化运行验证仍在推进。
Focus
Persona、QA、证据、证据会话与 filler 会话之间的可追踪生成链。
Validation
落地五段式 typed pipeline,让同一家庭中的不同成员拥有可区分、可审计的记忆事实与自然会话。
Public Proof
仓库中可核验 15 次个人提交、流水线文档与阶段产物;当前临时提交包不是最终 benchmark 结果。

Next Step

Portfolio PDF About the Founder Email

问题不是“记住一个用户”

家庭机器人会分别和多位家庭成员交互。同一句“我不喜欢香菜”,只有在事实、说话者、时间和证据都被正确绑定时,后续记忆才可靠。

LexMemoryBench 把评测重点放在跨成员、跨会话的长期记忆上:系统不仅要召回信息,还要知道信息属于谁、来自哪次对话,以及是否有足够证据支持。

我参与搭建的流水线

当前生成链由五个可追踪阶段组成:

  • 生成家庭与成员 Persona
  • 生成带意图和答案约束的 QA
  • 为答案绑定最小证据
  • 把证据编排成自然会话
  • 生成不泄露答案的 filler 会话

各阶段保留 typed schema、原始模型 envelope 和质量检查结果,便于定位到底是 Persona、证据还是会话生成出了问题。

我的角色

这是团队项目。我主要参与 benchmark 合成数据流水线的工程化、结构约束、Prompt 纪律和文档整理;仓库历史中可核验 15 次个人提交。我不把整个 benchmark 或其他成员的研究工作归为个人成果。

当前边界

核心流水线已经可运行,并产生了阶段性提交包;但完整 LongMemEval 风格 haystack、规模化运行与最终对比结果尚未完成。因此这里展示的是可复核的系统资产,而不是尚不存在的模型排名。

为什么它重要

长期记忆系统最危险的错误往往不是“忘了”,而是把 A 的事实错误地说给 B。这个项目让我把隐私、证据归属与评测可解释性放进同一条数据生成链。


配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。