LexMemoryBench:家庭长期记忆评测
为多成员家庭机器人设计长期记忆合成数据流水线,重点评测跨成员、跨会话的信息归属与召回。
落地五段式 typed pipeline,让同一家庭中的不同成员拥有可区分、可审计的记忆事实与自然会话。
这个主题下的公开项目与文章会一起出现,方便从不同形式交叉阅读。
LexMemoryBench:家庭长期记忆评测
为多成员家庭机器人设计长期记忆合成数据流水线,重点评测跨成员、跨会话的信息归属与召回。
落地五段式 typed pipeline,让同一家庭中的不同成员拥有可区分、可审计的记忆事实与自然会话。
无头浏览器 Benchmark 方法审计
以外部评测者身份复现浏览器引擎 benchmark,并检查统计口径、资源指标、并发覆盖与发布就绪度。
识别高方差、macOS 资源指标缺失、并发覆盖不足与横向比较缺失;9 项发布门槛中 8 项当时未满足。
Agent Evaluation Benchmark
为 openclaw 类个人助理设计一套带统计置信度的 Agent 评测框架,而不是只看“演示效果”。
建立 statistical confidence、judge agreement、coverage 与 cross-run stability 四支柱框架;另一条工作流新增并接入 40 个 RPA、IM、跨系统与邮件任务。
还没有带这个标签的公开问答。