Agent Evaluation Benchmark
为 openclaw 类个人助理设计一套带统计置信度的 Agent 评测框架,而不是只看“演示效果”。
建立 statistical confidence、judge agreement、coverage 与 cross-run stability 四支柱框架;另一条工作流新增并接入 40 个 RPA、IM、跨系统与邮件任务。
这个主题下的公开项目与文章会一起出现,方便从不同形式交叉阅读。
还没有带这个标签的公开文章。
还没有带这个标签的公开问答。