Post
为什么 Agent 评测不能只看“看起来很厉害”
当 Agent 真正开始执行任务,评测就不能停留在“看起来不错”,它必须回答可靠性、覆盖度和稳定性。
现在很多 agent 展示里,最常见的结论是:
“它看起来已经能用了。”
我对这句话越来越警惕。
“看起来能用”为什么不够
因为一个 agent 一旦从 demo 走向真实任务,用户真正需要知道的是:
- 它成功的概率到底是多少
- 这个概率在不同任务上是否稳定
- 评测结果是不是被裁判偏好放大了
- 测试集是不是只挑了它擅长的样本
如果这些问题没有被回答,那么所谓的高分,很可能只是被漂亮展示包装过的错觉。
我最在意的,不是排行榜
我更在意 benchmark 有没有诚实地承认不确定性。
这也是为什么我会引入这些视角:
- 有限样本下的统计区间
- judge 一致性,而不是默认裁判天然可靠
- coverage 是否贴近真实世界任务分布
- 多次运行的稳定性,而不是单次成功
很多 benchmark 的问题,不是“不专业”,而是太着急给出一个单一、整齐、可传播的数字。
但真实系统往往没这么整齐。
Coverage 是最容易被忽略的部分
我特别在意的一点是,coverage 不该默认追求“均匀”。
如果真实世界里,某些任务比另一些任务出现得频繁得多,那么一个 benchmark 如果强行平均分配权重,只是在制造一种表面公平。
它看起来中立,实际上会把系统真正重要的表现冲淡。
评测是一种价值表达
这也是我从传播研究里带来的直觉:
指标从来不是中性的。
你测什么、不测什么,怎么采样、怎么加权,最后都会塑造我们对一个系统的理解。评测不是后处理,它本身就是系统设计的一部分。
我想做的 benchmark
我希望最后做出来的,不是一套“适合发社交媒体”的排行榜,而是一套适合拿来做判断的评测结构。
它应该能帮助人回答这些问题:
- 这个 agent 是否值得进入真实流程
- 它在哪些任务上已经可靠
- 哪些地方的能力还只是偶然成功
- 接下来该优先改进什么
如果 benchmark 不能帮助我们更清醒地做这些判断,那它再漂亮,也只是另一种界面幻觉。
配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。