← Writing

Post

为什么 Agent 评测不能只看“看起来很厉害”

当 Agent 真正开始执行任务,评测就不能停留在“看起来不错”,它必须回答可靠性、覆盖度和稳定性。

现在很多 agent 展示里,最常见的结论是:

“它看起来已经能用了。”

我对这句话越来越警惕。

“看起来能用”为什么不够

因为一个 agent 一旦从 demo 走向真实任务,用户真正需要知道的是:

  • 它成功的概率到底是多少
  • 这个概率在不同任务上是否稳定
  • 评测结果是不是被裁判偏好放大了
  • 测试集是不是只挑了它擅长的样本

如果这些问题没有被回答,那么所谓的高分,很可能只是被漂亮展示包装过的错觉。

我最在意的,不是排行榜

我更在意 benchmark 有没有诚实地承认不确定性。

这也是为什么我会引入这些视角:

  • 有限样本下的统计区间
  • judge 一致性,而不是默认裁判天然可靠
  • coverage 是否贴近真实世界任务分布
  • 多次运行的稳定性,而不是单次成功

很多 benchmark 的问题,不是“不专业”,而是太着急给出一个单一、整齐、可传播的数字。

但真实系统往往没这么整齐。

Coverage 是最容易被忽略的部分

我特别在意的一点是,coverage 不该默认追求“均匀”。

如果真实世界里,某些任务比另一些任务出现得频繁得多,那么一个 benchmark 如果强行平均分配权重,只是在制造一种表面公平。

它看起来中立,实际上会把系统真正重要的表现冲淡。

评测是一种价值表达

这也是我从传播研究里带来的直觉:

指标从来不是中性的。

你测什么、不测什么,怎么采样、怎么加权,最后都会塑造我们对一个系统的理解。评测不是后处理,它本身就是系统设计的一部分。

我想做的 benchmark

我希望最后做出来的,不是一套“适合发社交媒体”的排行榜,而是一套适合拿来做判断的评测结构。

它应该能帮助人回答这些问题:

  • 这个 agent 是否值得进入真实流程
  • 它在哪些任务上已经可靠
  • 哪些地方的能力还只是偶然成功
  • 接下来该优先改进什么

如果 benchmark 不能帮助我们更清醒地做这些判断,那它再漂亮,也只是另一种界面幻觉。

继续阅读

按这条手工整理的阅读路径继续往下看。


配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。