Elea Notes.

词条 · AI ·

Benchmark

一套固定的任务集合,用来给不同模型打分排名——有用,但容易被误读和针对性优化。

也称:benchmark、基准测试、评测、榜单

一句话

同一套题,大家都来考,好比较。问题是:考得好不等于能力强,因为题目是公开且有限的。

读榜单时该问的几个问题

一个分数几乎从不能单独说明问题。至少要看清:

  • 谁测的——官方统一环境评测,还是提交方自己报告的?两者常常并列在同一张表里,含义差很远。
  • 允许什么——能不能调用额外工具、写代码、多次尝试取最好成绩?
  • 上限多少——给了多少步数或多少时间?
  • 题目多少——固定 300 题的 90%,和开放场景下的 90%,不是一回事。

固定题集的固有问题

题目一旦公开且固定,优化就会朝着题目的形状生长。这不必然是作弊——针对常见任务类型做专门处理是合理工程——但它意味着分数增长和真实能力增长之间会逐渐脱钩

更麻烦的是数据污染:如果测试题在训练数据里出现过,分数就完全失去意义。这是为什么严肃的评测会保留一部分从不公开的题目。