跳至主要内容

基础概念

如何阅读 AI 跑分而不被误导

跑分数字看起来很精确,这正是让人容易过度信任它的原因。像 MMLU 或 HumanEval 这样的分数究竟衡量的是什么、跑分数字常见的误导方式,以及在把某个分数当作对你的用例有意义之前应该检查什么。

全部文章 · 最近核实:

跑分是一次固定的测试,不是通用的能力衡量标准

MMLU(多项选择的通识知识)、HumanEval(简短的编程题)、GSM8K(小学水平的数学应用题)等知名跑分,每一个测的都是特定格式下一种狭窄、具体的技能。一个模型可能在某个跑分上得分很高,却在人类看来相似、但结构完全不同的任务上表现不佳——比如长篇编程相对于孤立的短函数,或者开放式写作相对于多项选择记忆。

跑分题目可能会泄露进训练数据

流行的跑分是公开的,它们的题目在网络、论文和论坛讨论中广泛流传——这恰恰正是大模型训练所用的那类文本。当一个模型实际上已经见过答案时,它的得分反映的是对那道具体测试题的记忆,而不是跑分本应代表的通用能力。这被称为数据污染,外部读者仅凭分数很难察觉。

公布的分数可能高度依赖于模型是如何被提问的

同一个模型,根据提示词格式、在真正问题之前展示了多少道已解答的示例、以及是否被允许在回答前逐步推理,得分可能会有很大不同。厂商在宽松条件下报告自己最好的结果,这不算撒谎,但那个数字未必和你用一句普通的日常提示词能得到的结果相像。

跑分会饱和——一旦大多数模型都能通过,它就不再有用了

一旦大多数领先模型在某个跑分上的得分都接近满分,这个跑分就不再能有意义地区分它们,即便那个较旧的数字仍然经常被引用。在一个已经饱和的跑分上接近满分,传达的信息比过去要少得多;更新、更难的跑分往往会取而代之,而依赖一个陈旧、饱和数字的营销对比值得再多留个心眼。

单一的平均分恰恰掩盖了模型真正吃力的地方

一个总体跑分是许多难度和类型各异的题目的平均值。一个模型可以在平均值上表现不错,同时在对你重要的某个具体子类别上并不可靠——某种特定类型的推理、某个特定领域、某种任务长度。平均值是一份摘要,而摘要恰恰会丢弃那些通常对真实决策最重要的细节。

把跑分当作起点,而不是最终结论

跑分最有用的地方在于作为一个粗略的初步筛选——排除明显不合适的模型,或者筛出几个值得进一步测试的候选者——而不是作为该用哪个模型的最终定论。参见如何评估 AI 模型,了解在你缩小候选范围之后,真正能预测适配度的是什么:在自己有代表性的任务上测试,这是任何已发布的跑分都无法替代的。

常见问题

MMLU 或 HumanEval 这样的跑分实际测试的是什么?
在特定格式下的一组固定、具体的题目——MMLU 是多项选择的通识知识,HumanEval 是简短的编程题。每一个都只衡量一种狭窄的技能,而不是通用智能或跨所有任务的能力。
为什么不同厂商公布的跑分数字有时看起来互相矛盾?
分数可能取决于提示词格式、在真正问题之前展示了多少示例,以及是否允许逐步推理。不同的报告条件会为同一个底层模型产生不同的数字。
什么是跑分数据污染?
当一个跑分公开的题目最终进入了模型的训练数据,导致模型在被测试之前实际上已经见过答案。由此得出的分数反映的是记忆,而不是跑分本应衡量的能力。
我应该完全忽略跑分数字吗?
不应该——它们是排除明显不合适的模型、或者构建候选名单的合理初步筛选工具。只是不要把最终数字当作定论;在做决定前,先在自己有代表性的任务上测试候选名单。

与其阅读,不如亲自试试

ClawAI 不发布自己的跑分排行榜,也不为任何模型声称专有的分数——相反,它的路由透明度面板会显示某个具体回答背后真实的成本等级、延迟等级和路由置信度,让你能对照自己的请求来判断一个回答,而不是对照一个你无法检查的公开测试集。