大模型的排名是怎么来的?看看背后的规则和坑

如果你经常刷到AI新闻,大概见过不少大模型排行榜——比如Chatbot Arena、MMLU、HumanEval、GSM8K这些词。同一款模型,在A榜上排第三,到B榜上却掉到第十,甚至有些榜单上它压根没出现。这让人忍不住想:这些排名到底是怎么算出来的?背后有没有什么“潜规则”?
其实吧,大模型的排名跟学校里的考试排名有点像,但又不完全一样。考试有统一的试卷、标准的评分标准,而大模型排名要复杂得多——因为“考什么”“怎么打分”“谁出题”这些环节,每家的做法都不一样。
排名的基础——基准测试
几乎所有大模型排名都依赖一个东西:基准测试(benchmark)。你可以把它理解成一套固定的考题。比如MMLU(大规模多任务语言理解)就像一份包含57个科目的选择题试卷,从法律到医学,从物理到历史,每道题有四个选项,模型选对一个得一分。另一个常见的HumanEval是编程题,让模型写函数,然后看它能不能通过预设的单元测试。
这些基准测试的考题通常由研究者精心设计,确保覆盖模型可能遇到的各种场景。考题数量从几百道到几万道不等。模型做完后,得到一个分数,比如MMLU得分78.5%,然后各家模型按分数高低排成一条龙。
但你可能会想:同样的MMLU,不同榜单给出的分数怎么不一样?问题就出在——各家用的“考卷”版本可能不同。有的用原始的全套题目,有的只抽了其中一部分,有的加了一些新题。这就好比两个班级都考数学,但一个班的试卷有50道题,另一个班只有30道,最后的平均分自然没法直接比。
评测方式的区别:自动还是人工?
除了考卷不同,评分方式也大相径庭。像MMLU、HumanEval这类有明确答案的题目,可以用程序自动打分——模型输出跟正确答案一比对,搞定。这种自动评测速度快、成本低,但也容易钻空子。比如模型可能输出了一堆废话,但最后一句恰好包含正确答案,程序可能就判对了。
更麻烦的是那些没有标准答案的任务,比如翻译、写摘要、讲故事。这时候就得靠人工来打分。Chatbot Arena就是典型例子:它让用户同时看到两个模型的回答(匿名),然后投票选出一个更好的。你可能会觉得“主观打分不靠谱”,但实际上,当投票人数足够多时,结果能较好地反映大众偏好。不过这里面也有偏差——参与投票的人大多是AI爱好者或从业者,他们的喜好不代表普通用户。
还有一种折中方案:用更强的模型来打分。比如让GPT-4去评估其他模型的回答,给它一份评分标准(相关性、流畅度、准确性等)。这种方法省人工,但会引入新问题——评估模型本身可能有偏见,比如“长得像自己的回答就高分”。
数据污染:最头疼的问题

大模型排名里一个绕不开的“坑”是数据污染。简单说,就是模型在训练时可能已经见过考题。因为很多基准测试的题目是开源公开的,模型训练数据里可能包含了这些题或它们的变体。这样一来,模型就不是在解答新问题,而是在“回忆”答案——类似于期末考试前老师提前发了答案。
举个真实的例子:2023年有研究发现,某些大模型在GSM8K(小学数学题)上的得分异常高,但仔细检查发现,模型回答里直接出现了训练数据中的解题步骤,甚至把题目中的数字都记混了。后来研究者重新设计了不公开的变体版本,结果那些模型得分暴跌。
为了避免数据污染,现在很多排名机构会使用“封存”的测试集——题目不公开,只在线评测。还有些榜单会定期更新考题,或者用动态生成的方式(比如让AI出题)。但道高一尺魔高一丈,总有办法能绕过这些措施,比如通过多个公开渠道拼凑出题目。
排名本身的不确定性
即便考卷和评分方式都固定,排名结果也有波动。大模型在生成回答时含有随机性——同一个问题问两次,得到的答案可能不一样。有些模型还用了采样策略(比如温度参数高),让回答更多样,但也更不可控。如果你让同一个模型跑五次MMLU,得到的五个分数可能相差0.5%到1%,而排名上零点几的差距就能让模型掉好几个位次。
另外,很多榜单只给出了平均分,没有统计误差条。比如模型A得分82.3%,模型B得分82.1%,看似A赢了,但如果你做显著性检验,很可能发现这个差距只是随机波动造成的。换句话说,两个模型的实际水平可能没有区别。
还有个容易被忽视的点:评测时的环境配置。比如模型是用完整版还是量化版?上下文窗口设多少?解码时的最大生成长度是多少?这些细节都会影响最终得分,但排名报告里往往不会写得太细。
怎么看待这些排名?
了解这些规则之后,再看排行榜就不会那么焦虑了。排名有参考价值,但别把它当成绝对真理。一个模型在MMLU上排第一,不等于它在实际对话中更好用——毕竟日常问题很少是四选一的选择题。反过来,模型在某个榜单上表现一般,也未必意味着它不行,可能只是那个榜单的题目跟它的强项不匹配。
比较合理的做法是:看多个维度的评测,比如语言理解、数学推理、代码生成、伦理安全,每个维度挑几个公认的基准。同时留意评测的时间和数据版本,别拿半年前的模型跟刚出的新模型比。另外,如果条件允许,自己动手跑一下小样本测试,感受会更直观。
说到底,大模型排名反映的只是“在特定条件下完成特定任务”的能力。而真正的智能,大概比任何一张榜单都复杂得多。

