大模型排行榜越来越多,普通人到底该怎么看?

“某模型全球第一”的说法越来越常见,但换一个排行榜,名次常常完全不同。这篇文章梳理了 Benchmark 失真的三个常见原因——测试集污染、benchmaxxing、厂商选择性公布成绩,以及 Arena 类平台、综合指数各自的局限,最后给出一份普通人也能直接用的判断清单。

现在的大模型厂商越来越多,同一家厂商下面又有一堆不同的模型,几乎每天都有新模型发布。问题是,对普通人来说,模型本身越来越难看懂了。

厂商会告诉你,这个模型的数学成绩刷新了纪录,那个模型的代码能力超过了某某对手;社交媒体上又会迅速出现一轮“XX吊打XX”“新模型登顶”的讨论。等你真正想知道这个模型到底怎么样,往往已经不知道该看谁了:官方的战报能不能直接信?社交媒体上的实测靠谱吗?那些排行榜和 Benchmark,又到底意味着什么?

以前,遇到一个新模型,打开一个排行榜,看一眼排名,多少还能有个大概;但现在,已经不是打开一个排行榜这么简单了,因为你会发现,不同的榜单、不同的 Benchmark,测的根本不是同一件事。当一个新模型发布时,我们到底应该怎么看它的那些“漂亮成绩”?

别急着看分数,先问一句:这到底在测什么

看到“Model A:95 分,Model B:91 分”,人的第一反应通常是 A 比 B 强。但这里其实少了一条最关键的信息:A 和 B 到底是在什么测试里拿到这两个分数的?

如果测的是数学,严谨的结论只能是“A 在这套数学测试里表现更好”;要是换成代码测试,或者换成让真人盲测回答质量,结论可能完全相反。就像一个学生数学考了第一,并不代表他英语和体育也排第一。大模型能聊天、写代码、做数学推理、看图、搜索、操作电脑、调用工具——根本不存在某一个单一数字,能把所有这些能力全部打包压缩进去。

所以,下次再看到“某某模型全球第一”时,第一反应不用急着兴奋,也不必急着怀疑,而是先问一句:这个“第一”,到底比的是什么?

Benchmark 是什么,又是怎么失真的

Benchmark(基准测试)说白了就是一套固定题目加上评分标准:给模型一批题目,让它作答,再和标准答案比对算出得分。它的好处很直接——大家做同一套试卷,横向对比一目了然,这也是发布会上那张漂亮对比表格的由来。

但问题恰恰从这里开始,水分主要出在三个地方。

第一,模型有没有可能提前“见过”这些题? 很多经典基准(比如 MMLU)已经在公开领域使用了好几年,题目和标准答案早已散落在互联网的各个角落,模型在预训练或微调抓取网页时,难免顺理成章地把它们“读”了进去。这未必是厂商主观作弊,但客观结果是一样的:最终的高分不再能代表模型面对陌生问题时的推理水平——这就是业内常说的 Benchmark contamination(测试集污染)

这也解释了为什么一些老牌基准的分数看起来越来越“通胀”:MMLU 上,GPT-3 在最初的公开测试中只有 43.9%,到了今天已经逐渐失去区分度,公开成绩普遍集中在较高区间;GSM8K 的变化则更加明显,GPT-3 时代的成绩大约只有 35%,而到了今天,顶尖模型已经可以做到接近满分。

这当然不意味着模型没有真正变强。问题在于,一个公开、固定的测试集存在得越久,就越容易被模型训练数据覆盖,或者被针对性优化,最终逐渐失去区分不同模型的能力。

这也是为什么后来出现了 LiveBench 这样的基准:不断加入来自近期数学竞赛、论文、新闻等来源的新题,并持续更新测试内容,尽量降低测试集污染,让 Benchmark 能够继续区分不断进步的模型。

基准测试分数通胀与区分度失真示意图:从 GPT-3 时代的 MMLU 43.9%、GSM8K 35% 早期高区分度,到 GPT-4 时代的刷题潮,再到如今老牌基准普遍超 90%+ 甚至满分导致的区分度归零,倒逼行业推出 LiveBench 和 Humanity’s Last Exam 等新一代动态与前沿评测体系

第二,模型是不是越来越“会考试”,而不是真正变懂了? 当行业摸清了某个 Benchmark 的题型分布和评分规则,针对它做针对性优化就成了顺理成章的事——这和学生摸透考纲后疯狂刷题背套路没什么本质区别。业内给这种现象起了个专门的词,叫 “benchmaxxing”:单纯为了在榜单上刷出漂亮分数,而不是为了提升泛化能力去调优模型。

这背后的逻辑正是经济学里著名的 Goodhart 定律(古德哈特定律):一旦某个指标被选为考核目标,它就不再是一个好指标。 所以看到某个模型在某项测试里拿到极高分数时,更准确的理解不是“这个模型的通用能力有多强”,而是“它非常契合这项测试所设定的任务与规则”——这两句话听起来接近,本质其实差了十万八千里。

第三,厂商自测自夸的成绩,含金量天然要打个折扣。 一款新模型出炉,实验室内部通常会跑几十甚至上百个基准,但在发布会 PPT 上,你永远只能看到它打赢竞品的那几项;至于挑来对比的竞品,也往往特意选了对方的旧版本或较弱的型号。更隐蔽的做法,是私下跑几十个不同变体,最后挑选一个成绩最亮眼的公开汇报。

2025 年 4 月,一篇名为《The Leaderboard Illusion》的论文(作者来自 Cohere、斯坦福、普林斯顿等机构)就直接指出了知名盲测平台 LMArena(2026 年 1 月已更名为 Arena)存在的这个漏洞。论文列举称,Meta 在 Llama 4 发布前的两三个月内,曾私下提交测试了 27 个不同变体,最终只公开了排名最好的那一次。尽管平台方随后公开反驳,表示论文部分推导数据基于模拟、不够准确,但几乎同一时期,包括 Andrej Karpathy 在内的多位技术大咖也公开表示,某个曾一度登顶的模型在实际生产环境中的表现平平,引发了社区的广泛疑虑。

这桩悬案在 2026 年 1 月迎来了实质性证实:Meta 时任首席科学家在接受《金融时报》采访时承认,当时的测试成绩确实“稍微注了点水”;扎克伯格也因此对评测团队失去信任,多位相关高管相继离职。

厂商自测数据失真机制示意图:以 Meta 私下测试 27 个 Llama 4 变体为例,研发产出的众多模型在匿名盲测后,表现平平的 26 个变体被隐藏,仅挑选 1 个登顶变体作为官方战绩对外公布,造成排行榜幻觉,最终引来社区质疑与官方证实注水

谁来打分,同样是个大问题

如果是一道有标准答案的数学选择题,打分很简单:答对就是对,答错就是错。但如果要求两个模型各写一篇文章、或者回答一个复杂的开放性论述,“谁写得更好”就没那么容易用标准答案去衡量了。

目前业内评判这类任务主要有三种方式:真人评判、让另一个大模型来当裁判(LLM Judge)、或者设计可以用代码自动验证的客观指标。

其中,LLM Judge 因为效率高、成本低,成了很多评测的首选——把同一个问题交给两个模型分别作答,再由第三个大模型来裁定谁的回答更好。但新的隐患也随之而来:Judge 自己真的可靠吗? 模型评价模型,不仅可能存在偏好倾向和评分标准不稳定的问题,而且天然容易对某种特定写作风格更买账(比如更偏爱长文本或特定行文结构)。所以,当你看到宣传里写着“某模型得分 9.2/10”时,同样值得先问一句:这个 9.2 分,到底是谁用什么尺度打出来的?

Arena 类平台,又是另一种思路

LMArena(现已更名为 Arena)这类平台换了一种完全不同的思路:它不发固定的题目试卷,而是让用户在界面里自由提问,后台同时调用两个匿名的模型作答,由用户盲选自己更喜欢哪一个。平台借用了国际象棋、电竞排位赛常用的 Elo 机制——赢一场就涨分,输一场就掉分——通过海量真实用户的投票积累出相对排名。

它和传统 Benchmark 测量的完全不是一回事:

  • 传统 Benchmark 更接近“这道题你答对了吗”;
  • Arena 类平台 更接近“这两个回答摆在面前,你更愿意用哪一个”。

两种方式并没有绝对的高下之分,它们只是测量了完全不同的维度——这也是同一个模型在不同排行榜上位置经常截然不同的根本原因:有的测数学,有的测代码,有的让真人盲选,有的让 AI 当裁判,底层的评价体系压根就不是一回事。

传统基准测试与 Arena 盲测平台机制对比图:传统 Benchmark 采用固定题库与程序客观判分,测量“答得对不对”,但易受污染和针对性刷分;Arena 类平台采用开放日常 Prompt 与真人盲选投票,基于 Elo 算法排位,测量“用户更喜欢哪个”,但易受排版长度和讨好型风格影响。两者维度不同,名次差异实属正常

不过,Arena 类平台也有自己的主观偏差。普通用户在投票时很容易被“讨好型”回答所吸引——那些回答更长、排版更精美、语气更客气的模型,哪怕内容深度一般,也更容易多赚几票。虽然平台后来加入了“风格控制”来部分校正这种水分,但这种主观偏好依然很难彻底抹平。前面提到的私下多跑变体、只公开最好成绩的问题,在这类平台上也同样存在。

综合指数是怎么算出来的?

既然单个 Benchmark 片面又容易失真,那把多个测试综合起来算个总分,总该客观了吧?

像第三方评测机构 Artificial Analysis 提出的 Intelligence Index(智能指数)就属于这种思路:把数学、代码、知识、推理等各个维度的基准测试按一定权重加总,算出一个综合总分。

这样做的好处显而易见——读者不用自己一个个去翻看十几个 Benchmark 进行比较。但随之而来的问题也十分直接:凭什么选这几项测试?又由谁来决定每项测试占多大权重?

权重只要稍微一调,排名立刻就会生变。综合指数不是物理世界里自然产生的“AI 真实智商”,它只是按某一套既定的评测框架、测试集筛选和权重分配计算出来的加权结果。这不代表综合指数没有参考价值,而是我们在看榜单时必须清楚:这个总分到底代表了谁的偏好与考量。

综合智能指数计算机制与局限图示:以 Artificial Analysis 的 Intelligence Index 为例,综合指数由代码、推理、数学、常识与盲测等子项按人为设定的权重加总而成;权重方案一旦由均衡调向代码或特定领域倾斜,榜单榜首就会立刻洗牌,说明综合指数并非客观物理智商,而是主观加权的人工投影

SWE-bench、GPQA、AIME 这些缩写又是什么?

面对发布会 PPT 上一连串大写字母,普通人往往一头雾水。其实大可不必纠结“哪个才是唯一权威的榜单”,把它们先理解成一套套不同的考试就好:有的考数学,有的考代码,有的考科学,也有的试图综合考察模型在多个领域的能力。

  • SWE-bench:测的是真实软件工程解决问题的能力,重点考察模型能不能读懂 GitHub 仓库的真实 Issue 并修改代码通过测试;
  • GPQA:高难度研究生级别的科学问答(涵盖物理、化学、生物等),即便让人类拿着搜索引擎去查也很难做对;
  • AIME:美国数学邀请赛真题,专门考察极高难度的数学推理;
  • 此外还有大量基准,分别用于测视觉理解、长上下文记忆、工具调用(Function Calling / Tool Use)等细分能力。

这些专项基准的核心价值,在于把“AI 能力”这个过于庞大模糊的概念,拆解成了许多可以具体测量的细分工程指标。一个模型在某项专项上拿高分当然很有价值,但千万别把局部优势无限放大:数学考第一不代表写文案懂人情世故,Arena 盲测名次高也不意味着所有复杂工程任务都比别人强。

值得一提的是,Humanity’s Last Exam(HLE),就是为了解决传统 Benchmark 越来越容易“考满分”的问题而设计的。

它由全球各领域的专家参与出题,包含 2,500 道覆盖数学、人文、自然科学等领域的高难度问题,并于 2026 年正式发表于《Nature》。最初发布时,顶尖模型在 HLE 上的正确率只有个位数,而 MMLU 等传统测试已经出现 90% 以上的高分。

但到了现在,HLE 本身也在快速被前沿模型追赶。2026 年 9 月,公开成绩的最高水平已经达到约 46.5%。与此同时,HLE 官方已经推出持续更新的 HLE-Rolling,不断替换较容易或存在问题的题目,引入新的 held-out 题目。

这反而说明了一个更有意思的问题:

一个 Benchmark 再难,也很难永远充当“最后一场考试”。

模型会进步,测试也会逐渐失去区分度,甚至可能出现过拟合。所谓“高分”,因此永远应该和它所对应的测试版本、测试方法一起看。

已饱和基准与前沿防线基准对比图示:通识基准 MMLU 遭训练数据严重污染、模型得分超 90%+ 导致区分度归零;而 Nature 2026 发表的 Humanity’s Last Exam 专防 AI 刷题,人类顶级专家达 90%,前沿模型虽从初期个位数追赶至 40%+,但依然存在巨大鸿沟。再难的基准也难永远充当最后一场考试,必须动态看待跑分

普通人怎么看:一份可以直接用的判断清单

不需要死记硬背几十个 Benchmark 的英文名字,平时浏览资讯时,养成以下 5 个审视习惯就足够:

  1. 看测试名称与类型——不要只看“领先 15%”的大字标题,先看清楚测的究竟是数学、代码、知识问答,还是综合对话。
  2. 看考题从哪来——是不是公开了很多年的老题库?新模型有没有可能在训练阶段就已经提前“背过答案”?
  3. 看谁来判定分数——是客观标准答案、程序自动单元测试、真人盲测,还是另一个 LLM 当裁判?
  4. 看测试条件是否对齐——模型具体是什么版本?是否允许多次尝试(Pass@1 还是重试多次)?思考时间给得充不充分?这些藏在脚注里的小细节,往往直接决定了两个数字能不能放在一起比较。
  5. 多方交叉验证——如果一个模型在代码、数学、最新测试集和真人偏好盲测里表现都很稳健,那它的可信度自然很高;如果它只在某一项测试里极其亮眼,换个测试就打回原形,那至少要明白这个成绩的适用场景非常狭窄。

普通人看大模型排行榜的 5 步审视法则与终极方案图示:从看测试类型、查题目时效、问评测裁判、对齐评测条件、到多方交叉验证,避开单榜偏科噱头;最实用的一招永远是挑选日常工作中的 5~10 个真实难题组建私人测试集,盲测出最适合自己的模型

最管用的一招:建一个只有你自己知道的“私人题库”

在所有方法里,对普通人最管用、也最不容易被忽悠的一条,是建立一个专属于你自己的“测试集”:

挑 5~10 个你平时工作或生活中最常遇到的真实问题——比如润色一封特定语气的工作邮件、排查一段报错代码、提炼一份复杂合同的关键条款。

不要告诉模型这是在测试,把相同的问题直接丢给两三个候选模型,在不看模型名字的前提下盲测对比结果。这比任何权威榜单都更能回答“哪个模型真正适合我”,原因其实很简单:只有你自己的真实问题,模型才永远不可能提前背过答案。

写在最后

下次再看到“某模型登顶全球第一”的宣传时,不用急着记住这个排名,不妨先在心里问自己几个问题:谁出的题?题目新不新?模型有没有可能提前背过?是谁打的分?有没有其他维度的测试可以交叉印证?

如果这项测试所衡量的能力,和你平时真正关心的需求根本不是一回事,那么这个“第一”哪怕叫得再响,其实也和你没有太大关系。

大模型评测真正麻烦的地方,从来不是分不清哪个数字更大,而是置身于铺天盖地的营销声浪中,我们太容易忘记:一个跑分数字,首先代表的永远只是一套特定的测试方法,而不是整个模型的全部。

关于

关注我获取更多资讯

月球基地博客公众号二维码,扫码关注获取更多 AI 与编程资讯
📢 公众号
月球基地博客作者个人微信二维码,扫码交流 AI 与编程话题
💬 个人号
使用 Hugo 构建
主题 StackJimmy 设计