现在的大模型厂商越来越多,同一家厂商下面又有一堆不同的模型,几乎每天都有新模型发布。问题是,对普通人来说,模型本身越来越难看懂了。
厂商会告诉你,这个模型的数学成绩刷新了纪录,那个模型的代码能力超过了某某对手;社交媒体上又会迅速出现一轮“XX吊打XX”“新模型登顶”的讨论。等你真正想知道这个模型到底怎么样,往往已经不知道该看谁了:官方的战报能不能直接信?社交媒体上的实测靠谱吗?那些排行榜和 Benchmark,又到底意味着什么?
以前,遇到一个新模型,打开一个排行榜,看一眼排名,多少还能有个大概;但现在,已经不是打开一个排行榜这么简单了,因为你会发现,不同的榜单、不同的 Benchmark,测的根本不是同一件事。当一个新模型发布时,我们到底应该怎么看它的那些“漂亮成绩”?
别急着看分数,先问一句:这到底在测什么
看到“Model A:95 分,Model B:91 分”,人的第一反应通常是 A 比 B 强。但这里其实少了一条最关键的信息:A 和 B 到底是在什么测试里拿到这两个分数的?
如果测的是数学,严谨的结论只能是“A 在这套数学测试里表现更好”;要是换成代码测试,或者换成让真人盲测回答质量,结论可能完全相反。就像一个学生数学考了第一,并不代表他英语和体育也排第一。大模型能聊天、写代码、做数学推理、看图、搜索、操作电脑、调用工具——根本不存在某一个单一数字,能把所有这些能力全部打包压缩进去。
所以,下次再看到“某某模型全球第一”时,第一反应不用急着兴奋,也不必急着怀疑,而是先问一句:这个“第一”,到底比的是什么?
Benchmark 是什么,又是怎么失真的
Benchmark(基准测试)说白了就是一套固定题目加上评分标准:给模型一批题目,让它作答,再和标准答案比对算出得分。它的好处很直接——大家做同一套试卷,横向对比一目了然,这也是发布会上那张漂亮对比表格的由来。
但问题恰恰从这里开始,水分主要出在三个地方。
第一,模型有没有可能提前“见过”这些题? 很多经典基准(比如 MMLU)已经在公开领域使用了好几年,题目和标准答案早已散落在互联网的各个角落,模型在预训练或微调抓取网页时,难免顺理成章地把它们“读”了进去。这未必是厂商主观作弊,但客观结果是一样的:最终的高分不再能代表模型面对陌生问题时的推理水平——这就是业内常说的 Benchmark contamination(测试集污染)。
这也解释了为什么一些老牌基准的分数看起来越来越“通胀”:MMLU 上,GPT-3 在最初的公开测试中只有 43.9%,到了今天已经逐渐失去区分度,公开成绩普遍集中在较高区间;GSM8K 的变化则更加明显,GPT-3 时代的成绩大约只有 35%,而到了今天,顶尖模型已经可以做到接近满分。
这当然不意味着模型没有真正变强。问题在于,一个公开、固定的测试集存在得越久,就越容易被模型训练数据覆盖,或者被针对性优化,最终逐渐失去区分不同模型的能力。
这也是为什么后来出现了 LiveBench 这样的基准:不断加入来自近期数学竞赛、论文、新闻等来源的新题,并持续更新测试内容,尽量降低测试集污染,让 Benchmark 能够继续区分不断进步的模型。
第二,模型是不是越来越“会考试”,而不是真正变懂了? 当行业摸清了某个 Benchmark 的题型分布和评分规则,针对它做针对性优化就成了顺理成章的事——这和学生摸透考纲后疯狂刷题背套路没什么本质区别。业内给这种现象起了个专门的词,叫 “benchmaxxing”:单纯为了在榜单上刷出漂亮分数,而不是为了提升泛化能力去调优模型。
这背后的逻辑正是经济学里著名的 Goodhart 定律(古德哈特定律):一旦某个指标被选为考核目标,它就不再是一个好指标。 所以看到某个模型在某项测试里拿到极高分数时,更准确的理解不是“这个模型的通用能力有多强”,而是“它非常契合这项测试所设定的任务与规则”——这两句话听起来接近,本质其实差了十万八千里。
第三,厂商自测自夸的成绩,含金量天然要打个折扣。 一款新模型出炉,实验室内部通常会跑几十甚至上百个基准,但在发布会 PPT 上,你永远只能看到它打赢竞品的那几项;至于挑来对比的竞品,也往往特意选了对方的旧版本或较弱的型号。更隐蔽的做法,是私下跑几十个不同变体,最后挑选一个成绩最亮眼的公开汇报。
2025 年 4 月,一篇名为《The Leaderboard Illusion》的论文(作者来自 Cohere、斯坦福、普林斯顿等机构)就直接指出了知名盲测平台 LMArena(2026 年 1 月已更名为 Arena)存在的这个漏洞。论文列举称,Meta 在 Llama 4 发布前的两三个月内,曾私下提交测试了 27 个不同变体,最终只公开了排名最好的那一次。尽管平台方随后公开反驳,表示论文部分推导数据基于模拟、不够准确,但几乎同一时期,包括 Andrej Karpathy 在内的多位技术大咖也公开表示,某个曾一度登顶的模型在实际生产环境中的表现平平,引发了社区的广泛疑虑。
这桩悬案在 2026 年 1 月迎来了实质性证实:Meta 时任首席科学家在接受《金融时报》采访时承认,当时的测试成绩确实“稍微注了点水”;扎克伯格也因此对评测团队失去信任,多位相关高管相继离职。
谁来打分,同样是个大问题
如果是一道有标准答案的数学选择题,打分很简单:答对就是对,答错就是错。但如果要求两个模型各写一篇文章、或者回答一个复杂的开放性论述,“谁写得更好”就没那么容易用标准答案去衡量了。
目前业内评判这类任务主要有三种方式:真人评判、让另一个大模型来当裁判(LLM Judge)、或者设计可以用代码自动验证的客观指标。
其中,LLM Judge 因为效率高、成本低,成了很多评测的首选——把同一个问题交给两个模型分别作答,再由第三个大模型来裁定谁的回答更好。但新的隐患也随之而来:Judge 自己真的可靠吗? 模型评价模型,不仅可能存在偏好倾向和评分标准不稳定的问题,而且天然容易对某种特定写作风格更买账(比如更偏爱长文本或特定行文结构)。所以,当你看到宣传里写着“某模型得分 9.2/10”时,同样值得先问一句:这个 9.2 分,到底是谁用什么尺度打出来的?
Arena 类平台,又是另一种思路
LMArena(现已更名为 Arena)这类平台换了一种完全不同的思路:它不发固定的题目试卷,而是让用户在界面里自由提问,后台同时调用两个匿名的模型作答,由用户盲选自己更喜欢哪一个。平台借用了国际象棋、电竞排位赛常用的 Elo 机制——赢一场就涨分,输一场就掉分——通过海量真实用户的投票积累出相对排名。
它和传统 Benchmark 测量的完全不是一回事:
- 传统 Benchmark 更接近“这道题你答对了吗”;
- Arena 类平台 更接近“这两个回答摆在面前,你更愿意用哪一个”。
两种方式并没有绝对的高下之分,它们只是测量了完全不同的维度——这也是同一个模型在不同排行榜上位置经常截然不同的根本原因:有的测数学,有的测代码,有的让真人盲选,有的让 AI 当裁判,底层的评价体系压根就不是一回事。
不过,Arena 类平台也有自己的主观偏差。普通用户在投票时很容易被“讨好型”回答所吸引——那些回答更长、排版更精美、语气更客气的模型,哪怕内容深度一般,也更容易多赚几票。虽然平台后来加入了“风格控制”来部分校正这种水分,但这种主观偏好依然很难彻底抹平。前面提到的私下多跑变体、只公开最好成绩的问题,在这类平台上也同样存在。
综合指数是怎么算出来的?
既然单个 Benchmark 片面又容易失真,那把多个测试综合起来算个总分,总该客观了吧?
像第三方评测机构 Artificial Analysis 提出的 Intelligence Index(智能指数)就属于这种思路:把数学、代码、知识、推理等各个维度的基准测试按一定权重加总,算出一个综合总分。
这样做的好处显而易见——读者不用自己一个个去翻看十几个 Benchmark 进行比较。但随之而来的问题也十分直接:凭什么选这几项测试?又由谁来决定每项测试占多大权重?
权重只要稍微一调,排名立刻就会生变。综合指数不是物理世界里自然产生的“AI 真实智商”,它只是按某一套既定的评测框架、测试集筛选和权重分配计算出来的加权结果。这不代表综合指数没有参考价值,而是我们在看榜单时必须清楚:这个总分到底代表了谁的偏好与考量。
SWE-bench、GPQA、AIME 这些缩写又是什么?
面对发布会 PPT 上一连串大写字母,普通人往往一头雾水。其实大可不必纠结“哪个才是唯一权威的榜单”,把它们先理解成一套套不同的考试就好:有的考数学,有的考代码,有的考科学,也有的试图综合考察模型在多个领域的能力。
- SWE-bench:测的是真实软件工程解决问题的能力,重点考察模型能不能读懂 GitHub 仓库的真实 Issue 并修改代码通过测试;
- GPQA:高难度研究生级别的科学问答(涵盖物理、化学、生物等),即便让人类拿着搜索引擎去查也很难做对;
- AIME:美国数学邀请赛真题,专门考察极高难度的数学推理;
- 此外还有大量基准,分别用于测视觉理解、长上下文记忆、工具调用(Function Calling / Tool Use)等细分能力。
这些专项基准的核心价值,在于把“AI 能力”这个过于庞大模糊的概念,拆解成了许多可以具体测量的细分工程指标。一个模型在某项专项上拿高分当然很有价值,但千万别把局部优势无限放大:数学考第一不代表写文案懂人情世故,Arena 盲测名次高也不意味着所有复杂工程任务都比别人强。
值得一提的是,Humanity’s Last Exam(HLE),就是为了解决传统 Benchmark 越来越容易“考满分”的问题而设计的。
它由全球各领域的专家参与出题,包含 2,500 道覆盖数学、人文、自然科学等领域的高难度问题,并于 2026 年正式发表于《Nature》。最初发布时,顶尖模型在 HLE 上的正确率只有个位数,而 MMLU 等传统测试已经出现 90% 以上的高分。
但到了现在,HLE 本身也在快速被前沿模型追赶。2026 年 9 月,公开成绩的最高水平已经达到约 46.5%。与此同时,HLE 官方已经推出持续更新的 HLE-Rolling,不断替换较容易或存在问题的题目,引入新的 held-out 题目。
这反而说明了一个更有意思的问题:
一个 Benchmark 再难,也很难永远充当“最后一场考试”。
模型会进步,测试也会逐渐失去区分度,甚至可能出现过拟合。所谓“高分”,因此永远应该和它所对应的测试版本、测试方法一起看。
普通人怎么看:一份可以直接用的判断清单
不需要死记硬背几十个 Benchmark 的英文名字,平时浏览资讯时,养成以下 5 个审视习惯就足够:
- 看测试名称与类型——不要只看“领先 15%”的大字标题,先看清楚测的究竟是数学、代码、知识问答,还是综合对话。
- 看考题从哪来——是不是公开了很多年的老题库?新模型有没有可能在训练阶段就已经提前“背过答案”?
- 看谁来判定分数——是客观标准答案、程序自动单元测试、真人盲测,还是另一个 LLM 当裁判?
- 看测试条件是否对齐——模型具体是什么版本?是否允许多次尝试(Pass@1 还是重试多次)?思考时间给得充不充分?这些藏在脚注里的小细节,往往直接决定了两个数字能不能放在一起比较。
- 多方交叉验证——如果一个模型在代码、数学、最新测试集和真人偏好盲测里表现都很稳健,那它的可信度自然很高;如果它只在某一项测试里极其亮眼,换个测试就打回原形,那至少要明白这个成绩的适用场景非常狭窄。
最管用的一招:建一个只有你自己知道的“私人题库”
在所有方法里,对普通人最管用、也最不容易被忽悠的一条,是建立一个专属于你自己的“测试集”:
挑 5~10 个你平时工作或生活中最常遇到的真实问题——比如润色一封特定语气的工作邮件、排查一段报错代码、提炼一份复杂合同的关键条款。
不要告诉模型这是在测试,把相同的问题直接丢给两三个候选模型,在不看模型名字的前提下盲测对比结果。这比任何权威榜单都更能回答“哪个模型真正适合我”,原因其实很简单:只有你自己的真实问题,模型才永远不可能提前背过答案。
写在最后
下次再看到“某模型登顶全球第一”的宣传时,不用急着记住这个排名,不妨先在心里问自己几个问题:谁出的题?题目新不新?模型有没有可能提前背过?是谁打的分?有没有其他维度的测试可以交叉印证?
如果这项测试所衡量的能力,和你平时真正关心的需求根本不是一回事,那么这个“第一”哪怕叫得再响,其实也和你没有太大关系。
大模型评测真正麻烦的地方,从来不是分不清哪个数字更大,而是置身于铺天盖地的营销声浪中,我们太容易忘记:一个跑分数字,首先代表的永远只是一套特定的测试方法,而不是整个模型的全部。
关于
关注我获取更多资讯