什么是大模型跑分?Benchmark 榜单该怎么看
新模型发布必晒的那些分数到底是什么?MMLU、GSM8K 这些榜单在考什么、为什么跑分高的模型未必好用、普通人该怎么看榜选模型,一文讲清。
每次新模型发布,配图几乎都长一个样:一堆柱状图,自家那根最高,旁边标着 MMLU、GSM8K、HumanEval 这些看不懂的名字。这些就是 Benchmark(基准测试)——通俗点说,给大模型出的标准化考卷。这篇讲清它们在考什么、为什么”跑分第一”和”你用着顺手”常常是两回事。
一句话理解:给模型考试
Benchmark 的逻辑和高考没什么两样:准备一套固定的题目和标准答案,所有模型做同一份卷子,按得分排名。
有了统一的卷子,才能横向比较——否则各家都说自己最强,谁也说不清。常见的几张卷子考的东西完全不同:
| 榜单 | 考什么 | 大致相当于 |
|---|---|---|
| MMLU | 几十个学科的多选题 | 通识百科大考 |
| GSM8K / MATH | 小学到竞赛级数学题 | 数学卷 |
| HumanEval | 写函数并跑通测试用例 | 编程上机考 |
| SWE-bench | 在真实代码仓库里修 bug | 编程实操考 |
| GPQA | 研究生级别的科学难题 | 专业课压轴题 |
| MMMU | 看图 + 推理 | 多模态综合卷 |
看榜的第一课就是:先看它考的是哪一科。一个数学榜第一的模型,不代表它写文案也第一。
为什么跑分高,用起来却一般
这是最值得说清楚的部分。榜单分数会失真,主要有四个原因:
1. 数据污染:考题提前泄露了
大模型的训练数据是从全网爬来的,而这些 benchmark 的题目和答案也公开在网上。如果测试题混进了训练数据,模型就不是在”解题”,而是在”背答案”。
这在业内叫数据污染(contamination),是最难排查、也最普遍的问题。它会让分数虚高,却完全不会提升模型在你实际任务上的表现。
2. 应试training:为了考试而优化
一旦某个榜单成为公认的宣传指标,就必然有人针对它优化。当一个指标变成目标,它就不再是好指标——模型可以被调得特别擅长做那类题,而通用能力并没有同步提升。
3. 考的不是你的场景
榜单题目大多是有标准答案的封闭问题。但你日常用 AI 干的事——写文案、改简历、整理会议纪要、陪你想方案——大多没有标准答案,也就没法用这种方式打分。
一个 GPQA 能答对研究生难题的模型,未必比另一个更懂怎么把你的邮件写得得体。
4. 分数饱和:都考满分了
很多老榜单已经被刷到 90 分以上,几个顶尖模型之间只差零点几分。这个差距早就小于测试本身的噪声了,拿它排名基本没有意义。这也是为什么新的、更难的榜单在不断被造出来。
那还有别的参考方式吗
有,而且更接近真实体验:
- 盲测竞技场:让真人同时看两个匿名模型的回答,投票选更好的那个,再用类似棋类的 Elo 算法排名。它衡量的是人真的更喜欢哪个答案,比做题更贴近日常使用。局限是容易偏向”讨喜”的回答风格——话说得漂亮不等于说得对。
- 自己建一套小测试集:这是最被低估、也最有效的办法。把你工作中最典型的 20 个任务整理出来,每次换模型就跑一遍。 这套”私人卷子”没有污染风险,考的又恰好是你真正在乎的能力。
普通人怎么看榜
四条实用原则:
- 先看科目,再看分数——挑和你用途最接近的那一项
- 警惕零点几分的差距,那基本是噪声
- 参考盲测排名,它比做题更接近真实使用感受
- 最终以自己试用为准——花二十分钟拿真实任务跑一遍,胜过看十张柱状图
主流几家模型在实际使用中的差异,可以对照 GPT / Claude / Gemini 横评;开源模型和闭源模型的取舍见开源大模型 vs 闭源大模型。
小结
Benchmark 是给模型出的标准化考卷,它的价值在于提供了可比较的尺度,但数据污染、应试优化、场景错配和分数饱和这四个问题,决定了它离”好不好用”始终隔着一层。
记住一句话:跑分衡量的是模型会做题,不是模型懂你。 看榜时先确认科目、别纠结零点几分、多参考真人盲测,最后一定用自己的真实任务试一遍。想更进一步理解分数背后的东西,可以看什么是参数量(模型大小和能力的关系)与什么是推理模型(为什么”会思考”的模型在难题榜单上分数突然拉高)。