评测与可观测Benchmark评测速答 · 约 5 分钟更新 2026-09-16

大模型评测都看哪些 Benchmark?榜单排名可信吗?

一句话结论

通用能力看 MMLU 系列和 GPQA,代码看 HumanEval/SWE-bench,数学看 AIME,Agent 能力看 SWE-bench 和各类 agent benchmark;榜单看趋势别看名次:数据污染、应试特化和场景错配是三个坑。

先这样答

按能力域过一遍主流 benchmark,然后讲榜单怎么读。

通用语言与知识:MMLU 及其进阶版 MMLU-Pro,考多领域选择题,是历史最久的通用基线;GPQA 考研究生水平的科学问题,难度更高,用来区分头部模型。推理与数学:AIME(数学竞赛题)、各类逻辑推理集。代码:HumanEval 考函数级生成,SWE-bench 考真实 GitHub 仓库里修 bug,后者更接近工程实际。长上下文:大海捞针(needle in a haystack)类测试。Agent 与工具:SWE-bench 本身就是 agent 任务,另有 Gaia、tau-bench 这类考工具使用和多步任务的基准。中文能力:C-Eval、CMMLU 是常用参考。

榜单怎么读,三个坑必须讲。

第一坑:数据污染。题目进了训练数据,分数就虚高,尤其是公开多年的老基准。所以行业不断推新基准,看榜单要看题目是否够新。第二坑:应试特化。模型在 benchmark 风格的数据上针对性训练过,榜上高分、实际干活平庸,「分数好不等于好用」。第三坑:场景错配。你的任务是中文客服文案,MMLU 高分帮不了你,通用榜单和具体业务之间隔着领域、语言、任务形态三重错配。

正确用法:榜单用来缩小候选范围和看长期趋势(模型代际的进步是真实的),最终选型必须用自己的业务评测集复测。这也是为什么「建自己的评测集」在大模型岗位面试里反复出现:会用榜单,也要能摆脱榜单。

面试官会怎么追问

  • 怎么检测数据污染? 常用手法:把题目改写换皮后重测(分数断崖说明背过原题)、检查模型能否补全题目的后续内容、用不公开的私有测试集对照。
  • Arena 类真人偏好榜怎么样? 互补视角:真实用户盲测投票,不污染但测的是「偏好」不是「正确」,且用户构成有偏;和学术榜交叉看更立体。
  • 自建评测集要多少条? 起步几十条覆盖核心场景就能做版本对比,几百条能稳定区分小差异;关键是分布贴真实任务,且持续更新。

回答的坑

  • 背一堆榜单名不带用法。每个榜单说清「考什么、什么场景参考它」才有信息量。
  • 全信榜单或全不信。观点给全:榜单看趋势、选型靠自测。
—— 本题完 ——