先这样答
按能力域过一遍主流 benchmark,然后讲榜单怎么读。
通用语言与知识:MMLU 及其进阶版 MMLU-Pro,考多领域选择题,是历史最久的通用基线;GPQA 考研究生水平的科学问题,难度更高,用来区分头部模型。推理与数学:AIME(数学竞赛题)、各类逻辑推理集。代码:HumanEval 考函数级生成,SWE-bench 考真实 GitHub 仓库里修 bug,后者更接近工程实际。长上下文:大海捞针(needle in a haystack)类测试。Agent 与工具:SWE-bench 本身就是 agent 任务,另有 Gaia、tau-bench 这类考工具使用和多步任务的基准。中文能力:C-Eval、CMMLU 是常用参考。
榜单怎么读,三个坑必须讲。
第一坑:数据污染。题目进了训练数据,分数就虚高,尤其是公开多年的老基准。所以行业不断推新基准,看榜单要看题目是否够新。第二坑:应试特化。模型在 benchmark 风格的数据上针对性训练过,榜上高分、实际干活平庸,「分数好不等于好用」。第三坑:场景错配。你的任务是中文客服文案,MMLU 高分帮不了你,通用榜单和具体业务之间隔着领域、语言、任务形态三重错配。
正确用法:榜单用来缩小候选范围和看长期趋势(模型代际的进步是真实的),最终选型必须用自己的业务评测集复测。这也是为什么「建自己的评测集」在大模型岗位面试里反复出现:会用榜单,也要能摆脱榜单。
面试官会怎么追问
- 怎么检测数据污染? 常用手法:把题目改写换皮后重测(分数断崖说明背过原题)、检查模型能否补全题目的后续内容、用不公开的私有测试集对照。
- Arena 类真人偏好榜怎么样? 互补视角:真实用户盲测投票,不污染但测的是「偏好」不是「正确」,且用户构成有偏;和学术榜交叉看更立体。
- 自建评测集要多少条? 起步几十条覆盖核心场景就能做版本对比,几百条能稳定区分小差异;关键是分布贴真实任务,且持续更新。
回答的坑
- 背一堆榜单名不带用法。每个榜单说清「考什么、什么场景参考它」才有信息量。
- 全信榜单或全不信。观点给全:榜单看趋势、选型靠自测。
—— 本题完 ——