大模型怎么评测
1️⃣ 考察意图
面试官想考察你是否具备系统化的 LLM 评测认知,而非仅背过几个 benchmark 名字。这是一道典型的“系统设计 + 工程取舍”题,刁钻点在于:评测不是跑分,而是为业务决策服务的。答好了能展示你对评测体系(基准、指标、方式、局限性)的完整理解,以及从“跑分”到“落地”的工程思维,包括如何设计评测集、如何平衡自动与人工评测、如何识别评测偏差。P1 难度意味着需要深入 trade-off,比如 MMLU 的饱和问题、GPT-4 作为裁判的偏见。
2️⃣ 标准答
LLM 评测不是单一维度,而是一个分层体系。我从三个层面展开:评测目标与基准、评测指标、评测方式与坑。
评测目标与基准
- 通用能力评测:覆盖知识、推理、代码、数学等。典型基准:
- MMLU(57 个学科,5-shot):考察知识广度,但已饱和(GPT-4 达 86%+),需关注细粒度(如细分学科)。
- GSM8K(小学数学):考察数学推理,但易受 prompt 影响,需用 CoT 或 PoT 格式。
- HumanEval / MBPP(代码生成):用 pass@k 指标,注意 k 值选择(常用 k=1, 10, 100)。
- HellaSwag / WinoGrande(常识推理):对抗性构建,避免数据泄露。
- 垂直领域评测:如医疗(MedQA)、法律(CaseHOLD)、金融(FinQA)。关键:公开基准可能不匹配业务场景,需自建数据集。例如金融问答,需覆盖财报、研报、新闻,并设计多轮对话。
- 安全与对齐评测:如 TruthfulQA(事实性)、BBQ(偏见)、HarmBench(有害内容)。坑:评测集可能过时,需持续更新对抗样本。
评测指标
- 自动指标:
- 准确率 / F1:适用于分类、多选题(如 MMLU)。
- BLEU / ROUGE:适用于生成任务,但相关性差(与人类判断的 Spearman 仅 0.2-0.3)。工程取舍:对摘要任务,ROUGE-L 比 BLEU 更稳定,但仍需人工校验。
- GPT-4 作为裁判:用 GPT-4 对生成结果打分(如 Chatbot Arena 的 Elo 评分)。坑:GPT-4 有位置偏见(先出现的答案得分高)、长度偏见(长答案得分高)。解法:交换顺序多次评测取平均,或使用 Fine-tuned 裁判模型(如 Reward Model)。
- 人工评测:
- Chatbot Arena:众包 A/B 测试,Elo 评分。优势:贴近真实用户。劣势:成本高、速度慢、标注者一致性差(Kappa 常 < 0.6)。
- 落地坑:人工评测需设计明确评分标准(如 1-5 分制),并做校准(calibration),否则不同标注者差异大。解法:先做 50 条预标注,计算一致性,再正式标注。
评测方式与坑
- 自动 vs 人工:自动评测快但浅,人工评测慢但深。工程取舍:在迭代阶段用自动评测(如 GPT-4 裁判),在发布前用人工评测(如 Chatbot Arena)。例如,我们团队在开发 RAG 系统时,先用 BLEU + GPT-4 裁判做快速筛选,再用 200 条人工标注做最终验证。
- 评测集设计:
- 数据泄露:模型可能见过评测集(如 MMLU 部分数据在预训练中)。解法:用最新数据(如 2024 年后的新闻)或自建对抗样本。
- 难度分布:评测集需覆盖简单、中等、困难样本。例如,GSM8K 只有小学难度,需补充 MATH(竞赛级)或自建复杂推理题。
- 结果分析:不能只看平均分。需关注:
- 领域差异:模型在 STEM 强但人文弱?需细分学科。
- 鲁棒性:同一问题换 prompt 或顺序,结果是否稳定?用多次采样(如 temperature=0.7)计算方差。
- 偏见:用 BBQ 检测性别、种族偏见。落地坑:偏见评测集可能不全面,需结合业务场景(如金融贷款场景的种族偏见)。
3️⃣ 答题模板(30 秒电梯版)
“这个问题我从评测目标与基准、评测指标、评测方式三个层面回答。首先,评测目标分通用(MMLU、GSM8K)、垂直(自建数据集)和安全(TruthfulQA);其次,指标包括自动(准确率、BLEU、GPT-4 裁判)和人工(Chatbot Arena Elo),需注意 GPT-4 裁判的位置偏见;最后,评测方式要平衡自动与人工,关注数据泄露和难度分布。总结一句:评测不是跑分,而是为业务决策服务的系统设计。”
4️⃣ 高频追问 & 应对
追问 1:你提到 GPT-4 作为裁判有偏见,具体怎么解决?
应对策略:主要解决位置偏见和长度偏见。位置偏见:交换两个答案的顺序,取两次评分的平均,或随机化顺序。长度偏见:在 prompt 中明确要求“忽略长度,只关注内容质量”。更鲁棒的做法是训练一个专门的 Reward Model(如基于 Llama 3 微调),用人工标注的偏好数据(如 10k 条)训练,这样裁判模型更稳定。另外,可以用多个裁判模型(如 GPT-4 + Claude 3)投票,减少单一模型偏差。
追问 2:如果业务场景是客服对话,你怎么设计评测集?
应对策略:首先,收集真实客服日志(脱敏后),覆盖常见问题(如退款、物流)和边缘案例(如投诉、多轮追问)。其次,设计多维度指标:答案准确率(自动匹配知识库)、对话流畅度(人工评分)、用户满意度(A/B 测试)。具体做法:构建 500 条测试集,每条包含用户问题、期望答案、多轮上下文。用 GPT-4 裁判做自动评分,再用 100 条做人工校验,计算一致性(Kappa > 0.7 才算合格)。最后,关注鲁棒性:换 prompt 或用户语气(如愤怒 vs 平静),看模型是否稳定。
追问 3:MMLU 已经饱和了,你怎么看?
应对策略:MMLU 饱和是因为模型在预训练中见过大量数据,且题目难度有限。解法:一是用更难的基准,如 MMLU-Pro(增加干扰项)、GPQA(研究生级问题);二是自建对抗性评测集,比如用 GPT-4 生成变体问题,或从最新论文/新闻中提取。另外,关注细粒度:不只看平均分,看模型在低资源学科(如伦理学)的表现。工程上,可以设计“难度自适应”评测:先做简单题,再根据正确率动态调整难度,避免天花板效应。
5️⃣ 避坑 · 常见错误答法
- ❌ 只背 benchmark 名字(“我用 MMLU、GSM8K、HumanEval 评测”) → ✅ 要解释为什么选这些基准,以及它们的局限性(如 MMLU 饱和、GSM8K 易受 prompt 影响)。
- ❌ 认为自动评测足够(“用 BLEU 和 ROUGE 就行”) → ✅ 要指出自动指标与人类判断相关性差,并给出混合方案(自动 + 人工 + GPT-4 裁判)。
- ❌ 忽略评测集设计(“用公开数据集跑分”) → ✅ 要强调自建数据集的重要性,以及数据泄露、难度分布等坑。
6️⃣ 简历呼应
- 如果你有 RAG 项目:从评测 RAG 系统的角度切入,比如如何设计检索 + 生成的联合评测(如 Recall@k + 答案准确率),以及如何处理多轮对话的评测。
- 如果你只做过传统 NLP:用分类/摘要任务的评测经验迁移,比如 BLEU 在机器翻译中的局限性,类比到 LLM 生成评测,强调需要引入人工或 GPT-4 裁判。
- 如果你是校招无项目:聚焦论文复现,比如复现 Chatbot Arena 的 Elo 评分系统,或用 GPT-4 裁判做一个小型评测实验(如 100 条问答),展示对评测流程的理解。
- 《MMLU: Measuring Massive Multitask Language Understanding》
- 《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》
- 《TruthfulQA: Measuring How Models Mimic Human Falsehoods》
- 《RAGAS: Automated Evaluation of Retrieval Augmented Generation》
- 《Evaluating Large Language Models: A Comprehensive Survey》