评测与可观测评测数据污染可观测速答 · 约 5 分钟更新 2026-09-28

Benchmark 数据污染是什么?怎么判断模型是背过题还是真会?

一句话结论

数据污染就是评测题或题解进了训练语料,判断模型真能力要看训练集重叠、改写题表现和真实业务自测,不能只看公开榜单。

先这样答

Benchmark 数据污染,是公开评测集的原题、答案或网上题解混进了模型训练数据,模型可能凭记忆作答,所以分数比真实能力高。判断时我会看三件事:训练数据和评测集是否重叠,把题目改写或换一种表达后分数是否明显下降,再对比标准版和改写版之间的分差。

公开榜单容易被污染,因为原题、解析和讨论长期存在于网页、代码仓库和资料中,训练数据又常常来自公开语料。模型在标准题上分数高,不代表它能迁移到业务场景;如果换成新任务、不同措辞,或者要求解释过程和处理边界条件,表现可能明显变差。实际选型时,榜单只做初筛,最终要用隔离的业务评测集验证。

如果是自己建设评测集,我会让题目和答案不进入训练或公开流转范围,定期轮换,并保留一批不外流的题做复核。面试中我会这样收束:公开榜单只能说明模型熟悉这套题,改写测试、重叠检测和业务自测一起通过,才更接近真实能力。

面试官会怎么追问

  • 「改写题分数下降,就一定说明原题被背过吗?」 不一定,也可能是改写引入了歧义、改变了任务难度,或者模型对新措辞泛化较差。所以要控制语义和难度,使用多种改写,再结合训练数据重叠证据判断。

  • 「训练数据拿不到,污染还怎么检测?」 可以用标准题和语义等价的改写题做对照,观察模型是否只在原表述上表现突出。还可以加入时间上较新的题、内部业务题和要求多步解释的任务,但这只能提供间接证据。

  • 「为什么不直接相信公开榜单?」 榜单适合做横向初筛,因为大家使用同一套题,结果容易比较。但公开题和题解可能已经进入训练语料,最终选型必须看隔离的业务数据、改写题和实际任务表现。

回答的坑

  • 只说「分数高就是能力强」,忽略公开题和题解可能进入训练语料,正确方向是同时检查重叠和改写后的泛化表现。

  • 把改写后掉分直接等同于数据污染,正确方向是先控制题意和难度,再结合多种证据判断。

—— 本题完 ——