先这样答
Recall@K 和 mAP 分别衡量召回覆盖率和排序准确度。Recall@K 指真实匹配项是否出现在 Top-K 结果里。它是检索场景的主指标。正确结果进入前 K 个位置即算成功。我们通常关注 Top-1 或 Top-5 的表现。它体现系统捞回正确答案的底线能力。
mAP 是平均精度均值。它衡量系统整体的排序质量。Recall@K 只关心结果在不在前 K 个。mAP 会惩罚把正确结果排在后面的情况。相关结果排得越靠前得分越高。这个综合指标在检测任务里非常常用。
多模态图文检索场景有特有的计算规则。图文检索必须做双向评估。图搜文和文搜图是独立的检索方向。我们不能把双向结果混在一起算平均。系统需要分别计算图搜文和文搜图的指标结果。
面试官会怎么追问
-
「在多模态检索里,只看单向的 Recall@K 为什么不够?」 图搜文和文搜图的特征映射难度不同。单向指标会掩盖系统在另一方向的缺陷。我们必须分别计算双向指标。这能完整验证模型的跨模态对齐能力。
-
「Recall@K 和 mAP 在实际业务中怎么配合看?」 Recall@K 决定检索系统的下限。它保证正确结果进入后续重排阶段。mAP 决定用户体验的上限。它要求系统把最相关的结果推到最前面。
-
「为什么目标检测常用 mAP,而检索场景更看重 Recall@K?」 检测任务需要找出所有目标并准确定位。mAP 能综合评估框的准确率和召回率。检索场景面临海量候选库。业务更关心正确结果能否进入前 K 个候选名单。
回答的坑
回答多模态评估时漏掉图搜文和文搜图双向分别计算的特有要求。 解释 mAP 时没有点出它对排序位置敏感的核心特征。
同系列的题
—— 本题完 ——