五厂面经真题集字节跳动面经高频字节真题多模态评估指标速答 · 约 5 分钟更新 2026-09-29

多模态检索的评估指标 Recall@K 和 mAP 是什么?

一句话结论

Recall@K 衡量真实匹配项是否进入前 K 名,是检索主指标。mAP 即平均精度均值,反映整体排序质量。多模态需双向分别计算。

先这样答

Recall@K 和 mAP 分别衡量召回覆盖率和排序准确度。Recall@K 指真实匹配项是否出现在 Top-K 结果里。它是检索场景的主指标。正确结果进入前 K 个位置即算成功。我们通常关注 Top-1 或 Top-5 的表现。它体现系统捞回正确答案的底线能力。

mAP 是平均精度均值。它衡量系统整体的排序质量。Recall@K 只关心结果在不在前 K 个。mAP 会惩罚把正确结果排在后面的情况。相关结果排得越靠前得分越高。这个综合指标在检测任务里非常常用。

多模态图文检索场景有特有的计算规则。图文检索必须做双向评估。图搜文和文搜图是独立的检索方向。我们不能把双向结果混在一起算平均。系统需要分别计算图搜文和文搜图的指标结果。

面试官会怎么追问

  • 「在多模态检索里,只看单向的 Recall@K 为什么不够?」 图搜文和文搜图的特征映射难度不同。单向指标会掩盖系统在另一方向的缺陷。我们必须分别计算双向指标。这能完整验证模型的跨模态对齐能力。

  • 「Recall@K 和 mAP 在实际业务中怎么配合看?」 Recall@K 决定检索系统的下限。它保证正确结果进入后续重排阶段。mAP 决定用户体验的上限。它要求系统把最相关的结果推到最前面。

  • 「为什么目标检测常用 mAP,而检索场景更看重 Recall@K?」 检测任务需要找出所有目标并准确定位。mAP 能综合评估框的准确率和召回率。检索场景面临海量候选库。业务更关心正确结果能否进入前 K 个候选名单。

回答的坑

回答多模态评估时漏掉图搜文和文搜图双向分别计算的特有要求。 解释 mAP 时没有点出它对排序位置敏感的核心特征。

—— 本题完 ——