五厂面经真题集蚂蚁集团面经高频蚂蚁集团真题大模型面试检索重排速答 · 约 5 分钟更新 2026-09-29

检索器和 Reranker 的分数太相近、不可靠,怎么解决?

一句话结论

先归一化分数并比较相对排序,再用多路召回并集统一重排,必要时增强 Rerank、改写 query,并用难例集检查边界样例。

先这样答

结论是,不要直接依赖检索器和 Reranker 的绝对分数。先做分数归一化,再看候选之间的相对排序。同时从召回、重排、query 和评估四个方面处理。

如果候选分数挤在一起,说明分数的区分度低。可以把多路召回结果取并集,再统一交给 Reranker 排序。这样能扩大候选之间的差异,让模型在同一批候选中比较。若 Reranker 仍然分不出先后,可以换更强的模型,或者用 pairwise 排序方式做微调。

还可以改写 query,让问题中的语义差异更清楚。评估时要单独建设难例集,专门测试容易混淆的边界样例。这样不能只看整体排序结果,还能确认模型是否真的解决了分数接近的问题。

面试官会怎么追问

  • 「为什么不能直接比较检索器和 Reranker 的绝对分数?」 分数挤在一起时,绝对值很难反映候选之间的真实差异。先归一化分数,再观察相对排序,更适合判断候选先后。重点是比较同一批候选中的排序关系。

  • 「多路召回取并集后,为什么还要统一重排?」 多路召回会带来不同候选。取并集可以扩大候选范围。统一交给同一个 Reranker 排序,才能在同一尺度下比较这些候选。

  • 「你怎么验证这次调整真的有效?」 建立难例集,专门覆盖分数接近、容易混淆的边界样例。分别观察归一化、召回并集、模型调整和 query 改写后的排序结果。重点检查边界样例是否能被正确区分。

回答的坑

  • 只说“换更大的模型”,却不处理分数尺度、候选集合和 query 语义差异。

  • 只看整体评估结果,不单独检查分数接近的边界样例。

相关深度笔记

—— 本题完 ——