五厂面经真题集腾讯面经高频腾讯真题置信度Agent路由速答 · 约 5 分钟更新 2026-09-29

模型输出置信度不可直接相信时,系统怎么决定重试、拒答还是转人工?

一句话结论

不要直接使用模型自报的置信度,而要结合多采样一致性、检索支撑度和校验器结果判断答案是否可靠,再按错误是否可修复、证据是否充分和场景风险选择重试、拒答或转人工。

先这样答

系统不能直接相信模型自报的置信度,因为模型的置信度校准可能很差。系统应该使用外部信号判断答案是否可靠,再决定重试、拒答还是转人工。核心信号有三个:多采样一致性、检索支撑度和校验器结果。

多采样一致性看模型多次生成的答案是否收敛。如果多次结果不一致,说明答案不稳定,可以先重试。检索支撑度看答案能否在检索内容中找到依据。如果检索为空,或者证据很弱,就不应该继续生成,应当拒答。校验器可以检查答案是否满足要求,并作为路由依据。

路由还要结合错误类型和场景风险。格式错误、缺少信息这类可修复错误,可以重试。答案没有检索依据时,应当拒答。涉及资金、合规等高风险场景时,即使答案看起来合理,也应转人工。最终判断不能依赖模型自评,而要依赖这些外部信号。

面试官会怎么追问

  • 「为什么不能直接使用模型输出的置信度?」 模型自报的置信度不一定和真实正确性一致。它可能给出很高的分数,但答案没有足够依据。系统需要用校准更可靠的外部信号判断是否继续执行。

  • 「多采样一致就能证明答案正确吗?」 不能。多次生成一致,只能说明输出比较稳定,不能单独证明内容正确。还要检查答案是否得到检索内容支撑,并结合校验器结果做决定。

  • 「什么情况下重试,什么情况下直接拒答?」 先判断错误是否可修复。格式问题或信息缺失可以重试;检索为空、答案缺少证据时,应当拒答。如果场景涉及资金或合规,则转人工。

回答的坑

把模型自报的高置信度当成答案正确的证明,这是错误的。

只讲重试和拒答,不区分可修复错误、证据不足和高风险场景,也没有回答完整。

—— 本题完 ——