先这样答
要确保输出符合检索内容,需要同时约束生成、校验答案,并在检索质量不足时拒答。生成侧先在提示词中明确要求模型只依据检索资料回答。资料没有答案时,模型必须说不知道。这样可以减少模型凭已有知识补充内容。
同时要求模型逐句带来源编号。面试官可以直接检查每句话对应哪段检索资料。采样时使用低温度,减少同一问题出现不同表述或额外发挥的情况。
校验侧加入忠实度检测。让裁判模型比对最终答案和检索片段,检查答案是否超出资料支持范围。系统还要拦截没有依据的内容。检索侧配合 Rerank 阈值门控。检索结果质量低于阈值时,系统直接拒答,不让模型硬生成。这样才能从输入质量、生成过程和最终答案三个位置控制偏离。
面试官会怎么追问
-
「只靠提示词要求模型说不知道,真的可靠吗?」 提示词是生成侧约束,不能替代结果校验。最终还要用忠实度检测比对答案和检索片段,并拦截无依据内容。
-
「为什么要让模型逐句带来源编号?」 来源编号让每句话都有对应资料,方便检查答案是否被检索内容支持。它也能帮助裁判模型定位答案和检索片段之间的对应关系。
-
「检索结果质量低时,为什么不让模型根据已有知识回答?」 这道流程要求模型只依据检索资料回答。Rerank 阈值门控发现结果质量不足后,直接拒答比硬生成更符合这个约束。
回答的坑
-
只说“提示词限制模型”,却不提忠实度检测和无依据内容拦截。
-
只讨论生成侧控制,却漏掉 Rerank 阈值门控和低质检索直接拒答。
同系列的题
这家公司的面经实录
—— 本题完 ——