五厂面经真题集阿里巴巴面经高频阿里真题强化学习速答 · 约 5 分钟更新 2026-09-29

过程奖励模型怎么设计?怎么防止模型迎合评审器而不是完成真实任务?

一句话结论

过程奖励模型按步骤评分,给长链路更密的信号;同时把评审器和执行器解耦,用结果奖励和人工标注校准,盯住过程分与结果分的相关性,防止模型迎合评审器。

先这样答

过程奖励模型要对任务执行的每一步打分,而不是只看最终结果。这样可以提供更密的奖励信号,适合需要很多步骤的长链路任务。模型不只在最后拿到一个结果分,也能获得过程中的反馈。

防止模型迎合评审器,核心是把评审器和执行器解耦。评审标准不能直接公开给执行模型,避免模型专门优化评审器容易识别的表面特征。同时要用结果奖励做交叉校验。如果一条轨迹过程分很高,但最终结果很差,就降低这条轨迹的权重。这样可以限制模型只追求过程分。

还要定期用人工标注校准评审器,检查过程分是否真的反映任务质量。线上可以观察过程分和结果分的相关性。如果两者的相关性开始下降,就说明模型可能正在迎合评审器,而不是完成真实任务。此时需要重新检查评审标准,并结合人工标注调整评审器。

面试官会怎么追问

  • 「为什么不只使用结果奖励?」 结果奖励只在任务结束后提供信号。长链路任务中,模型很难知道具体哪一步出了问题。过程奖励能逐步评价执行过程,提供更密的反馈。

  • 「如果过程分很高,但结果分很低,你会怎么处理?」 先把这类轨迹识别出来,再降低它们的权重。它们说明评审器认可的过程不一定带来真实结果。还要用人工标注校准评审器,检查过程标准是否偏离任务质量。

  • 「怎么判断模型已经开始迎合评审器?」 观察过程分与结果分的相关性。如果过程分持续升高,但结果分没有同步改善,甚至两者相关性下降,就可以把它作为迎合开始的警报。之后要重新检查评审标准,并进行人工校准。

回答的坑

  • 只说过程奖励比结果奖励更细,却不说明过程分和结果分要交叉校验。
  • 只强调隐藏评审标准,却不提人工标注校准和相关性监控。
—— 本题完 ——