训练与微调腾讯面经高频[强化学习奖励模型信用分配]速答 · 约 6 分钟更新 2026-09-28

长链路 Agent 任务为什么信用分配难?PRM 怎么参与?

一句话结论

难在只有最终奖励且轨迹长,无法区分哪一步导致成败,优势估计方差大;PRM 可作过程奖励拼进总回报,或直接转成优势信号参与更新。

先这样答

长链路 Agent 任务的信用分配难题,核心在于动作与奖励解耦。一条轨迹通常有几十步,但只有终态有确定的奖励信号。这导致无法区分哪一步该为成败负责,同一个动作可能在成功和失败的轨迹里都出现过。此外,轨迹过长会使优势估计的方差变大。在 token 级别的损失函数下,这种方差叠加长度偏差,会导致长回答整体被压制。

常见解决方案各有取舍。蒙特卡洛回报实现简单但方差大。GAE 类方法能做折中,但需要训练 Critic 模型,而 Agent 场景的 Critic 很难训。成本较高的方式是反事实评估,即把某一步换成别的动作重新跑看结果。目前比较有效的是树搜索式的多条采样比较,GRPO 的组内相对评分就是这一思路的简化。

PRM 参与信用分配有两种方式。第一种是只做打分,给每步提供过程奖励并拼进总回报,后续仍要经过优势估计。第二种是直接转成优势,把步级分数当作该步或该段 token 的 advantage 信号直接参与更新,跳过组内比较或价值基线。后者的信号更直接,但高度依赖 PRM 质量。如果 PRM 存在偏差,直接更新会系统性带偏策略模型。

实际落地中,先用组内相对方法解决基线问题,再叠加 PRM 做步级细化,是多数团队务实的演进顺序。

面试官会怎么追问

  • 「如果引入了上下文压缩,信用分配的难度为什么会加剧?」 压缩后历史细节会丢失,被压缩掉的步骤既没有保留 token 也没有过程信号。这使得奖励更难落回真实的因果步骤上。
  • 「PRM 分数直接转成 Advantage 相比于只做过程奖励,风险在哪里?」 风险在于对 PRM 的准确度要求极高。如果 PRM 只是打分拼进总回报,后续的优势估计还能过滤部分噪声。直接转成 Advantage 会让 PRM 的有偏信号直接作用于策略更新。
  • 「怎么理解 GRPO 组内相对是树搜索多条采样比较的简化?」 树搜索需要展开多个分支并评估节点,计算成本很高。GRPO 通过对同一个提示词采样多个回答并在组内计算相对得分,跳过了复杂的节点评估,以较低成本实现了多样本比较。

回答的坑

  • 认为只要有了 PRM 就能完美解决信用分配,正确的方向是指出 PRM 直接参与更新存在系统性偏差风险,依然需要结合组内相对基线来稳定训练。
  • 认为 GAE 能轻松解决长链路方差问题,正确的方向是明确 GAE 虽然能折中方差,但在 Agent 场景下会面临 Critic 模型难训练的阻碍。
—— 本题完 ——