Q2训练与微调对比选型AgentAlpha 社区约 6 分钟更新 2026-09-29

PPO vs GRPO vs DPO:对齐算法怎么选

PPO 四件套样本效率高、GRPO 组内相对省 Critic、DPO 离线偏好最简。这篇给三种对齐算法在显存、稳定性、数据依赖上的对比表与按资源选型的口径。

面试官原题

三种对齐/强化学习算法的核心差异与适用场景?

面试官 · Agent 岗面试现场

先给结论

如果有可验证的客观奖励,例如数学计算结果、代码执行状态或工具调用反馈,并且具备相应的算力支持,首选 GRPO 算法,这也是当前推理模型训练的主流选择。如果手里只有现成的人类偏好对比数据,且业务要求快速上线验证,选 DPO。如果任务需要精细的控制与在线探索,并且团队有深厚的强化学习工程积累,选 PPO。这三种算法的本质区别在于对数据类型和计算资源的依赖程度。DPO 是对偏好数据的离线拟合,PPO 是完整的在线强化学习探索,而 GRPO 则是在特定场景下通过剥离价值网络来实现资源与效果平衡的变体。

逐项对比

对比维度PPOGRPODPO
定位在线强化学习完整形态去除价值网络的 PPO 变体离线偏好优化
强项样本效率高,可控性强节省显存,适用于推理任务简单稳定,训练成本低
弱项调参困难,显存占用高依赖自动判分,全对全错无梯度探索能力弱,对数据质量敏感
典型场景需精细控制与在线探索的任务数学、代码、工具调用等推理任务快速迭代、基于人类偏好的任务
成本最高,需维护四个模型中等,省去同规模价值网络最低,跳过奖励模型与采样

PPO 作为完整的在线强化学习框架,包含策略模型、价值模型、奖励模型和参考模型四个组件。它通过广义优势估计计算奖励,并结合截断目标与相对熵约束更新参数。这种结构带来了高样本效率与强可控性,但也使得显存占用庞大且调参过程十分复杂。

GRPO 针对 PPO 的显存开销做出了取舍,直接移除了价值模型。它采用同一个提示词进行组内多次采样,将相对排名作为优势进行组内均值归一化处理。这种设计省去了训练和部署一个同规模网络的成本。不过,GRPO 的应用前提是任务必须具备可自动判分的奖励信号。如果组内采样结果出现全对或全错的情况,模型将无法获得梯度,通常需要配合动态采样等策略进行改进。

DPO 完全放弃了在线采样和独立的奖励模型,直接在离线偏好对数据上进行类似监督学习的训练。这种方式虽然简单稳定且成本低廉,但缺乏主动探索未知空间的能力。同时它对数据质量极为敏感,如果偏好数据存在噪声,容易导致被选中和被拒绝的回复概率同时下降。

面试怎么答

遇到这类算法选型问题,先向面试官确认具体的业务条件,包括当前的数据准备情况、算力预算以及任务是否具备客观的评判标准。确认完前置条件后,再按照前文的结论给出对应的算法推荐,并补充说明所选算法的局限性以及相应的弥补方案。

常见的错误答法是脱离具体的业务场景直接比较算法的优劣,或者认为某种新算法可以完全替代旧算法。例如,忽略 DPO 对劣质数据的敏感性而盲目推荐 DPO,或者在没有自动判分规则的开放式对话任务中强行套用 GRPO。对齐算法没有绝对的优劣之分,只有在特定约束条件下的合理选择。

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。