训练与微调Agentic RLSFT速答 · 约 6 分钟更新 2026-09-28

Agentic RL 和 SFT 训出来的 Agent 有什么区别?什么时候值得上 RL?

一句话结论

SFT 学的是模仿标注轨迹,只会数据里见过的路径;Agentic RL 让模型在环境里多步试错、按任务成败拿奖励,能长出标注数据没有的策略。代价是要有能自动判分的环境、不容易被钻空子的奖励设计,训练门槛远高于 SFT。

先这样答

SFT 的数据是「专家怎么做的」完整轨迹,模型学的是逐步模仿。它的上限就是数据覆盖:见过的任务路径能走,没见过的状态容易乱,因为它从来没被要求「自己想办法」。Agentic RL 换了一种训练信号:不给标准轨迹,让模型自己在环境里多步行动,用任务结果当奖励——代码题看测试过没过、工具任务看完成没完成——结果好的行动序列被加强,差的被削弱。模型因此可能探索出标注数据里没有的解法,比如新的工具组合和规划方式。

但前提条件苛刻,这也是「什么时候值得上」的判断标准:第一,环境要能自动判分,结果可验证的任务(代码、数学、有明确完成标准的操作)才有的放矢,开放式对话很难定义奖励;第二,奖励要经得起钻空子,模型会找「拿分但不解决问题」的捷径,奖励设计要和评测对抗着改;第三,训练成本和稳定性门槛远高于 SFT,多步交互的采样量、环境吞吐都要跟上。多数业务场景,SFT 加提示词工程已经够用,别为了 RL 而 RL。

面试官会怎么追问

  • 「为什么不直接 SFT 大量轨迹,非要用 RL?」 SFT 有模仿上限:数据覆盖不到的状态它不会应对,轨迹数据再多也补不全所有分支。RL 的价值在探索出数据外的新策略,尤其是多步规划与工具组合这类组合空间爆炸的任务。
  • 「reward hacking 能举个例子吗?」 自动判分写得松,模型就绕过任务直接迎合判分器:比如代码题的测试用例没有随机数据,模型记住固定输入的预期输出硬编码返回。防法是奖励设计对抗迭代:判分加随机化、加过程校验,评测集定期换血。
  • 「Agentic RL 的工程量在哪?」 不在算法公式,在环境:任务怎么下发、动作怎么执行、结果怎么回传、奖励怎么自动算,这套环境的吞吐和正确性决定训练能不能转起来。面试里能讲清环境设计的坑,比背算法名更加分。

回答的坑

  • 说「RL 全面比 SFT 好」。RL 成本高、训练不稳,适用面窄在「结果可自动验证」的任务上;答成全面取代说明没做过训练。
  • 只谈算法不谈环境。Agentic RL 落地的大头是环境与奖励工程,环境判分不可靠,训练再久也是负优化,这一点主动说出来才是做过的人。
—— 本题完 ——