五厂面经真题集DeepSeek面经高频DeepSeek真题强化学习推理模型速答 · 约 5 分钟更新 2026-09-29

DeepSeek R1 的核心创新点是什么?

一句话结论

DeepSeek R1 以纯强化学习激发推理行为,用 GRPO 降低训练成本,再通过多阶段训练和蒸馏兼顾能力、稳定性与小模型迁移。

先这样答

DeepSeek R1 的核心创新,是用强化学习激发模型的推理行为,再用多阶段训练把这种能力变得稳定、可用,并通过蒸馏迁移给小模型。这里要先区分 R1-Zero 和 R1。R1-Zero 走纯 RL 路线。它不依赖 SFT 冷启动,也能涌现长思维链。这验证了推理行为可以由强化学习直接激发。R1 则在这条路线之上加入冷启动数据和后续训练阶段,解决实际使用中的稳定性问题。

算法层面,R1 使用 GRPO。它在同一组回答中计算相对优势,并省去价值网络。训练流程分为四步。先做冷启动 SFT,再做面向推理的 RL。然后用拒绝采样生成新的 SFT 数据,最后做全场景 RL。这个流程既保留推理能力,也覆盖更多任务场景。R1 还把推理能力蒸馏给小模型。小模型因此可以继承大模型形成的推理模式。

面试官会怎么追问

  • 「R1-Zero 和 R1 到底是什么关系?」 R1-Zero 负责验证纯 RL 路线。它说明模型不靠 SFT 冷启动,也能涌现长思维链。R1 继承这条路线,但加入冷启动 SFT 和多阶段训练,让推理能力更稳定,也更适合实际任务。

  • 「GRPO 为什么能省掉价值网络?」 GRPO 不单独训练价值网络来估计优势。它对同一组回答做相对比较,再计算组内相对优势。这样可以直接为策略更新提供信号,并减少价值网络带来的训练负担。

  • 「为什么纯 RL 之后还要补 SFT 和全场景 RL?」 纯 RL 已经能激发推理行为,但 R1 还需要稳定输出并覆盖更多场景。冷启动 SFT 提供初始基础。拒绝采样把较好的推理结果转成新 SFT 数据。全场景 RL 再处理不同任务下的整体表现。

回答的坑

  • 不要把 R1-Zero 和 R1 说成同一个训练流程,前者验证纯 RL 涌现推理,后者加入冷启动和多阶段训练。

  • 不要只答长思维链,还要覆盖 GRPO、多阶段训练和小模型蒸馏,否则答案缺少完整结构。

—— 本题完 ——