Q21LLM 基础概念对比选型AgentAlpha 社区约 6 分钟更新 2026-09-29

预训练 vs SFT vs RLHF:三阶段各在干什么

预训练进知识、SFT 教格式、RL 调质量。这篇给三阶段的边界对比表与「跳级和错位」两类常见误区。

面试官原题

大模型训练三个阶段的边界与衔接?

面试官 · Agent 岗面试现场

先给结论

大模型训练的三个阶段各司其职,呈严格的递进关系。如果需要让模型从零掌握语言规律与世界知识,决定模型的能力底子,必须选择预训练。如果模型已有知识储备但听不懂指令或无法按格式输出,应选择SFT,用高质量的示范数据教它完成任务。如果模型已经能按指令作答,但需要进一步对齐人类偏好或强化正确的路径,把会做变成做得好,则选择RLHF阶段。知识进参数靠预训练,行为格式靠SFT,质量取舍靠RLHF,三者不可跳级或错位。

逐项对比

对比维度预训练SFTRLHF
定位海量无标注语料上的下一词预测指令回答对上的监督微调基于偏好或可验证奖励的继续优化
强项学习语言规律与世界知识教模型听懂指令并按格式完成任务对齐人类偏好并强化正确路径
弱项无法直接响应人类指令改变行为但不注入可靠知识依赖SFT基础否则无正样本
典型场景决定模型的底子与能力上限规范输出格式与行为模式把会做调到做得好
成本最高,不可频繁重做较低,上限取决于数据质量较高,依赖奖励模型或偏好数据

这三个阶段在训练目标与作用机制上存在本质差异。预训练是模型的基础,它通过海量无标注语料的下一词预测任务,将语言规律与世界知识压缩进参数中。该阶段成本最高,决定了模型的能力底子与上限,不可频繁重做。

SFT阶段的核心是行为规范。它通过人工构造的指令与回答示范,教导模型将已有知识转化为符合预期的输出格式。SFT主要改变行为模式,不负责注入可靠新知识。若试图用SFT灌输新知识,往往达不到预期效果,因为SFT的上限由数据的正确示范质量决定。

RLHF阶段是在SFT基础上进行质量拔高。它不是简单地堆砌数据,而是将优化目标切换为奖励或偏好驱动。就像雕刻家在粗胚上做精细打磨,RLHF负责把模型从会做调整为做得好。该阶段必须依赖SFT赋予的基本能力,若跳过SFT直接进行强化学习,模型将很难找到正样本。

面试怎么答

遇到此类问题,建议先明确三阶段核心目标,再按顺序阐述衔接关系。指出预训练负责知识注入,SFT负责行为格式规范,RLHF负责质量取舍。重点说明为何不能错位,强调SFT不适合注入新知识,且RLHF必须依赖SFT的基础。

常见的错误答法是把RLHF描述为继续训练更多数据。答题时必须指出,RLHF的本质是优化目标的转换——从预测下一词变为偏好驱动。同时避免混淆边界,切忌提出没SFT直接做强化学习的错误思路。

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。