先给结论
大模型训练的三个阶段各司其职,呈严格的递进关系。如果需要让模型从零掌握语言规律与世界知识,决定模型的能力底子,必须选择预训练。如果模型已有知识储备但听不懂指令或无法按格式输出,应选择SFT,用高质量的示范数据教它完成任务。如果模型已经能按指令作答,但需要进一步对齐人类偏好或强化正确的路径,把会做变成做得好,则选择RLHF阶段。知识进参数靠预训练,行为格式靠SFT,质量取舍靠RLHF,三者不可跳级或错位。
逐项对比
| 对比维度 | 预训练 | SFT | RLHF |
|---|---|---|---|
| 定位 | 海量无标注语料上的下一词预测 | 指令回答对上的监督微调 | 基于偏好或可验证奖励的继续优化 |
| 强项 | 学习语言规律与世界知识 | 教模型听懂指令并按格式完成任务 | 对齐人类偏好并强化正确路径 |
| 弱项 | 无法直接响应人类指令 | 改变行为但不注入可靠知识 | 依赖SFT基础否则无正样本 |
| 典型场景 | 决定模型的底子与能力上限 | 规范输出格式与行为模式 | 把会做调到做得好 |
| 成本 | 最高,不可频繁重做 | 较低,上限取决于数据质量 | 较高,依赖奖励模型或偏好数据 |
这三个阶段在训练目标与作用机制上存在本质差异。预训练是模型的基础,它通过海量无标注语料的下一词预测任务,将语言规律与世界知识压缩进参数中。该阶段成本最高,决定了模型的能力底子与上限,不可频繁重做。
SFT阶段的核心是行为规范。它通过人工构造的指令与回答示范,教导模型将已有知识转化为符合预期的输出格式。SFT主要改变行为模式,不负责注入可靠新知识。若试图用SFT灌输新知识,往往达不到预期效果,因为SFT的上限由数据的正确示范质量决定。
RLHF阶段是在SFT基础上进行质量拔高。它不是简单地堆砌数据,而是将优化目标切换为奖励或偏好驱动。就像雕刻家在粗胚上做精细打磨,RLHF负责把模型从会做调整为做得好。该阶段必须依赖SFT赋予的基本能力,若跳过SFT直接进行强化学习,模型将很难找到正样本。
面试怎么答
遇到此类问题,建议先明确三阶段核心目标,再按顺序阐述衔接关系。指出预训练负责知识注入,SFT负责行为格式规范,RLHF负责质量取舍。重点说明为何不能错位,强调SFT不适合注入新知识,且RLHF必须依赖SFT的基础。
常见的错误答法是把RLHF描述为继续训练更多数据。答题时必须指出,RLHF的本质是优化目标的转换——从预测下一词变为偏好驱动。同时避免混淆边界,切忌提出没SFT直接做强化学习的错误思路。