先这样答
大模型训练通常分四个阶段:预训练、监督微调、偏好对齐和领域适配。前三个阶段构成主流程,领域适配按业务需要选择。
第一阶段是预训练。模型使用海量无标注语料学习语言规律和知识。数据通常是没有人工指令标注的文本。目标是让模型具备理解和生成语言的基础能力。
第二阶段是监督微调,也就是 SFT。训练数据是带有指令和答案的监督数据。模型学习怎样理解任务要求,并按照指定的行为和格式作答。
第三阶段是偏好对齐。常见方法包括 RLHF 和 DPO。训练数据体现人或标注者对不同回答的偏好。目标是让模型学会价值判断,输出更符合要求的回答。
第四阶段是领域适配。这一步不是所有项目都必须做。团队可以使用业务数据继续微调,让模型适应具体领域和任务。算力占比上,预训练承担最大量级,SFT、偏好对齐和领域适配相对较少,具体比例要看数据规模和业务目标。
面试官会怎么追问
-
「预训练和 SFT 的数据有什么区别?」 预训练使用海量无标注语料,模型从中学习语言与知识。SFT 使用带有指令和答案的监督数据。前者建立基础能力,后者训练行为和输出格式。
-
「RLHF 和 DPO 在训练流程里解决什么问题?」 两者都用于偏好对齐。数据需要体现不同回答之间的偏好。训练目标是让模型学会价值判断,使输出更符合人的要求。
-
「领域适配是不是每次训练都必须做?」 不是。领域适配属于可选阶段。只有当业务有明确的领域数据和任务要求时,才使用业务数据继续微调模型。
回答的坑
-
不要把预训练、SFT、偏好对齐和领域适配混成同一种训练,因为它们使用的数据形态和训练目标不同。
-
不要随口报固定的算力比例,应该先说明预训练占主要量级,再说明具体比例取决于数据规模和业务目标。
同系列的题