五厂面经真题集美团面经高频百度面经高频腾讯面经高频大模型训练对齐训练美团真题速答 · 约 5 分钟更新 2026-09-29

大模型训练有哪些步骤?

一句话结论

大模型训练通常分四阶段:预训练学语言与知识,SFT 学指令行为,RLHF 或 DPO 做偏好对齐,最后按业务需要用领域数据微调。

先这样答

大模型训练通常分四个阶段:预训练、监督微调、偏好对齐和领域适配。前三个阶段构成主流程,领域适配按业务需要选择。

第一阶段是预训练。模型使用海量无标注语料学习语言规律和知识。数据通常是没有人工指令标注的文本。目标是让模型具备理解和生成语言的基础能力。

第二阶段是监督微调,也就是 SFT。训练数据是带有指令和答案的监督数据。模型学习怎样理解任务要求,并按照指定的行为和格式作答。

第三阶段是偏好对齐。常见方法包括 RLHF 和 DPO。训练数据体现人或标注者对不同回答的偏好。目标是让模型学会价值判断,输出更符合要求的回答。

第四阶段是领域适配。这一步不是所有项目都必须做。团队可以使用业务数据继续微调,让模型适应具体领域和任务。算力占比上,预训练承担最大量级,SFT、偏好对齐和领域适配相对较少,具体比例要看数据规模和业务目标。

面试官会怎么追问

  • 「预训练和 SFT 的数据有什么区别?」 预训练使用海量无标注语料,模型从中学习语言与知识。SFT 使用带有指令和答案的监督数据。前者建立基础能力,后者训练行为和输出格式。

  • 「RLHF 和 DPO 在训练流程里解决什么问题?」 两者都用于偏好对齐。数据需要体现不同回答之间的偏好。训练目标是让模型学会价值判断,使输出更符合人的要求。

  • 「领域适配是不是每次训练都必须做?」 不是。领域适配属于可选阶段。只有当业务有明确的领域数据和任务要求时,才使用业务数据继续微调模型。

回答的坑

  • 不要把预训练、SFT、偏好对齐和领域适配混成同一种训练,因为它们使用的数据形态和训练目标不同。

  • 不要随口报固定的算力比例,应该先说明预训练占主要量级,再说明具体比例取决于数据规模和业务目标。

—— 本题完 ——