LLM 基础概念LLM 基础后训练速答 · 约 5 分钟更新 2026-09-19

预训练完的模型为什么不能直接用?后训练补了什么

一句话结论

预训练产出的是一个续写器:会语言、有知识,但不会以助手身份对话。后训练用 SFT 和偏好对齐把续写能力改造成会听话、答得好的产品形态,这一步决定好不好用。

先这样答

直接用会有个很具体的问题:预训练的目标是「给前文续写下一个 token」,模型学到的全部本领都围着这个目标转。你问「法国首都是哪」,它可能续写出更多类似的问题,或者接着百科的文风往下写,就是不回答你。它有语言能力和世界知识,但没学过「以助手身份回应人」这个行为。

后训练补的就是这个行为。第一步是监督微调(SFT),用人工写的高质量问答对训练,让模型学会指令该接什么样的回答、助手的角色怎么扮演。第二步是偏好对齐(RLHF 或 DPO),用人类对多个回答的比较数据,把回答往人喜欢的方向调:更有用、更安全、格式更干净。这两步用的数据量远小于预训练,但产品里那个能好好对话的模型,就是基座模型经过这两步变出来的。基座决定能力上限,后训练决定好不好用。

注意边界:后训练主要改行为和风格,不是灌输新知识,事实知识主要在预训练阶段进来;给模型补外部知识,靠的是 RAG 或继续预训练,不是后训练。

面试官会怎么追问

  • 「SFT 数据从哪来,要多少?」 来源有人工撰写、模型生成加人工审核、真实对话清洗,各家路线不同。要点在质量不在数量:这个阶段质量远比规模重要,数据里的坏习惯会被模型学走,混入低质量数据效果不升反降。
  • 「为什么有的模型对齐之后反而变笨?」 这是对齐税:让模型拒答敏感问题、回避风险的同时,一些无害问题的回答也变得保守,部分能力受损。对齐强度是设计取舍,调得越紧代价越明显,不是只有收益没有成本。
  • 「基座模型和 chat 模型怎么选?」 做研究、继续训练、自己掌控后训练流程,选基座;直接做产品、要开箱能对话,选经过后训练的 chat 模型。自己从基座开始做后训练,好处是可控,成本是要自建数据和评估。

回答的坑

  • 把后训练说成「训练的第二轮,继续学知识」。两个阶段的目标函数和数据完全不同:预训练学语言和知识,后训练学行为和偏好,混为一谈会答不到点上。
  • 认为后训练能弥补预训练的不足。后训练是把已有能力调成好用的形态,不能无中生有;基座不行,后训练救不回来。
—— 本题完 ——