Q913训练与微调真题解析LLM 训练AgentAlpha 社区真题库约 9 分钟更新 2026-09-29

预训练和传统监督学习有什么区别

预训练和传统监督学习有什么区别

P0 · llm_training

📊 考点:pretraining

🏷 标签:supervised-learning, transfer-learning

1️⃣ 考察意图

面试官想看的不是“预训练用无标签数据,监督学习用有标签”这种教科书定义,而是你能否从学习范式、数据效率、泛化边界三个维度,讲清楚两者在工程落地中的本质差异。刁钻点在于:很多人会误以为“预训练只是监督学习的更大版本”,忽略了自监督信号设计和规模定律带来的质变。答好了能展示你对 LLM 训练全流程(预训练→SFT→RLHF)的底层理解,以及面对“该不该全量微调”这类决策时的工程直觉。

2️⃣ 标准答

1. 数据来源与信号设计

  • 预训练:使用无标签原始文本(Common Crawl、BooksCorpus 等 TB 级数据),通过自监督任务构造学习信号。典型如 GPT 系列的自回归语言建模(预测下一个 token,用交叉熵损失)、BERT 的掩码语言建模(MLM,预测 [MASK] 位置 token)。信号来自数据本身,无需人工标注。
  • 传统监督学习:依赖人工标注的 (x, y) 对,例如 ImageNet 的类别标签、IMDB 的情感极性。信号由标注者提供,成本高、规模受限(通常百万级)。
  • 工程取舍:自监督信号质量低于人工标注,但规模优势(千亿 token vs 百万样本)使得模型能学到更泛化的统计规律。代价是预训练阶段无法直接优化下游指标,需要后续微调对齐。

2. 学习目标与泛化性

  • 预训练:目标是学习通用语言表示,即 token 间的分布规律、句法结构、世界知识。例如 BERT 的 [CLS] 向量在预训练后,只需一层线性分类器就能在 GLUE 上达到 SOTA。泛化性体现在:同一个预训练 checkpoint 可以适配文本分类、问答、摘要等完全不同任务。
  • 传统监督学习:目标是拟合特定任务的输入-输出映射,例如 ResNet-50 在 ImageNet 上训练后,只能做 1000 类分类。若要迁移到医学影像,必须重新训练或做大量微调。
  • 实际落地的坑:很多人以为“预训练模型直接拿来用就行”,但领域漂移会导致性能暴跌。例如用通用 BERT 做法律文书分类,F1 可能只有 0.6,因为预训练数据中法律文本占比极低。解法:在目标领域数据上做继续预训练(domain-adaptive pretraining),用 MLM 再训 10 万步,F1 可提升至 0.85。

3. 训练范式与规模效应

  • 预训练:遵循规模定律(Scaling Laws),模型参数量、数据量、计算量三者协同增长。例如 GPT-3 175B 参数在 570GB 文本上训练,损失随计算量幂律下降。训练过程是一次投入、多次复用:一个 checkpoint 可被多个下游任务共享。
  • 传统监督学习:通常遵循样本效率曲线,增加数据带来的收益递减(例如 ImageNet 从 100 万张到 1400 万张,top-1 准确率仅提升 3%)。训练是任务绑定的,每个新任务都需要从头或从预训练模型开始。
  • 工程取舍:预训练的计算成本极高(GPT-3 训练成本约 460 万美元),但分摊到每个下游任务后成本极低(微调仅需几小时)。监督学习在小数据场景下更高效(例如 1000 条标注数据即可训练一个分类器),但无法利用大规模无标签数据。

4. 训练流程差异

  • 预训练:分两阶段——预训练(自监督,通用表示)→ 微调(有监督,任务对齐)。微调阶段通常只更新少量参数(如 Adapter、LoRA),或全量微调但学习率极低(1e-5 量级)。
  • 传统监督学习:单阶段端到端训练,从随机初始化或预训练权重开始,直接优化任务损失。

3️⃣ 答题模板(30 秒电梯版)

“这个问题我从数据信号、泛化边界、训练范式三个层面回答。数据层面,预训练用自监督信号(如预测下一个 token),无需标注,规模可达 TB 级;监督学习依赖人工标注,成本高、规模小。泛化层面,预训练学到通用表示,可迁移到多个任务;监督学习通常任务绑定。训练范式层面,预训练遵循规模定律,一次训练多次复用;监督学习样本效率递减。总结一句:预训练通过自监督和规模效应实现了表示学习的质变,但监督学习在小数据、高精度场景下仍有不可替代性。”

4️⃣ 高频追问 & 应对

追问 1:那为什么 GPT-4 还要做 RLHF?这不也是监督学习吗?

RLHF 本质是偏好对齐,不是传统监督学习。传统监督学习拟合的是“正确答案”,RLHF 拟合的是“人类偏好排序”。数据形式不同:RLHF 使用对比对(好回答 vs 差回答),而非绝对标签。训练目标也不同:RLHF 用 PPO 优化奖励模型,鼓励模型生成高奖励的 token 序列,而不是最小化交叉熵。工程上,RLHF 的 reward hacking 问题很常见——模型学会生成“看起来好但实际空洞”的回答,需要配合 KL 散度约束(如 GRPO 中的 clip 机制)来抑制。

追问 2:预训练模型在垂直领域效果差,你怎么办?

核心是领域自适应。第一步做 domain-adaptive pretraining:用目标领域文本(如医疗病历、法律文书)继续 MLM 预训练,数据量至少 10 万篇文档,训练步数 5-10 万步。第二步做 task-adaptive fine-tuning:用少量标注数据微调,学习率 2e-5,batch size 32。如果数据量极少(<1000 条),考虑用检索增强生成(RAG)替代微调,从外部知识库检索相关片段,避免模型遗忘预训练知识。坑:领域数据质量差(如 OCR 错误、格式混乱)会导致预训练损失不降,需要先做数据清洗(去重、拼写纠正)。

追问 3:预训练和自监督学习是什么关系?

预训练是训练范式,自监督学习是实现手段。预训练阶段通常使用自监督任务(如 MLM、对比学习),但也可以用弱监督(如利用 HTML 标签)或生成式任务(如 T5 的 span corruption)。自监督学习不限于预训练,例如 SimCLR 在图像领域做对比学习,也是自监督但规模较小。关键区别:预训练强调通用表示和规模效应,自监督学习更关注信号设计。面试官可能想听你区分“预训练是目标,自监督是工具”。

5️⃣ 避坑 · 常见错误答法

  • ❌ “预训练就是无监督学习,监督学习就是有监督学习。” → ✅ “预训练使用自监督信号(如预测下一个 token),不是无监督(无监督通常指聚类、降维)。自监督的标签来自数据本身,但训练目标是有监督的(交叉熵损失)。”
  • ❌ “预训练模型可以直接用,不需要微调。” → ✅ “预训练模型学的是通用分布,直接推理(zero-shot)效果通常差于微调。例如 BERT 直接做情感分类,准确率可能只有 50%(随机),微调后可达 95%。只有 GPT-3 等超大模型在 prompt 工程下才能 zero-shot 达到可用水平。”
  • ❌ “预训练数据越多越好,没有上限。” → ✅ “数据质量比数量更重要。重复数据、噪声数据会导致模型过拟合或灾难性遗忘。例如 GPT-3 训练时去重后性能提升 5%。规模定律的前提是数据是高质量、多样化的。”

6️⃣ 简历呼应

  • 如果你有 RAG 项目:从“预训练 vs 监督学习”切入,对比 RAG 中检索器(预训练 embedding 模型)和生成器(微调 LLM)的训练差异。强调预训练 embedding 的通用性(如 BGE-M3 支持多语言)和微调生成器的任务对齐(如用 QA 对微调)。
  • 如果你只做过传统 NLP:用“词向量预训练(Word2Vec)→ 下游分类器”类比,说明预训练+微调范式的历史演进。对比 Word2Vec 的静态表示和 BERT 的动态表示,突出预训练从“特征提取”到“表示学习”的质变。
  • 如果你是校招无项目:聚焦 Hugging Face 的 transformers 库,用 BERT 在 IMDB 上做预训练+微调 demo,记录 loss 曲线和准确率。强调你理解“预训练是通用表示,微调是任务对齐”的工程含义,并对比从头训练(随机初始化)的差距。

7️⃣ 延伸阅读

  • 《Scaling Laws for Neural Language Models》(Kaplan et al., 2020)
  • 《BERT: Pre-training of Deep Bidirectional Transformers》(Devlin et al., 2019)
  • 《Language Models are Few-Shot Learners》(GPT-3, Brown et al., 2020)
  • 《LoRA: Low-Rank Adaptation of Large Language Models》(Hu et al., 2021)
  • 《RAG: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》(Lewis et al., 2020)

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。