| Q115 | What is the significance of self-supervised learning in LLM pretraining
1️⃣ 考察意图
面试官想考察你对 LLM 预训练核心机制的理解深度,而非简单背诵“自监督学习”的定义。这是一道“背概念 + 工程取舍”混合题。刁钻点在于:候选人常把“自监督”等同于“无监督”,或只提 Next Token Prediction 却说不清它为何能学到世界知识。答好了能展示:① 对预训练目标函数本质的洞察(如为什么 NTP 比 MLM 更适合生成式 LLM);② 对数据效率与模型能力的 trade-off 理解(如自监督的“虚假相关性”问题);③ 对 Scaling Law 背后自监督信号密度变化的认知。这是区分“背八股”和“真懂预训练”的关键题。
2️⃣ 标准答
自监督学习(Self-Supervised Learning, SSL)在 LLM 预训练中的核心意义是:从无标注文本中自动构造监督信号,驱动模型学习语言的内在规律,从而在参数量和数据量上实现规模化扩展。没有 SSL,GPT-4 级别的模型不可能存在。
具体从三个层面展开:
1. 核心机制:从数据本身生成标签
- Next Token Prediction (NTP):这是 GPT 系列(GPT-2/3/4, LLaMA, Qwen)的核心。模型看到前
t-1个 token,预测第t个 token。标签就是文本本身,无需人工标注。 - Masked Language Modeling (MLM):BERT 和 RoBERTa 使用。随机 mask 15% 的 token,模型预测被遮住的 token。这本质上是“完形填空”。
- 对比学习变体:如 SimCSE、DeCLUTR,通过构造正负样本对(如同一个句子的不同 dropout mask 输出为正例),学习句子级表示。这在 embedding 模型(如 BGE、E5)预训练中常见。
2. 为什么 NTP 能学到世界知识?
- 压缩即智能:NTP 迫使模型学习数据的概率分布
P(x_t | x_<t)。为了准确预测下一个 token,模型必须隐式编码语法(主谓宾结构)、语义(“苹果”后面常跟“吃”或“手机”)、事实知识(“爱因斯坦”后面是“相对论”)。 - 长程依赖:Transformer 的 attention 机制让模型能捕捉数千 token 的上下文。例如,预测“法国首都”后的 token,模型需记住前文提到的“法国”。这迫使模型建立实体关系图谱。
- Scaling Law 的燃料:自监督信号密度极高——每个 token 都是一个训练样本。对于 1T token 的语料,NTP 产生 1T 个预测任务。这直接驱动了 Scaling Law:模型越大、数据越多,性能越好。
3. 工程取舍与落地坑
- Trade-off:NTP vs. MLM:NTP 是单向(causal)的,适合生成任务;MLM 是双向的,适合理解任务。但 MLM 在预训练中引入了
[MASK]token,导致预训练-微调不一致(pretrain-finetune discrepancy)。GPT 系列选择 NTP 统一框架,牺牲部分双向理解能力,换取生成流畅性和架构简洁性。 - 实际坑:虚假相关性:自监督任务可能学到“捷径”。例如,在代码补全中,模型可能学会预测“
}”紧跟“{”,而不理解代码逻辑。解法:引入代码执行反馈(如 CodeRL 中的单元测试奖励)或使用 GRPO(Group Relative Policy Optimization)进行强化学习后训练,打破纯自监督的局限。 - 数据质量 > 数量:自监督不保证学到有用知识。如果语料全是“今天天气真好”重复 1 亿次,模型只会学会复读。解法:数据去重(MinHash)、质量过滤(基于 fastText 分类器)、多样性采样(如 The Pile 的文档级别去重)。
3️⃣ 答题模板(30 秒电梯版)
“这个问题我从三个层面回答:第一,自监督学习的核心是自动构造监督信号,LLM 中最典型的是 Next Token Prediction,它把无标注文本变成了无限训练数据。第二,NTP 之所以能学到世界知识,是因为准确预测下一个 token 需要模型隐式编码语法、语义和事实关系,这直接驱动了 Scaling Law。第三,关键取舍在于 NTP 单向 vs. MLM 双向,以及如何通过数据清洗和强化学习避免虚假相关性。总结一句:自监督学习是 LLM 预训练的基石,它用数据本身的信号实现了模型能力的规模化扩展。”
4️⃣ 高频追问 & 应对
追问 1:自监督学习和无监督学习有什么区别?为什么 LLM 预训练不用无监督?
自监督学习是监督学习的一个子集,标签来自数据本身(如 NTP 的标签是下一个 token);无监督学习没有标签,目标是发现数据内在结构(如聚类、降维)。LLM 预训练不用纯无监督,因为:① 无监督方法(如 K-means)无法直接生成文本;② 自监督提供了明确的损失函数(交叉熵),梯度信号强,训练稳定;③ 无监督的评估指标(如轮廓系数)与下游任务关联弱,而自监督的 perplexity 直接反映语言建模能力。
追问 2:如果语料全是英文,自监督预训练能学到中文知识吗?
不能直接学到。自监督学习依赖数据分布。如果语料只有英文,模型学到的 token 概率分布
P(token | context)只包含英文模式。但通过多语言预训练(如 mBERT、XLM-R),模型可以在共享的 embedding 空间中学到跨语言对齐(如“猫”和“cat”的向量相近)。这需要语料中包含平行语料或代码切换(code-switching)数据。纯英文语料训练出的模型对中文是“零样本”,性能极差。
追问 3:自监督预训练后,为什么还需要 RLHF 或 SFT?
自监督目标(NTP)优化的是“下一个 token 的预测准确率”,而非“有用性”或“安全性”。这导致两个 gap:① 能力 gap:模型学会了语言模式,但不知道如何遵循指令(如“用中文回答”)。SFT 通过人工标注的指令-回复对,教会模型“对话格式”。② 对齐 gap:NTP 可能学到有害模式(如生成歧视性内容)。RLHF 通过人类偏好反馈,用 PPO 或 GRPO 优化模型,使其输出更符合人类价值观。自监督提供基础能力,SFT 和 RLHF 做能力定向和对齐。
5️⃣ 避坑 · 常见错误答法
- ❌ 说“自监督学习就是无监督学习,因为都不需要人工标注” → ✅ 区分清楚:自监督是构造伪标签(如 NTP 的 token 预测),无监督是发现结构(如聚类)。LLM 预训练是自监督,不是无监督。
- ❌ 只提 BERT 的 MLM,不提 GPT 的 NTP → ✅ 必须覆盖两种主流范式,并说明 NTP 为何成为生成式 LLM 的主流(架构统一、Scaling Law 友好)。
- ❌ 说“自监督学习完美解决了数据标注问题,没有缺点” → ✅ 指出虚假相关性、预训练-微调不一致等坑,并给出解法(数据清洗、RLHF)。
6️⃣ 简历呼应
- 如果你有 RAG 项目:从“自监督预训练 vs. 检索增强”角度切入。强调自监督让模型学会语言先验,但 RAG 补充了实时知识。可以提你在项目中如何用自监督预训练的 embedding 模型(如 BGE)做检索,再结合 LLM 生成。
- 如果你只做过传统 NLP:用“自监督 vs. 监督学习”类比迁移。例如,传统情感分类需要标注数据,而自监督预训练让模型从无标注文本中学会情感表示,微调时只需少量样本。提你如何用 BERT 做 few-shot 分类。
- 如果你是校招无项目:聚焦论文复现。提你复现了 GPT-2 在 WikiText-103 上的预训练,对比了 NTP 和 MLM 的 perplexity 差异,并分析了自监督信号密度对收敛速度的影响。展示你对 Scaling Law 的理解。
- 《Language Models are Unsupervised Multitask Learners》(GPT-2 论文)
- 《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》
- 《Scaling Laws for Neural Language Models》(Kaplan et al., 2020)
- 《Training Language Models to Follow Instructions with Human Feedback》(InstructGPT 论文)
- 《DeCLUTR: Deep Contrastive Learning for Unsupervised Textual Representations》