11其mask相对于CBOW有什么异同点
1️⃣ 考察意图
面试官想考察你能否穿透“都是预测词”的表象,精准区分浅层静态词向量(CBOW)与深层动态预训练(MLM)在架构、训练目标和表示能力上的本质差异。这是典型的概念对比+工程取舍题,刁钻点在于:很多人只背了“CBOW是浅层、MLM是深层”,却说不清为什么MLM必须用mask而非直接预测、以及mask带来的训练-推理不一致问题。答好了能展示你对NLP模型演进逻辑的深刻理解,以及处理预训练任务中工程trick(如mask策略、位置编码)的实战经验。
2️⃣ 标准答
核心差异:从“统计共现”到“双向上下文建模”
CBOW(Continuous Bag of Words)和MLM(Masked Language Model)虽然都基于上下文预测词,但代表了两个时代的范式。下面从架构、训练目标、表示能力、工程细节四个维度拆解。
1. 架构与信息流
- CBOW:浅层神经网络(输入层→投影层→输出层)。上下文词向量通过平均或求和聚合,无自注意力机制。本质是局部窗口内的共现统计,窗口大小通常5-10词。
- MLM:基于Transformer Encoder,通过自注意力实现全序列双向交互。每个token的表示能直接看到所有位置(包括未来词),依赖位置编码(如RoPE或绝对位置编码)区分顺序。
2. 训练目标与mask机制
- CBOW:预测单个中心词。输入是上下文词(无mask),输出是softmax分类。梯度更新时所有输入词都可见,训练稳定。
- MLM:随机mask掉15%的token,预测多个被遮住的词。关键设计:
- 80%替换为
[MASK],10%替换为随机词,10%保持不变。这是为了缓解预训练-微调不一致([MASK]在微调时不存在)。 - 预测时每个mask位置独立计算损失,但通过自注意力共享上下文信息。
3. 表示能力对比
| 维度 | CBOW | MLM |
|---|---|---|
| 词向量类型 | 静态(每个词一个向量,无法消歧) | 动态(同一词在不同上下文有不同向量) |
| 长距离依赖 | 受窗口限制,无法捕获长程语义 | 通过自注意力,理论上可建模任意距离 |
| 多义词处理 | 无法区分“苹果”(水果/公司) | 根据上下文自动区分 |
| 计算成本 | 低(O(窗口大小×V)) | 高(O(L²×d)),L为序列长度 |
4. 实际落地的坑与解法
- 坑1:MLM的mask策略导致训练-推理不一致。在微调阶段没有
[MASK],模型可能对未见模式过拟合。解法:使用80-10-10策略,并引入Whole Word Masking(如BERT-wwm)或Span Masking(如SpanBERT),让模型学会从部分可见信息推理。 - 坑2:CBOW的窗口大小选择。窗口太小丢失远距离共现,太大引入噪声。工程取舍:通常设5-10,但高频词(如“the”)可设更小窗口,低频词设更大——这需要动态窗口策略,但实现复杂,多数实现直接固定。
- 坑3:MLM的batch内mask比例控制。如果序列长度差异大,短序列的mask数量可能不足。解法:使用动态padding,按batch内最长序列填充,并确保每个序列至少mask 1个token。
总结:MLM通过mask机制实现了真正的双向上下文建模,但付出了计算成本和训练-推理不一致的代价;CBOW简单高效,但表示能力有限。现代NLP几乎全面转向MLM,但在资源受限场景(如移动端词向量检索)CBOW仍有价值。
3️⃣ 答题模板(30 秒电梯版)
“这个问题我从架构、训练目标、表示能力三个层面回答。架构上,CBOW是浅层平均聚合,MLM基于Transformer自注意力实现双向交互;训练目标上,CBOW预测单个中心词,MLM通过mask策略预测多个被遮词,并引入80-10-10策略缓解不一致;表示能力上,CBOW输出静态词向量,MLM输出上下文动态表示。总结一句:MLM是CBOW在深度和双向性上的革命性升级,但计算成本更高,且需要精心设计mask策略。”
4️⃣ 高频追问 & 应对
追问 1:为什么MLM不直接像CBOW那样预测所有词,而要用mask?
直接预测所有词会导致信息泄露:如果模型看到完整句子,它只需复制输入就能“预测”正确,学不到语义。Mask强制模型从受损输入中推理,类似完形填空。但mask也带来问题:预训练和微调输入分布不同。所以有了80-10-10策略:80%替换为[MASK]让模型学习推理,10%随机词防止模型过度依赖[MASK]标记,10%不变让模型保持对原始输入的敏感度。这是典型的训练-推理不一致工程取舍。
追问 2:CBOW和MLM在词义消歧上的差距有多大?能举个具体例子吗?
差距显著。以“苹果”为例:CBOW在训练后只有一个向量,无论上下文是“吃苹果”还是“买苹果手机”,向量相同。MLM在“苹果”被mask时,如果上下文是“吃__”,注意力会加权“吃”和周围词,生成偏向水果的表示;如果上下文是“__手机”,则生成偏向公司的表示。在词相似度任务(如WordSim-353)上,CBOW的Spearman相关系数约0.6-0.7,而BERT-base可达0.8-0.9。但注意:MLM的消歧能力依赖上下文长度,短文本(如搜索query)中优势会减弱。
追问 3:如果让你在资源受限场景(如手机端)部署词向量,你会选CBOW还是MLM?为什么?
选CBOW。原因有三:1)CBOW模型小(仅嵌入层+投影层),推理只需查表+平均,延迟<1ms;MLM需要完整Transformer推理,即使蒸馏版(如TinyBERT)也有几十毫秒延迟。2)CBOW词向量可离线计算并缓存,MLM必须在线推理。3)如果任务只是简单的词相似度或聚类,CBOW足够。但若任务需要上下文消歧(如意图识别),则必须用MLM,此时可考虑量化+剪枝压缩模型。工程取舍:在准确率和延迟之间,CBOW是“够用就好”的选择。
5️⃣ 避坑 · 常见错误答法
- ❌ 说“CBOW和MLM都是预测词,所以本质一样” → ✅ 正确切入:虽然都是预测,但CBOW是浅层统计共现,MLM是深层双向建模,mask机制是核心差异,导致表示能力天差地别。
- ❌ 说“MLM的mask是随机选的,没有策略” → ✅ 正确切入:MLM有精心设计的mask策略(80-10-10、Whole Word Masking、Span Masking),目的是缓解训练-推理不一致,这是工程细节的体现。
- ❌ 说“CBOW没有位置信息,所以完全无法处理词序” → ✅ 正确切入:CBOW确实无位置编码,但通过窗口内词的平均/求和,仍能捕获局部共现顺序(如“猫追老鼠”和“老鼠追猫”的共现模式不同),只是无法建模长距离依赖。
6️⃣ 简历呼应
- 如果你有预训练模型项目:从“我在BERT微调时遇到过mask策略导致的过拟合,通过调整mask比例缓解”切入,展示对MLM工程细节的实战理解。
- 如果你只做过传统NLP(如Word2Vec+分类):用“CBOW相当于局部窗口的n-gram统计,MLM相当于全局双向的Transformer”类比,强调从统计到深度学习的演进逻辑。
- 如果你是校招无项目:聚焦“在相同语料上复现CBOW和BERT-small,对比词相似度任务结果”的demo,说明你理解静态vs动态表示的量化差异。
- 《Efficient Estimation of Word Representations in Vector Space》(Mikolov et al., 2013)——CBOW原始论文
- 《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》(Devlin et al., 2019)——MLM原始论文
- 《SpanBERT: Improving Pre-training by Representing and Predicting Spans》(Joshi et al., 2020)——Span Masking策略
- 《RoBERTa: A Robustly Optimized BERT Pretraining Approach》(Liu et al., 2019)——动态mask策略
- 博客:The Illustrated BERT(Jay Alammar)——图解MLM与mask机制