五厂面经真题集拼多多面经高频拼多多真题RoBERTaBERT速答 · 约 5 分钟更新 2026-09-29

RoBERTa 对 BERT 做了哪些改进?

一句话结论

RoBERTa 去掉 NSP 和 dropout,引入动态 mask、字节级 BPE,并用更大 batch 和更多数据证明 BERT 的核心问题是训练不充分。

先这样答

结论是,RoBERTa 没有大改 BERT 的架构,而是证明了 BERT 训练得不充分。它保留主体架构,调整预训练任务、数据处理和训练配置。核心思路很直接:同样的架构用更多数据、更大 batch 训练,并改掉无益或不必要的设计,效果就会涨。

第一,去掉 NSP 任务,因为这个任务无益。第二,采用动态 mask。每轮训练都会重新随机 mask,不再一直使用同一组遮盖结果。第三,使用更大的 batch 和更多数据。模型因此接受了更充分的训练。这也是 RoBERTa 改进的主线。

第四,去掉 dropout。RoBERTa 的判断是,在大数据训练下不需要它。第五,使用字节级 BPE 处理文本。面试时不要只把这五点背成清单。最后要收束到一句话:RoBERTa 的关键不是发明新架构,而是把 BERT 的训练方案重新做扎实,说明原版 BERT 还有训练不足的问题。

面试官会怎么追问

  • 「为什么要去掉 NSP?」 因为 RoBERTa 认为 NSP 对训练无益。去掉它可以让预训练方案更直接。回答时说清“无益”即可,不要补充底稿之外的实验数字或任务细节。

  • 「动态 mask 和原来的做法有什么区别?」 动态 mask 会在每轮训练时重新随机选择遮盖位置。模型每轮看到的 mask 结果都可能不同。这个变化属于数据处理策略,不是模型架构变化。

  • 「这五点里最核心的改进是什么?」 最核心的不是某个单独技巧,而是更充分地训练同一套架构。更大的 batch、更多数据,以及对训练方案的调整都服务于这条主线。结论就是 BERT 原本没有训练充分。

回答的坑

  • 只罗列五项改动,却不说“BERT 训练不充分”,会让答案像背诵,没有抓住核心。

  • 把 RoBERTa 说成全新的模型架构,或擅自添加实验数字、论文细节和内部信息,都会偏离题目。

这家公司的面经实录

—— 本题完 ——