抖音大模型二面真题:Transformer 与 Decoder-only 的胜利
大模型算法 / 应用岗
岗位:抖音大模型算法 / 应用岗 轮次:二面单题深挖记录,融合整理 一句话定性:这是一道「演进逻辑」题,RNN 卡在哪、Attention 怎么破、三种架构打了一圈为什么 Decoder-only 赢到现在,一条线讲下来。 素材时间线:2026 年抖音大模型岗面试的单题记录,整理时间 2026-09-28
0. 一分钟速览
| 项目 | 内容 |
|---|---|
| 公司 / 岗位 | 抖音 · 大模型算法 / 应用 |
| 考察重心 | RNN 的两个缺陷、Attention 的解法、三种架构变体与 Decoder-only 胜因 |
| 追问风格 | 「编码器解码器是中文翻译,我问的是具体在做什么」 |
| 典型挂点 | 只答「Attention 能并行、效果好」;架构选型说不清为什么 |
| 准备方向 | 每个概念落到机制和因果,不讲名词翻译 |
1. 真题:讲讲 Transformer 架构的基本原理,Encoder 和 Decoder 是什么
问法:「讲讲 Transformer 架构的基本原理?Encoder 和 Decoder 是什么?」
错误示范:答「Transformer 核心是 Attention,效果比 RNN 好;Encoder 是编码器,Decoder 是解码器」。面试官直接指出这是名词翻译,然后连追三问:RNN 的致命缺陷是什么、Attention 怎么解决的、为什么主流大模型全是 Decoder-only。
答题要点,按演进线讲:
RNN 的两个致命缺陷。一是顺序计算无法并行:第 N 步必须等第 N-1 步算完,训练 scale 不上去。二是长距离信息衰减:第 1 个词的信息逐层传到第 800 个词基本耗尽,长文档里前面的内容等于白放。
Self-Attention 怎么把两点都破掉。每个 token 直接和序列里任意位置建立联系,一步到位不需要逐层传递——长距离依赖从「会衰减的传递」变成「直接访问」;且所有位置的注意力可以并行计算——训练效率的天花板抬起来了。
Encoder 和 Decoder 的具体分工。Encoder 双向注意力,每个词同时看前后文,适合理解类任务(BERT 一系);Decoder 单向因果注意力,只能看前面的词,天然适合自回归生成(GPT 一系)。原版 Transformer 是 Encoder-Decoder(翻译任务),后来三个变体各自发展。
Decoder-only 为什么赢到现在。「预测下一个 token」这个训练目标极其统一,任何 NLP 任务都能表达成它,于是可以在海量无标注文本上自监督训练,规模越大能力越强——统一的训练目标加无限的数据,是这场架构竞争的胜负手。
2. 复盘与准备清单
- 基础原理题的高分结构是因果链:旧方案卡在哪(具体机制)→ 新方案的解法(对应每一卡)→ 竞争变体里为什么是这个赢了。名词解释只值起手分。
- 这场面试官的原话值得记住:「这种『为什么 X 赢了 Y』的演进逻辑搞不清楚,去面试就是被怼。」
相关题目:站内题库的「MHA、MQA、GQA 的区别」「RoPE 位置编码」是这道题的常见后续。