抖音二面 · 基础原理深挖 13 分钟读完

抖音大模型二面真题:Transformer 与 Decoder-only 的胜利

大模型算法 / 应用岗

面经抖音TransformerDecoder-only架构演进

岗位:抖音大模型算法 / 应用岗 轮次:二面单题深挖记录,融合整理 一句话定性:这是一道「演进逻辑」题,RNN 卡在哪、Attention 怎么破、三种架构打了一圈为什么 Decoder-only 赢到现在,一条线讲下来。 素材时间线:2026 年抖音大模型岗面试的单题记录,整理时间 2026-09-28


0. 一分钟速览

项目内容
公司 / 岗位抖音 · 大模型算法 / 应用
考察重心RNN 的两个缺陷、Attention 的解法、三种架构变体与 Decoder-only 胜因
追问风格「编码器解码器是中文翻译,我问的是具体在做什么」
典型挂点只答「Attention 能并行、效果好」;架构选型说不清为什么
准备方向每个概念落到机制和因果,不讲名词翻译

1. 真题:讲讲 Transformer 架构的基本原理,Encoder 和 Decoder 是什么

问法:「讲讲 Transformer 架构的基本原理?Encoder 和 Decoder 是什么?」

错误示范:答「Transformer 核心是 Attention,效果比 RNN 好;Encoder 是编码器,Decoder 是解码器」。面试官直接指出这是名词翻译,然后连追三问:RNN 的致命缺陷是什么、Attention 怎么解决的、为什么主流大模型全是 Decoder-only。

答题要点,按演进线讲:

RNN 的两个致命缺陷。一是顺序计算无法并行:第 N 步必须等第 N-1 步算完,训练 scale 不上去。二是长距离信息衰减:第 1 个词的信息逐层传到第 800 个词基本耗尽,长文档里前面的内容等于白放。

Self-Attention 怎么把两点都破掉。每个 token 直接和序列里任意位置建立联系,一步到位不需要逐层传递——长距离依赖从「会衰减的传递」变成「直接访问」;且所有位置的注意力可以并行计算——训练效率的天花板抬起来了。

Encoder 和 Decoder 的具体分工。Encoder 双向注意力,每个词同时看前后文,适合理解类任务(BERT 一系);Decoder 单向因果注意力,只能看前面的词,天然适合自回归生成(GPT 一系)。原版 Transformer 是 Encoder-Decoder(翻译任务),后来三个变体各自发展。

Decoder-only 为什么赢到现在。「预测下一个 token」这个训练目标极其统一,任何 NLP 任务都能表达成它,于是可以在海量无标注文本上自监督训练,规模越大能力越强——统一的训练目标加无限的数据,是这场架构竞争的胜负手。


2. 复盘与准备清单

  • 基础原理题的高分结构是因果链:旧方案卡在哪(具体机制)→ 新方案的解法(对应每一卡)→ 竞争变体里为什么是这个赢了。名词解释只值起手分。
  • 这场面试官的原话值得记住:「这种『为什么 X 赢了 Y』的演进逻辑搞不清楚,去面试就是被怼。」

相关题目:站内题库的「MHA、MQA、GQA 的区别」「RoPE 位置编码」是这道题的常见后续。