LLM 基础概念LLM 基础Transformer速答 · 约 5 分钟更新 2026-09-19

Transformer 和注意力机制是什么?为什么大模型都基于它

一句话结论

Transformer 是 2017 年提出的神经网络结构,核心是注意力机制:算每个词的表示时直接去看序列里所有位置并按相关性加权。它可并行、能抓长距离依赖,适合堆大规模训练。

先这样答

Transformer 是 2017 年提出的一种神经网络结构,现在几乎所有大语言模型都基于它。它的核心组件是注意力机制:模型在计算某个位置的表示时,会直接查看序列里的所有其他位置,按相关性高低分配权重,再把加权后的信息汇总过来。「该看哪里」不是人规定的,是训练学出来的。

在它之前,处理序列的主流结构是循环神经网络(RNN):一个词一个词顺着读,远处的信息靠逐步传递,距离一长就衰减,而且必须顺序计算,没法并行。注意力把「取远处信息」变成一步直达:任意两个位置之间都有直接通路,长距离依赖抓得住;整个序列还能同时计算,GPU 算力吃得满。这两点正好对上大模型的需求:要海量数据,要能堆算力。

收一句:注意力让模型自己学会「按相关性取信息」,Transformer 把它做成一个可以不断堆深堆宽的通用结构。大模型这一轮竞争,很大程度上就是把这套结构做大、做稳、做便宜。

面试官会怎么追问

  • 「注意力机制具体在算什么?」 每个位置生成三个向量:Query(我在找什么)、Key(我是什么)、Value(我提供什么内容)。当前位置拿自己的 Query 和所有位置的 Key 算相似度,经 softmax 归一化成权重,再对 Value 加权求和。整个过程就是「按相关性取信息」。
  • 「为什么主流大模型用 Decoder 结构?」 Encoder-Decoder 适合输入输出都明确的任务,比如翻译;对话和文本生成的输出长度不定、边生成边看,只做因果注意力的 Decoder 更自然,GPT 这条路线就是纯 Decoder。BERT 那类理解任务用的才是 Encoder。
  • 「注意力是唯一选择吗?」 不是。状态空间模型(如 Mamba)这类新结构想解决注意力计算量随长度平方增长的问题,也有把注意力和新结构混用的架构。但说「注意力仍是当前主流」是稳的,新结构大多还在验证期。

回答的坑

  • 把注意力说成「模仿人类注意力」。它是加权平均的数学操作,「注意力」只是类比出来的名字,机制上和人脑注意没有对应关系。
  • 说 Transformer 全面碾压 RNN。它的注意力计算量随序列长度平方增长,长文本下代价真实存在;它赢在可并行、好扩展,不是无条件领先。
—— 本题完 ——