五厂面经真题集美团面经高频美团真题模型架构注意力机制速答 · 约 5 分钟更新 2026-09-29

Prefix、Causal、Encoder-Decoder 三种注意力架构的区别?

一句话结论

三者区别在于注意力方向。Prefix 前缀双向生成单向,Causal 全程单向,Encoder-Decoder 编码双向解码单向。主流选 Causal,赢在训练目标统一及无限自回归。

先这样答

这三种架构的核心区别在于注意力计算的方向。模型处理输入和输出的可见范围完全不同。

Prefix LM 将文本划分为前缀和生成两部分。模型在前缀部分使用双向注意力。前缀阶段的计算允许上下文互相可见。模型在生成部分使用单向注意力。生成阶段的计算只能看到历史输入。

Causal LM 采用全程单向注意力机制。模型在任何阶段都只能依赖前面的内容。这种架构将训练目标统一为预测下一个 token。当前主流大模型普遍选择 Causal 架构。它赢在训练目标高度统一。这种设计支持模型进行无限自回归。

Encoder-Decoder 架构拆分编码和解码过程。模型在编码阶段使用双向注意力。模型在解码阶段使用单向注意力。这种架构天然适合翻译类对齐任务。编码器提取源文本特征。解码器生成目标文本。

面试官会怎么追问

  • 「为什么主流大模型最终都选择了 Causal 架构?」 Causal LM 采用全程单向注意力。这种设计将训练目标完全统一为预测下一个 token。模型不需要区分输入和输出的结构差异。这种统一性简化了训练流程。模型也因此具备了无限自回归的能力。

  • 「Encoder-Decoder 架构在什么场景下比 Causal LM 更有优势?」 Encoder-Decoder 架构天然适合翻译类对齐任务。编码器使用双向注意力处理输入文本。模型可以获取完整的上文和下文特征。解码器再根据这些特征进行单向生成。这种机制在处理需要全局对齐的任务时表现更好。

  • 「Prefix LM 的前缀双向注意力有什么具体作用?」 前缀双向注意力允许模型充分理解提示词。前缀中的内容可以互相交换信息。模型获取双向特征后再在生成阶段切换回单向注意力。这种设计结合了双向理解和单向生成的特点。模型在处理复杂提示词时具备一定优势。

回答的坑

  • 忽视 Causal LM 赢在训练目标统一和无限自回归,错误将其优势归结于其他机制。
  • 答题时遗漏 Encoder-Decoder 架构天然适合翻译类对齐任务这一核心场景。
—— 本题完 ——