先这样答
这三种架构的核心区别在于注意力计算的方向。模型处理输入和输出的可见范围完全不同。
Prefix LM 将文本划分为前缀和生成两部分。模型在前缀部分使用双向注意力。前缀阶段的计算允许上下文互相可见。模型在生成部分使用单向注意力。生成阶段的计算只能看到历史输入。
Causal LM 采用全程单向注意力机制。模型在任何阶段都只能依赖前面的内容。这种架构将训练目标统一为预测下一个 token。当前主流大模型普遍选择 Causal 架构。它赢在训练目标高度统一。这种设计支持模型进行无限自回归。
Encoder-Decoder 架构拆分编码和解码过程。模型在编码阶段使用双向注意力。模型在解码阶段使用单向注意力。这种架构天然适合翻译类对齐任务。编码器提取源文本特征。解码器生成目标文本。
面试官会怎么追问
-
「为什么主流大模型最终都选择了 Causal 架构?」 Causal LM 采用全程单向注意力。这种设计将训练目标完全统一为预测下一个 token。模型不需要区分输入和输出的结构差异。这种统一性简化了训练流程。模型也因此具备了无限自回归的能力。
-
「Encoder-Decoder 架构在什么场景下比 Causal LM 更有优势?」 Encoder-Decoder 架构天然适合翻译类对齐任务。编码器使用双向注意力处理输入文本。模型可以获取完整的上文和下文特征。解码器再根据这些特征进行单向生成。这种机制在处理需要全局对齐的任务时表现更好。
-
「Prefix LM 的前缀双向注意力有什么具体作用?」 前缀双向注意力允许模型充分理解提示词。前缀中的内容可以互相交换信息。模型获取双向特征后再在生成阶段切换回单向注意力。这种设计结合了双向理解和单向生成的特点。模型在处理复杂提示词时具备一定优势。
回答的坑
- 忽视 Causal LM 赢在训练目标统一和无限自回归,错误将其优势归结于其他机制。
- 答题时遗漏 Encoder-Decoder 架构天然适合翻译类对齐任务这一核心场景。
同系列的题