LLM 基础概念位置编码长文本速答 · 约 5 分钟更新 2026-09-28

ALiBi 位置编码是什么?和 RoPE 怎么选?

一句话结论

ALiBi 是在注意力分数上直接加线性距离惩罚,RoPE 是对查询和键向量进行旋转。选型上,需要长程精确检索选表达力更强的 RoPE,看重零参数天然外推选 ALiBi。

先这样答

ALiBi 和 RoPE 的核心区别在于作用阶段和表达能力。前者修改注意力分数,后者修改查询和键的向量表达。在工程选型中,业界主流更多选择 RoPE,因为它能提供更精确的相对位置建模,配合成熟的外推工具即可处理长文本。ALiBi 则凭借零参数的外推优势,在追求极简实现的场景下作为备选。

ALiBi 的机制是不学习位置嵌入向量,而在计算注意力分数时,直接加上与相对距离成正比的负向惩罚项。距离越远,注意力分数被压制越多。其优势是实现极简且具备天然外推性,模型在短序列上训练后可直接推理长序列。但局限在于表达能力受限,强制的线性衰减使得模型在处理长程检索任务时,难以精确提取远处的关键信息。

RoPE 通过对查询和键向量进行旋转变换,使两者的注意力内积自然携带相对位置信息。相比 ALiBi,RoPE 对相对位置的建模更精确,表达能力更强。虽然基础版 RoPE 的直接外推能力较弱,但作为主流标配,它配合 NTK 或 YaRN 等技巧,同样能顺利扩展上下文长度。

在面试官面前可以这样总结:一个改注意力分数,一个改向量表达,选型看任务对长程精确检索的需求。要求精准的长文本任务选 RoPE,看重无参数稳定外推选 ALiBi。

面试官会怎么追问

  • 「既然 ALiBi 天然支持外推,为什么现在主流模型用 RoPE 配合 NTK 或 YaRN 做长文本?」 因为 ALiBi 的线性距离惩罚会导致长距离信息丢失,无法胜任精准的长程检索任务。RoPE 表达能力更好,配合 NTK 等技巧缩放旋转角度后,也能实现长文本外推,达到了表达力与外推能力的平衡。
  • 「ALiBi 对远处 token 的注意力压制是绝对的吗?如果任务需要远距离依赖怎么办?」 ALiBi 的惩罚项按距离单调递减,会导致远距离 token 的注意力分数变得很小。若任务强依赖远距离信息,ALiBi 表现通常不如 RoPE。实际应用中,可通过调整不同注意力头的衰减斜率来缓解此问题。
  • 「这两种编码方式在本质上属于绝对位置编码还是相对位置编码?」 两者在效果上都实现了相对位置信息的注入。RoPE 虽然在绝对位置上应用旋转矩阵,但内积结果只与相对位置有关。ALiBi 直接根据相对距离计算惩罚项,也是纯粹的相对位置机制。

回答的坑

认为 RoPE 完全不具备外推能力是一个常见误区,实际上它配合插值技巧可以很好地扩展上下文长度。 把 ALiBi 当作需要训练参数的位置嵌入向量来解释是错误的,它是不包含任何可学习参数的偏置项。

—— 本题完 ——