是什么
ALiBi 放弃学习位置嵌入,直接在注意力计算阶段干预。其做法是在查询和键计算出的注意力 logits 上减去一个惩罚项,该惩罚项等于 token 间的相对距离乘以预设斜率。每个注意力头分配不同斜率,使远处 token 权重被线性压低。
因惩罚项随距离线性增长且无训练参数,模型遇到未见过的更长距离时,依然能表现出合理分布,具备稳定的长度外推性。
其局限在于线性衰减对远距离精确检索任务不友好。远端信息分数被强制压低,导致表达能力弱于 RoPE 的精确相对位置建模。
解决什么问题
传统位置编码通常需引入可训练参数,在处理超过训练长度的序列时易发生性能崩塌,难以适应长文本场景。
ALiBi 提供了一种无参数且具天然外推能力的替代方案。它通过极简加法为变长序列注入位置信息,既降低训练成本,又保持极低实现复杂度,满足短文本训练与长文本推理的需求。
面试怎么考
面试常考 ALiBi 与 RoPE 的机制对比。答题要点在于明确作用阶段差异:ALiBi 在注意力分数计算后直接修改标量分数,而 RoPE 在计算前对查询和键向量进行旋转操作。
另一考法是追问外推性来源及不适用任务。答题需指出外推性源于无参数的线性距离惩罚。同时需说明,因该机制对远距离 token 施加严格压制,它不适合需要远距离精确信息检索的任务。
又称:ALiBi · 线性偏置注意力
接着做点什么
—— 本条完 ——