是什么
LoRA 的机制是用两个小矩阵的乘积近似权重更新量。微调时原模型权重冻结,在旁路并接降维与升维矩阵。前向传播输出等于原权重输出加上低秩矩阵乘积的缩放输出,矩阵的秩远小于原维度。
超参数秩决定适配容量,常用范围为 8 到 128,缩放系数控制增量影响。它通常作用于注意力投影矩阵,也可扩展至前馈网络。QLoRA 将基座量化成低位宽再训 LoRA,单卡消费级显存即可微调大模型。
每个任务只需存几十到上百兆的适配器,多任务时基座共享,换任务换适配器即可。
解决什么问题
全参微调需更新所有参数,导致显存占用高、存储开销大,多任务管理成本高昂。每个任务都要保存与原模型等大的权重。
LoRA 将权重增量压缩到低秩子空间,替代全部参数更新。这使微调算得动、增量存得下,多任务并发时能基于共享基座快速切换。
面试怎么考
常考 LoRA 为什么可行。答题需指出预训练模型微调时的权重更新量具有低秩特性。
常问秩怎么选、是不是越大越好。回答需说明秩决定容量,但并非越大越好,过大会增加开销。此外常考 LoRA 与全参微调的效果差距,以及 QLoRA 省在哪里,需点明 QLoRA 通过量化冻结的基座来压缩显存。
又称:LoRA · 低秩适配 · Low-Rank Adaptation · QLoRA
相关术语
接着做点什么
—— 本条完 ——