训练与微调LoRA微调更新 2026-09-28

LoRALoRA (Low-Rank Adaptation)

一句话定义

LoRA 是一种冻结原模型权重,在旁路并接一对低秩矩阵只训练增量的微调方法。其可训练参数仅占原模型小几个百分点,显存与存储开销大幅下降,效果接近全参微调。

是什么

LoRA 的机制是用两个小矩阵的乘积近似权重更新量。微调时原模型权重冻结,在旁路并接降维与升维矩阵。前向传播输出等于原权重输出加上低秩矩阵乘积的缩放输出,矩阵的秩远小于原维度。

超参数秩决定适配容量,常用范围为 8 到 128,缩放系数控制增量影响。它通常作用于注意力投影矩阵,也可扩展至前馈网络。QLoRA 将基座量化成低位宽再训 LoRA,单卡消费级显存即可微调大模型。

每个任务只需存几十到上百兆的适配器,多任务时基座共享,换任务换适配器即可。

解决什么问题

全参微调需更新所有参数,导致显存占用高、存储开销大,多任务管理成本高昂。每个任务都要保存与原模型等大的权重。

LoRA 将权重增量压缩到低秩子空间,替代全部参数更新。这使微调算得动、增量存得下,多任务并发时能基于共享基座快速切换。

面试怎么考

常考 LoRA 为什么可行。答题需指出预训练模型微调时的权重更新量具有低秩特性。

常问秩怎么选、是不是越大越好。回答需说明秩决定容量,但并非越大越好,过大会增加开销。此外常考 LoRA 与全参微调的效果差距,以及 QLoRA 省在哪里,需点明 QLoRA 通过量化冻结的基座来压缩显存。

又称:LoRA · 低秩适配 · Low-Rank Adaptation · QLoRA

—— 本条完 ——