先这样答
按资源和收益选:全量微调的效果上限最高,但需要多卡集群。只有任务需要改变基座能力时,才考虑全量微调。普通业务微调优先选 LoRA。LoRA 只训练约百分之一的参数,多数任务已经够用。
QLoRA 适合单卡或大基座场景。它使用 4bit 量化基座,再训练适配器。这样可以把显存需求降一个量级。硬件受限时,QLoRA 通常比 LoRA 更容易落地。
我会先看三类信号。第一是可用显存,判断能否直接训练基座。第二是任务和基座的差距,判断是否需要更高的效果上限。第三是是否需要多个 Adapter 热切换。业务微调默认选 LoRA;单卡或大基座选 QLoRA;基座级任务且有多卡集群,再选全量微调。
面试官会怎么追问
-
「为什么业务微调默认选 LoRA?」 LoRA 只训练约百分之一的参数。多数业务任务用 LoRA 就能达到够用的效果。它也比全量微调更适合资源有限的场景。
-
「QLoRA 和 LoRA 的核心区别是什么?」 QLoRA 会先把基座做 4bit 量化,再训练适配器。它主要解决显存限制。单卡或大基座场景下,应优先考虑 QLoRA。
-
「什么时候不能只看显存来选?」 还要看任务和基座的差距。如果任务需要改变基座能力,就要考虑全量微调。还要看是否需要多个 Adapter 热切换,这会影响方案选择。
回答的坑
- 不要把全量微调说成默认方案,它的效果上限最高,但需要多卡集群。
- 不要只按模型大小选择,还要同时判断可用显存、任务与基座差距和 Adapter 热切换需求。
同系列的题
—— 本题完 ——