五厂面经真题集美团面经高频腾讯面经高频百度面经高频美团真题大模型面试参数高效微调速答 · 约 5 分钟更新 2026-09-29

LoRA、QLoRA 与全量微调怎么选?

一句话结论

资源有限先选 LoRA;单卡或大基座选 QLoRA;只有基座级任务且有多卡集群时才做全量微调,再看任务与基座差距和 Adapter 热切换需求

先这样答

按资源和收益选:全量微调的效果上限最高,但需要多卡集群。只有任务需要改变基座能力时,才考虑全量微调。普通业务微调优先选 LoRA。LoRA 只训练约百分之一的参数,多数任务已经够用。

QLoRA 适合单卡或大基座场景。它使用 4bit 量化基座,再训练适配器。这样可以把显存需求降一个量级。硬件受限时,QLoRA 通常比 LoRA 更容易落地。

我会先看三类信号。第一是可用显存,判断能否直接训练基座。第二是任务和基座的差距,判断是否需要更高的效果上限。第三是是否需要多个 Adapter 热切换。业务微调默认选 LoRA;单卡或大基座选 QLoRA;基座级任务且有多卡集群,再选全量微调。

面试官会怎么追问

  • 「为什么业务微调默认选 LoRA?」 LoRA 只训练约百分之一的参数。多数业务任务用 LoRA 就能达到够用的效果。它也比全量微调更适合资源有限的场景。

  • 「QLoRA 和 LoRA 的核心区别是什么?」 QLoRA 会先把基座做 4bit 量化,再训练适配器。它主要解决显存限制。单卡或大基座场景下,应优先考虑 QLoRA。

  • 「什么时候不能只看显存来选?」 还要看任务和基座的差距。如果任务需要改变基座能力,就要考虑全量微调。还要看是否需要多个 Adapter 热切换,这会影响方案选择。

回答的坑

  • 不要把全量微调说成默认方案,它的效果上限最高,但需要多卡集群。
  • 不要只按模型大小选择,还要同时判断可用显存、任务与基座差距和 Adapter 热切换需求。
—— 本题完 ——