训练与微调微调提示词速答 · 约 4 分钟更新 2026-09-19

什么情况该微调?什么情况改提示词就够了

一句话结论

判断标准看差距在哪:模型缺知识或知识老变,用检索不改模型;行为、格式、风格不对,先改提示词,反复调仍不稳再微调。微调是最后动的那一档,不是第一档。

先这样答

先看提示词能解决什么:模型本来就会、只是没按要求输出的问题。格式不对、语气不合适、缺步骤、角色设定跑偏,都先靠提示词调:把要求写清楚、给几个示例、必要时用结构化输出约束。这一档成本最低、当天见效、随时能改,任何需求都应该从这里起步。

什么时候必须微调:提示词反复调仍有三类问题稳定存在。一是任务复杂,规则堆成很长的提示词,模型还是时对时错;二是风格或领域表达差距大,每次都要一大段设定去掰;三是提示词长到延迟和成本都扛不住,模型还记不全。这三类的共同点是:行为要求已经超出了上下文提示能稳定传达的范围,需要把行为写进参数里。

决策按成本递增:先提示词,缺知识再上检索,然后小规模微调,最后才是大规模训练。一句总结:微调是提示词试过之后的升级选项,不是替代品;没试过提示词就要微调的团队,多半连任务定义都没收敛。

面试官会怎么追问

  • 「怎么判断提示词已经到头了?」 两个信号:同一提示在多样本测试下时好时坏,找不到稳定生效的写法;或者有效提示长到影响延迟成本、还装不下全部规则。两个信号都出现,就该准备数据微调了。
  • 「微调之后提示词还要吗?」 要,但可以短很多。微调把默认行为固化进参数,提示词只留任务级的动态信息,比如用户输入、当次上下文。微调完还要靠长提示词撑着,说明没调到位。
  • 「缺知识的问题能靠微调解决吗?」 不可靠。微调擅长教行为和格式,让模型稳定记住易变的事实既难维护又容易幻觉。知识类需求优先走检索,微调管行为、检索供知识,这个分工要讲清楚。

回答的坑

  • 上来就推荐微调,理由是「效果更好」。微调改行为不改智力,周期长、成本高、还要养数据管线,不先排除提示词和检索能解决的部分,属于选型基本功不过关。
  • 把两者说成二选一。上线后的常见形态是微调模型配一段短提示词,各管一层,能讲出这种组合的,多半真的上过线。
—— 本题完 ——