先这样答
先看提示词能解决什么:模型本来就会、只是没按要求输出的问题。格式不对、语气不合适、缺步骤、角色设定跑偏,都先靠提示词调:把要求写清楚、给几个示例、必要时用结构化输出约束。这一档成本最低、当天见效、随时能改,任何需求都应该从这里起步。
什么时候必须微调:提示词反复调仍有三类问题稳定存在。一是任务复杂,规则堆成很长的提示词,模型还是时对时错;二是风格或领域表达差距大,每次都要一大段设定去掰;三是提示词长到延迟和成本都扛不住,模型还记不全。这三类的共同点是:行为要求已经超出了上下文提示能稳定传达的范围,需要把行为写进参数里。
决策按成本递增:先提示词,缺知识再上检索,然后小规模微调,最后才是大规模训练。一句总结:微调是提示词试过之后的升级选项,不是替代品;没试过提示词就要微调的团队,多半连任务定义都没收敛。
面试官会怎么追问
- 「怎么判断提示词已经到头了?」 两个信号:同一提示在多样本测试下时好时坏,找不到稳定生效的写法;或者有效提示长到影响延迟成本、还装不下全部规则。两个信号都出现,就该准备数据微调了。
- 「微调之后提示词还要吗?」 要,但可以短很多。微调把默认行为固化进参数,提示词只留任务级的动态信息,比如用户输入、当次上下文。微调完还要靠长提示词撑着,说明没调到位。
- 「缺知识的问题能靠微调解决吗?」 不可靠。微调擅长教行为和格式,让模型稳定记住易变的事实既难维护又容易幻觉。知识类需求优先走检索,微调管行为、检索供知识,这个分工要讲清楚。
回答的坑
- 上来就推荐微调,理由是「效果更好」。微调改行为不改智力,周期长、成本高、还要养数据管线,不先排除提示词和检索能解决的部分,属于选型基本功不过关。
- 把两者说成二选一。上线后的常见形态是微调模型配一段短提示词,各管一层,能讲出这种组合的,多半真的上过线。
同系列的题
—— 本题完 ——