先这样答
我的结论是,SFT 本质上主要教模型风格和行为边界,不是教知识。教知识是一条低效路径。知识更新快,直接把知识写进参数的成本高,这类需求更适合用 RAG。
SFT 更适合教领域话术和输出格式。它也适合教模型在不同场景下怎么行动。比如什么时候调用工具,什么时候拒答,什么时候继续追问。这些内容不是单纯记住一条知识,而是让模型在具体情况下做出符合要求的行为。
所以我会先给自己的 SFT 数据分类,再看每条样本到底在教什么。多数样本应该教行为边界,而不是教知识。这个判断会直接影响数据构造质量。如果数据只是反复灌输会快速变化的知识,就会浪费算力,也没有发挥 SFT 的长处。
面试官会怎么追问
-
「为什么说教知识是低效路径?」 知识更新快,模型参数里的内容不容易直接跟着变化。把知识写进参数也有较高成本,所以知识需求更适合用 RAG。SFT 应该把重点放在知识之外的能力上。
-
「那 SFT 具体应该教哪些行为边界?」 可以教模型什么时候调工具,什么时候拒答,什么时候追问。也可以教领域话术和固定的输出格式。核心是让模型在不同情况下稳定地产生符合要求的行为。
-
「你会怎么判断一份 SFT 数据是否合理?」 我会先把样本按知识、风格和行为边界分类。然后看数据中是否多数样本在教行为边界,而不是只教知识。如果纯教知识的样本占主要部分,这批数据的方向就有问题。
回答的坑
- 把“模型知道更多知识”当成 SFT 的主要目标,忽略知识更新快和参数化成本高的问题。
- 只谈领域话术和输出格式,却没有说明什么时候调工具、拒答或追问这些行为边界。
同系列的题
—— 本题完 ——