五厂面经真题集百度面经高频百度真题SFTRAG速答 · 约 5 分钟更新 2026-09-29

你的 SFT 本质上在教模型什么?教知识、风格还是行为边界?

一句话结论

SFT 主要教模型稳定的输出风格和行为边界,而不是把知识硬塞进参数;知识更新快、参数化成本高,知识更适合用 RAG,数据应多数围绕边界设计。

先这样答

我的结论是,SFT 本质上主要教模型风格和行为边界,不是教知识。教知识是一条低效路径。知识更新快,直接把知识写进参数的成本高,这类需求更适合用 RAG。

SFT 更适合教领域话术和输出格式。它也适合教模型在不同场景下怎么行动。比如什么时候调用工具,什么时候拒答,什么时候继续追问。这些内容不是单纯记住一条知识,而是让模型在具体情况下做出符合要求的行为。

所以我会先给自己的 SFT 数据分类,再看每条样本到底在教什么。多数样本应该教行为边界,而不是教知识。这个判断会直接影响数据构造质量。如果数据只是反复灌输会快速变化的知识,就会浪费算力,也没有发挥 SFT 的长处。

面试官会怎么追问

  • 「为什么说教知识是低效路径?」 知识更新快,模型参数里的内容不容易直接跟着变化。把知识写进参数也有较高成本,所以知识需求更适合用 RAG。SFT 应该把重点放在知识之外的能力上。

  • 「那 SFT 具体应该教哪些行为边界?」 可以教模型什么时候调工具,什么时候拒答,什么时候追问。也可以教领域话术和固定的输出格式。核心是让模型在不同情况下稳定地产生符合要求的行为。

  • 「你会怎么判断一份 SFT 数据是否合理?」 我会先把样本按知识、风格和行为边界分类。然后看数据中是否多数样本在教行为边界,而不是只教知识。如果纯教知识的样本占主要部分,这批数据的方向就有问题。

回答的坑

  • 把“模型知道更多知识”当成 SFT 的主要目标,忽略知识更新快和参数化成本高的问题。
  • 只谈领域话术和输出格式,却没有说明什么时候调工具、拒答或追问这些行为边界。
—— 本题完 ——