五厂面经真题集百度面经高频百度真题知识库预处理检索速答 · 约 5 分钟更新 2026-09-29

知识入库前做了哪些预处理?各步骤分别解决什么问题?

一句话结论

知识入库前通常经过格式解析、清洗、结构化抽取、语义切分和元数据标注,分别处理格式异构、数据质量、内容结构、检索单元以及过滤审计问题。

先这样答

知识入库前,我会按格式解析、清洗、结构化抽取、切分、元数据标注五步处理。每一步都要说明它解决的问题,不能只罗列处理动作。

第一步是格式解析。PDF、网页、表格使用对应的解析器,把不同来源的内容转换成后续可以处理的形式,解决格式异构问题。第二步是清洗,去掉噪声、重复内容和乱码,解决数据质量问题。第三步是结构化抽取,识别标题层级、表格和实体,保留内容结构,解决后续切分困难的问题。

第四步是切分。切分要参考语义边界,并加入重叠内容,形成合适的检索单元,解决内容过长或上下文被截断的问题。第五步是元数据标注,为内容记录来源、权限和时效信息,解决检索过滤和后续审计问题。这样回答时,重点不是背出五个步骤,而是把每一步和它解决的问题对应起来。

面试官会怎么追问

  • 「为什么要先做结构化抽取,再做切分?」
    结构化抽取先识别标题层级、表格和实体。切分时才能参考内容结构和语义边界,形成更合适的检索单元。否则切分可能破坏原有结构,影响后续检索。

  • 「切分时为什么要设置重叠?」
    切分不能只按固定长度处理,还要参考语义边界。加入重叠内容,可以保留相邻切分单元之间的上下文。这样能减少内容被切开后语义不完整的问题。

  • 「元数据标注具体解决什么问题?」
    元数据至少包括来源、权限和时效。来源可以支持内容追溯,权限可以用于检索过滤,时效可以区分内容是否适用。这些信息也支持后续审计。

回答的坑

  • 只说“解析、清洗、切分、入库”,却没有说明每一步解决什么问题,会漏掉这道题的主要采分点。
  • 把切分只回答成按字数或固定长度截断,没有提到语义边界和重叠。
—— 本题完 ——