先这样答
知识入库前,我会按格式解析、清洗、结构化抽取、切分、元数据标注五步处理。每一步都要说明它解决的问题,不能只罗列处理动作。
第一步是格式解析。PDF、网页、表格使用对应的解析器,把不同来源的内容转换成后续可以处理的形式,解决格式异构问题。第二步是清洗,去掉噪声、重复内容和乱码,解决数据质量问题。第三步是结构化抽取,识别标题层级、表格和实体,保留内容结构,解决后续切分困难的问题。
第四步是切分。切分要参考语义边界,并加入重叠内容,形成合适的检索单元,解决内容过长或上下文被截断的问题。第五步是元数据标注,为内容记录来源、权限和时效信息,解决检索过滤和后续审计问题。这样回答时,重点不是背出五个步骤,而是把每一步和它解决的问题对应起来。
面试官会怎么追问
-
「为什么要先做结构化抽取,再做切分?」
结构化抽取先识别标题层级、表格和实体。切分时才能参考内容结构和语义边界,形成更合适的检索单元。否则切分可能破坏原有结构,影响后续检索。 -
「切分时为什么要设置重叠?」
切分不能只按固定长度处理,还要参考语义边界。加入重叠内容,可以保留相邻切分单元之间的上下文。这样能减少内容被切开后语义不完整的问题。 -
「元数据标注具体解决什么问题?」
元数据至少包括来源、权限和时效。来源可以支持内容追溯,权限可以用于检索过滤,时效可以区分内容是否适用。这些信息也支持后续审计。
回答的坑
- 只说“解析、清洗、切分、入库”,却没有说明每一步解决什么问题,会漏掉这道题的主要采分点。
- 把切分只回答成按字数或固定长度截断,没有提到语义边界和重叠。
同系列的题
—— 本题完 ——