先这样答
日志最难处理。四类知识源放在一起看,日志同时面对无结构、量大、时效敏感和敏感信息这几个问题。它不像 API 文档那样有稳定结构,也不像 DDL 那样本身就是结构化定义。只说“日志量大”不够。量大只是其中一层难度。回答时还要讲清内容形态、时间因素和脱敏要求。
API 文档的结构稳定,可以按模板解析。DDL 提供结构化定义,可以直接图谱化。Wiki 属于半结构化,处理难度居中。这样比较后,日志的难点才有参照:它没有稳定结构可直接套用,内容又多,还要考虑时效和敏感信息。我会把这三类放在一起比较,再说明为什么选日志,不会只报一个答案。
落到处理上,我会先清洗过滤日志,再归纳模式,随后做脱敏,最后按时间衰减索引。清洗过滤回应量大的问题,模式归纳回应无结构的问题。脱敏处理敏感信息,按时间衰减索引则回应时效敏感。面试中我会先给结论,再对比其他三类,最后说日志的处理链。这样每一步都对应前面提到的难点。
面试官会怎么追问
- 「为什么不是 Wiki 最难?」 Wiki 是半结构化,处理难度居中。日志无结构、量大,还要考虑时效和脱敏。判断难度时,我不会只比较结构,也会把这些要求放在一起看。
- 「API 文档和 DDL 为什么更容易处理?」 API 文档结构稳定,可以模板化解析。DDL 是结构化定义,可以直接图谱化。它们都有可用的结构,因此我不会把它们排在日志前面。
- 「如果让你处理日志,你会按什么顺序做?」 我会先清洗过滤,再归纳模式,随后脱敏。最后按时间衰减索引。这个顺序对应日志量大、无结构、含敏感信息和时效敏感这几个难点。
回答的坑
- 只说“日志最难,因为量大”,会漏掉无结构、时效敏感和脱敏这几项关键理由。
- 只讲日志而不比较 API 文档、DDL 和 Wiki,面试官就听不到你判断“最难”的依据。
同系列的题
—— 本题完 ——