先这样答
GraphRAG 的难点集中在实体抽取一致性、图构建成本和多跳查询延迟三个方面。实体抽取一致性要求系统具备消歧能力。文本中经常出现同名不同实体。系统需要把它们区分开。文本也会出现异名同实体。系统必须把这些不同表述合并到同一个节点。图构建成本源于大模型的计算开销。系统处理海量文档并建立节点关系会消耗大量算力。多跳查询延迟发生在检索阶段。系统沿着图边进行多次跳转检索会拖慢响应速度。
增量更新的核心策略是不重建全图。系统接收新文档后,只针对增量内容运行实体抽取。大模型从新文本中提取出增量实体。系统接着执行实体对齐操作。新提取的实体与图谱中的存量实体进行匹配。系统通过合并节点完成新老数据融合。
更新上线依赖版本化索引机制。系统完成增量图谱构建后,生成全新的索引版本。线上服务不直接覆盖旧索引。业务端通过灰度切换平滑过渡流量。这保证了图谱更新期间查询服务的稳定性。
面试官会怎么追问
-
「图构建成本主要产生在哪个环节?」 成本主要产生在实体抽取和关系构建阶段。系统调用大模型处理所有输入文档。大模型提取实体会消耗大量计算资源。
-
「增量更新时,新实体怎么和老实体建立联系?」 系统对新文档提取增量实体。系统将新实体与存量实体进行对齐。系统利用消歧机制合并异名同实体。
-
「版本化索引灰度切换的具体作用是什么?」 灰度切换用于保障线上查询服务。系统在后台构建新版本索引。系统通过逐步切换流量避免直接覆盖旧索引带来的风险。
回答的坑
认为增量更新只是简单追加新节点,忽略了增量实体与存量实体必须进行对齐和消歧。
只描述图数据的更新过程,漏掉版本化索引和灰度切换这两个保障线上稳定的关键步骤。
同系列的题
—— 本题完 ——