五厂面经真题集阿里巴巴面经高频阿里真题用户画像记忆更新速答 · 约 5 分钟更新 2026-09-29

怎么把非结构化对话转成可更新的用户偏好、业务状态和任务档案?

一句话结论

用抽取、分类、更新三步处理对话:按 schema 保守抽取实体和属性,分库存放偏好、状态与任务,再和旧记录比对,按冲突规则覆盖或合并。

先这样答

我会用抽取、分类、更新三步,把非结构化对话转成可维护的档案。抽取可以在会话结束时触发,也可以在轮次之间触发。模型按照预先定义的 schema,从对话中抽取实体和属性。抽取结果记录结构化信息,但不改写用户原话。这里要控制判断边界,宁可漏掉,也不要把不确定内容写进档案。抽错的画像比没有画像危害更大。

第二步做分类。偏好类、状态类、任务类分别进入不同的库存,因为三类信息的生命周期不同。第三步做更新。系统把本次抽取结果和旧记录比对,判断内容是否一致。没有冲突时保留并更新记录。出现冲突时,按预先约定的覆盖或合并逻辑处理。这样,档案不是一次生成后固定不变,而是随着后续对话持续更新。

面试官会怎么追问

  • 「抽取应该在什么时候触发?」 可以在会话结束时触发,也可以在轮次之间触发。具体选哪种时机,要看业务需要。无论何时触发,都要让模型按照 schema 抽取实体和属性。

  • 「为什么要把偏好、状态和任务分开存?」 三类信息的生命周期不同,所以不能用同一种方式管理。分类后分别进入不同的库存。更新时,也能基于对应类别处理旧记录和新信息。

  • 「新旧信息发生冲突时怎么处理?」 先把本次抽取结果和旧记录比对。确认存在冲突后,再按照预先定义的覆盖或合并逻辑处理。不能让模型直接把不确定内容写入档案。

回答的坑

  • 只讲模型抽取,不讲分类和新旧记录比对,回答就没有覆盖完整流程。
  • 为了提高档案数量而放宽抽取标准,容易产生错误画像,风险高于暂时没有画像。
—— 本题完 ——