五厂面经真题集快手面经高频网易面经高频推荐系统用户画像LLM速答 · 约 5 分钟更新 2026-09-29

推荐系统引入 LLM 做 User Profiling,可行性和挑战是什么?

一句话结论

可行的方案是把行为序列转成自然语言,让 LLM 生成可解释的画像摘要,再和 embedding 画像混合使用,同时按用户活跃度分配成本,并处理时效和隐私问题。

先这样答

可行,但不适合让 LLM 单独承担全部用户画像工作。一个直接方案是把用户行为序列转成自然语言,再让 LLM 生成画像摘要。这样得到的画像比向量更直观,也更容易解释用户为什么可能喜欢某类内容。

它还能帮助发现行为之间的隐性兴趣关联。比如,用户看过的内容不一定属于同一主题,但组合起来可能反映出一个更高层的兴趣方向。这个方案有三个主要挑战。第一是成本。推荐系统面对亿级用户,需要分层处理。活跃用户可以实时更新,长尾用户适合批量处理。第二是时效。画像摘要本质上是快照,可能跟不上用户兴趣的实时变化。第三是隐私。行为转成文本后,敏感信息可能更容易暴露。

落地时,我会把 LLM 画像和 embedding 画像混合使用。LLM 画像负责提供可读的摘要和关联信息,embedding 画像继续承担适合向量表示的部分。这样可以结合两种画像的特点,也能控制 LLM 的使用范围。

面试官会怎么追问

  • 「为什么不直接用 embedding 做用户画像?」
    embedding 适合表示用户行为和兴趣,但人不容易直接理解向量表达的内容。LLM 生成的画像摘要更直观,也更方便解释用户为什么被判断为具有某类兴趣。两者可以混合使用,而不是二选一。

  • 「亿级用户下,你会怎么控制 LLM 的成本?」
    我会按用户活跃度分层。活跃用户需要更及时的画像,可以实时更新。长尾用户不必频繁调用 LLM,可以采用批量处理。

  • 「画像摘要跟不上实时兴趣时,方案还能用吗?」
    能用,但不能把摘要当成唯一画像来源。摘要属于快照,可能滞后于用户最近的行为。落地时应混合 LLM 画像和 embedding 画像,让不同画像承担不同部分。

回答的坑

  • 只讲 LLM 能发现兴趣关联,却不提亿级用户下的成本分层。
  • 只讲画像可解释,却不提文本化行为带来的隐私暴露风险。

这家公司的面经实录

—— 本题完 ——