记忆系统百度面经高频字节跳动面经高频AgentMemory速答 · 约 6 分钟更新 2026-09-28

Agent 记忆为什么要分级?多级架构的必要性怎么讲清楚?

一句话结论

记忆分级是为了在生命周期与访问成本之间做平衡。单级架构无法同时解决窗口限制、检索损耗与成本控制问题,多级架构通过冷热数据分离实现了各级存储的高效协同。

先这样答

Agent 记忆分级的核心依据是数据的生命周期与访问成本。多级架构分为会话内上下文、会话摘要及长期记忆库。上下文在模型窗口内,最准最贵。摘要对跨轮对话进行压缩,保留脉络。长期记忆库是跨会话外置存储,存放历史事实。这本质是对热、温、冷数据的分离。

单级架构在实际工程中存在两难。全塞进窗口,长对话会超限,计算成本呈线性增长。全做成外置检索,每轮都有检索延迟与召回错误。当前轮次的即时状态属于热数据,强行走检索路径会破坏对话连贯性。

多级架构通过明确的分工规则解决上述问题。热数据进入窗口处理当前事实,温数据生成摘要维持任务脉络,冷数据存入外置库记录历史偏好。系统同时定义写入与提升规则。写入规则决定何时将窗口信息压缩并落库,提升规则决定检索命中的冷数据如何重新放入窗口参与计算。

面试时可以这样收束,记忆分级不是架构炫技,是在窗口有限、检索有损与成本要控这三个约束同时成立时的工程解。

面试官会怎么追问

  • 「Context 和长期的 Memory 到底有什么区别?」 Context 对应热数据,存放在模型窗口内,是最准但也最贵的存储方式,处理正在讨论的事实。长期 Memory 对应冷数据,是跨会话的外置存储,存放历史偏好与事实。长期 Memory 的内容必须通过检索提升到 Context 中,才能被模型消费。
  • 「记忆的写入和提升规则具体是怎么工作的?」 写入规则控制数据降级,决定何时将窗口内的即时信息生成摘要,并作为温数据或冷数据落盘到长期记忆库。提升规则控制数据激活,决定当外部检索命中冷数据时,如何将这部分记忆重新放入上下文窗口参与当前对话。
  • 「温数据在多级架构中起到了什么作用?」 温数据主要以会话摘要的形式存在,负责处理跨轮压缩。它在热数据和冷数据之间做缓冲,既避免了把所有历史对话原封不动留在窗口导致超限,又能维持本轮任务的整体脉络,不用每次都去外置库进行检索。

回答的坑

认为记忆分级单纯是为了解决上下文长度不够的问题,忽略了全量输入带来的成本线性增长与检索方案的召回误差,应该将其解释为成本、时延与准确率的综合权衡。

认为外部数据库是模型能直接理解的记忆,忽略了多级架构中的数据流转过程,应该明确强调所有层级的外部记忆最终都要被提取并放入上下文窗口才能生效。

—— 本题完 ——