五厂面经真题集字节跳动面经高频字节真题Memory评测方法速答 · 约 5 分钟更新 2026-09-29

怎么评测 Memory 对任务成功率的真实增益?

一句话结论

评测记忆增益必须做对照实验与消融实验,对比带记忆与不带记忆在任务成功率、交互轮次和纠正次数上的差异,不能只看检索相似度。

先这样答

评测 Memory 的真实增益必须依赖端到端的对照实验。我们不能只看检索相似度。检索得准不等于模型用得上。我们要固定同一个任务集。系统分出带记忆和不带记忆两个组分别跑。跑完直接对比三个核心指标。第一是任务成功率。第二是完成任务需要的交互轮次。第三是用户或系统的纠正次数。带记忆的组应该用更少的轮次和纠正次数完成任务。

验证总体增益后要做消融实验。我们要拆解不同记忆机制的边际贡献。第一组只加检索机制,不加写入机制。这能验证已有记忆对当前任务的利用率。第二组只加写入机制,不加淘汰机制。这能验证无限膨胀的记忆对成功率的负面影响。对比这几组的指标差异,我们就能看出各个机制的具体贡献。

针对长周期任务,评测还要看跨会话的累积增益。单次会话的成功率无法反映记忆的长期价值。我们要统计系统在多次独立会话中的表现。带记忆的系统在后续会话中应该表现出轮次递减的趋势。跨会话的纠正次数也会随着历史记忆的积累而持续减少。

面试官会怎么追问

  • 「为什么说检索得准不等于用得上?」 检索出的记忆可能与当前任务上下文冲突。模型可能过度依赖外部记忆而忽略当前输入指令。我们要看最终的任务成功率,而不是中间的检索召回率。

  • 「只加写入不加淘汰的消融实验目的是什么?」 记忆库随时间变大会引入大量噪声。噪声会直接干扰模型的上下文理解能力。这个实验能测出记忆膨胀对任务成功率的衰减影响。

  • 「怎么量化长周期任务跨会话的累积增益?」 我们记录同一用户在不同时间发起相似任务的日志数据。对比第一次和第 N 次独立任务的交互轮次。轮次差值和纠正次数的降幅就是累积增益的量化指标。

回答的坑

只看检索模块的召回率而脱离具体任务做评测。

忽视长周期任务中多次独立会话带来的累积效应。

—— 本题完 ——