五厂面经真题集阿里巴巴面经高频阿里真题Agent状态管理速答 · 约 5 分钟更新 2026-09-29

上下文污染是什么?怎么防?

一句话结论

上下文污染指无关或错误信息混入上下文并影响模型后续生成。防范方法包括来源过滤、过期标记与淘汰、会话隔离以及定期清理与压缩。

先这样答

上下文污染指无关或错误的信息混进上下文并影响后续生成。模型会把这些脏数据当成已知事实。这会导致模型输出偏离预期。污染主要来自三个渠道。第一是外部工具返回的错误结果。第二是长期对话中累积的过期历史记录。第三是并发场景下其他用户的残留状态。

防范上下文污染需要做四项工作。第一项是来源过滤。系统在外部数据进入上下文前必须做严格校验。第二项是过期标记与淘汰。开发者给每条历史记录打上时间戳。系统按时间规则自动淘汰过期信息。第三项是会话隔离。底层必须严格分开不同用户和任务的内存状态。第四项是定期清理与压缩。系统定时剔除冗余对话并压缩过长的上下文。

一旦发生污染,错误会沿着执行步骤放大。外部工具返回了错误数据。系统没有拦截它。模型就会基于这个错误数据继续推理和生成。错误信息顺着执行链路不断放大并导致任务失败。

面试官会怎么追问

  • 「工具返回错误结果具体是怎么导致污染放大的?」 工具返回错误数据后直接进入模型的上下文。模型无法分辨外部数据的真伪。模型会把错误数据当成已知事实去生成后续步骤。错误顺着执行链路不断放大。

  • 「其他用户的残留状态为什么会混进上下文?」 服务端有时会复用同一个实例去处理多个并发请求。系统没有在底层做严格的会话隔离。前一个用户的对话历史就留在了当前实例的上下文中。

  • 「定期清理与压缩解决的是哪类污染源?」 它主要解决过期历史带来的污染。对话轮数增加会让上下文堆积大量无用信息。系统定时清理冗余信息可以保证上下文纯净。过长的历史记录也需要压缩处理。

回答的坑

将上下文污染等同于模型幻觉并忽略工具错误结果这个核心来源。

只提限制上下文长度却遗漏进上下文前校验和会话隔离这两种关键机制。

—— 本题完 ——