是什么
上下文窗口是模型在一次前向处理中能够容纳的 token 总量上限。系统提示、用户输入、对话历史、检索片段和工具返回都会占用窗口。内容超过上限时,必须截断或压缩,例如生成摘要、丢弃部分内容,或把信息转移到外置记忆中。
标称窗口长度不代表模型能够同等有效地利用全部内容。上下文变长后,模型对中间部分信息的利用率可能下降,推理成本和延迟也会随长度上升。超长输入还可能打破前缀缓存命中。在 Agent 中,多类信息会竞争有限空间,因此需要管理内容的保留、压缩与移出。
解决什么问题
模型本身无状态,每次调用所需的信息都必须放进当前输入。上下文窗口规定了模型当下能够看到什么,是单次调用的信息硬边界。
没有足够的窗口,早期对话、任务约束或工具结果可能无法同时保留;窗口越大,能够放入的信息越多,但处理成本也会增加,因此不能只追求长度。
面试怎么考
常见问题包括:为什么标称长窗口不能全部当作有效空间使用;窗口接近上限时如何处理;长文档应直接放入窗口,还是先检索再提供相关片段。
答题时先说明窗口统计的是一次前向中的全部 token,再指出长上下文存在中间信息利用率下降、成本和延迟上升、前缀缓存可能失效等限制。处理策略应围绕截断、摘要、丢弃、外置记忆和检索展开,并根据任务保留最相关的信息。
又称:上下文窗口 · Context Window · 上下文长度
接着做点什么
—— 本条完 ——