是什么
语义缓存的核心机制是将请求转化为向量,在向量库中寻找历史请求的最近邻。当相似度大于等于设定阈值时,判定命中并直接返回历史答案;未命中则走正常推理链路,并将新结果写入缓存。
它与前缀缓存的区别在于,前缀缓存复用同前缀的计算过程,语义缓存复用整条响应答案,两者正交可叠加。该方案适用于常见问题等高重复流量场景,个性化或时效要求高的场景慎用。
实际应用中,相似度阈值应宁紧勿松,因为错答代价高于慢答。系统需按用户隔离缓存,对时效敏感内容设置生存时间,并监控命中率与错答率。
解决什么问题
大语言模型调用成本高且延迟长,而真实业务流量中存在大量重复提问。若无此机制,系统会对相同问题进行重复计算。语义缓存补上了拦截重复请求的环节,用低廉的检索开销替代模型生成,是成本优化中杠杆最大的单点。
面试怎么考
常考辨析语义缓存与前缀缓存的区别,答题需点明前者缓存答案、后者缓存计算状态。
考官会问如何设定阈值及防范错答,答题要点是强调阈值宁紧勿松,配合权限隔离、生存时间控制和错答率监控。此外还会考察不适用的场景,需指出强个性化和高时效性场景慎用。
又称:语义缓存 · Semantic Caching · GPTCache
接着做点什么
—— 本条完 ——