RAG 与检索Embedding检索更新 2026-09-28

Embedding(向量化)Embedding

一句话定义

Embedding(向量化)是将文本映射为固定维度的稠密向量,使语义相近的文本在空间内距离近。检索时计算查询与文档的向量相似度进行召回,模型通过对比学习训练实现语义对齐。

是什么

Embedding(向量化)是将文本转化为几百到几千维的实数向量,通常用余弦相似度或内积衡量向量间的距离。在实际使用中,查询与文档通常使用同一个模型进行编码,文本的切分粒度会直接影响向量表示的语义完整性。模型选型需要参考检索类基准测试,并结合自有数据进行实测。

该类模型通常采用双塔架构通过对比学习进行训练。训练过程中,相关的查询与文档作为正样本在向量空间中被拉近,不相关的负样本被推远。硬负例挖掘策略与训练数据的质量共同决定了最终的编码效果。

解决什么问题

传统的字面匹配方法无法处理同义改写与不同表达方式的文本。当用户查询与目标文档用词不一致时,字面匹配会导致相关内容无法被检索到。

Embedding 提供了按语义相似度进行召回的能力。它使得字面表达不同但语义相似的内容能够被匹配,是检索增强生成架构中召回环节的主流方案。

面试怎么考

面试常考 Embedding 的概念、训练机制与选型方法。答题时应说明双塔对比学习的训练过程,并强调选型需结合自有数据实测。

考官常问及 BM25 与向量检索的区别,以及为什么向量检索后还要接重排。答题要点是指出 BM25 解决字面匹配,向量检索解决语义匹配,而重排用于对初步召回结果进行更精确的二次计算。

又称:Embedding · 向量化 · 向量表示 · 语义向量

—— 本条完 ——