先这样答
多模态融合分为早期、中期与晚期融合三种方式。早期融合直接在原始特征层合并数据。模型将不同模态的底层特征拼接后输入网络。这种方式保留的原始信息最多。图像和文本的底层特征语义空间差异大。网络很难在浅层完成特征对齐。代表模型如早期将图像特征与文本词向量直接拼接的多层感知机。
中期融合是目前多模态大模型的主流做法。不同模态数据先经过独立编码器提取特征。这些特征随后在网络的中间层进行深度交互。模型通常使用跨模态注意力机制完成计算。这种方式能利用单模态预训练模型的能力。它也能实现模态间的细粒度语义对齐。代表模型如采用交叉注意力机制的BLIP。
晚期融合在决策级完成信息合并。各个模态独立经过完整的网络计算流程。模型分别输出预测结果。系统最后将这些独立结果通过加权或投票机制进行融合。这种方式的工程实现最简单。它完全割裂了模态间的底层关联。模型也会丢失跨模态交互信息。代表模型如独立计算特征相似度的CLIP。
面试官会怎么追问
-
「中期融合的跨模态注意力机制具体怎么计算?」 模型将一种模态的特征作为查询向量。另一种模态的特征作为键和值向量。文本特征作为查询去关注图像的局部图块特征。网络通过计算注意力权重来动态提取跨模态信息。
-
「CLIP属于晚期融合,为什么在图文检索任务上效果好?」 CLIP主要解决全局语义对齐问题。双流架构在最后计算余弦相似度时才发生交互。这种设计保证了检索任务的计算效率。检索任务不需要细粒度局部特征交互。晚期融合的特征表达已经足够胜任。
-
「早期融合对齐困难,原始数据的差异体现在哪?」 图像是连续的稠密像素信号。文本是离散的稀疏符号标记。两者的原始数据分布和信息密度存在本质区别。网络缺乏足够的深度去建立像素与词汇的映射关系。
回答的坑
- 混淆中期融合与晚期融合的界限,误将特征独立编码后的简单拼接当成深层交互。
- 忘记结合业务场景分析融合方式的优劣,脱离实际任务空谈模型架构理论。
同系列的题