先这样答
多模态主流架构可以按表征、融合、生成三层来回答。
第一层是表征。CLIP使用图像编码器和文本编码器组成双塔。它通过对比学习把图像和文本对齐到共享空间。这样,模型可以比较图像和文本的语义相关性。
第二层是融合。BLIP-2使用Q-Former连接冻结的视觉编码器和LLM。Q-Former负责从视觉特征中提取信息,再交给语言模型处理。Flamingo则把交叉注意力插入语言模型,让模型在生成过程中融合视觉信息。这两类方法都强调视觉信息和语言信息的交互。
第三层是生成。LLaVA类方法使用线性投影,把视觉编码器输出的特征接到LLM输入侧,再由LLM完成多模态理解和生成。这是当前多模态大模型常见的路线。落到业务上,可以根据场景选择架构。比如点餐图片理解、商家质检,都要先看任务更需要图文对齐、跨模态融合,还是直接生成结果。
面试官会怎么追问
-
「CLIP和LLaVA的定位有什么不同?」
CLIP主要解决图像和文本的表征对齐问题。它用双塔和对比学习把两种模态放到共享空间。LLaVA类方法则把视觉特征通过线性投影接入LLM,重点是完成多模态理解和生成。 -
「BLIP-2为什么要引入Q-Former?」
Q-Former连接冻结的视觉编码器和LLM。它从视觉特征中提取信息,再把结果交给语言模型。这样可以明确承担视觉信息到语言模型之间的连接和融合。 -
「Flamingo和BLIP-2的融合方式有什么区别?」
BLIP-2使用Q-Former连接视觉编码器和LLM。Flamingo把交叉注意力插入语言模型,让模型在生成过程中融合视觉信息。两者都属于融合层,但连接方式不同。
回答的坑
- 不要把CLIP只说成图像分类模型,它的核心是图文对比对齐和共享空间表征。
- 不要只罗列模型名称,要按表征、融合、生成三层说明各自解决什么问题。
同系列的题