五厂面经真题集美团面经高频多模态架构美团真题速答 · 约 5 分钟更新 2026-09-29

多模态了解吗?说说主流架构。

一句话结论

主流多模态架构可从表征、融合、生成三层理解:CLIP做图文对齐,BLIP-2和Flamingo做跨模态融合,LLaVA类路线把视觉信息接入LLM完成生成。

先这样答

多模态主流架构可以按表征、融合、生成三层来回答。

第一层是表征。CLIP使用图像编码器和文本编码器组成双塔。它通过对比学习把图像和文本对齐到共享空间。这样,模型可以比较图像和文本的语义相关性。

第二层是融合。BLIP-2使用Q-Former连接冻结的视觉编码器和LLM。Q-Former负责从视觉特征中提取信息,再交给语言模型处理。Flamingo则把交叉注意力插入语言模型,让模型在生成过程中融合视觉信息。这两类方法都强调视觉信息和语言信息的交互。

第三层是生成。LLaVA类方法使用线性投影,把视觉编码器输出的特征接到LLM输入侧,再由LLM完成多模态理解和生成。这是当前多模态大模型常见的路线。落到业务上,可以根据场景选择架构。比如点餐图片理解、商家质检,都要先看任务更需要图文对齐、跨模态融合,还是直接生成结果。

面试官会怎么追问

  • 「CLIP和LLaVA的定位有什么不同?」
    CLIP主要解决图像和文本的表征对齐问题。它用双塔和对比学习把两种模态放到共享空间。LLaVA类方法则把视觉特征通过线性投影接入LLM,重点是完成多模态理解和生成。

  • 「BLIP-2为什么要引入Q-Former?」
    Q-Former连接冻结的视觉编码器和LLM。它从视觉特征中提取信息,再把结果交给语言模型。这样可以明确承担视觉信息到语言模型之间的连接和融合。

  • 「Flamingo和BLIP-2的融合方式有什么区别?」
    BLIP-2使用Q-Former连接视觉编码器和LLM。Flamingo把交叉注意力插入语言模型,让模型在生成过程中融合视觉信息。两者都属于融合层,但连接方式不同。

回答的坑

  • 不要把CLIP只说成图像分类模型,它的核心是图文对比对齐和共享空间表征。
  • 不要只罗列模型名称,要按表征、融合、生成三层说明各自解决什么问题。
—— 本题完 ——