多模态小红书面经高频拼多多面经高频[VLM架构设计多模态]速答 · 约 6 分钟更新 2026-09-28

VLM 里视觉编码器和 LLM 之间怎么连接?线性投影、Q-Former、MLP 各差在哪?

一句话结论

视觉与文本分布不同,需连接层做对齐。大上下文时代主流是 MLP,因其保留全部视觉 token 且成本可控,不丢细节。Q-Former 压缩率高但丢细节,线性投影则表达能力有限。

先这样答

视觉编码器和 LLM 直接拼接会导致分布失配,视觉与文本本质是两个分布。因此需要连接层承担维度对齐和语义适配的职责,把视觉特征序列变换成 LLM 能消化的输入表示。主流连接方式有线性投影、Q-Former 和 MLP 三种,核心差异在于特征压缩程度和模型容量。

线性投影通常是一层或几层线性映射,参数量最小,不改变视觉 token 数量。其表达能力相对有限,主要起基础维度转换作用。Q-Former 是带有可学习查询向量的轻量 Transformer 结构,把变长视觉特征压缩成固定数量的查询表示。优势在于压缩率高,但缺点是结构复杂、训练阶段多,且压缩过程产生信息瓶颈,容易丢失细节。MLP 连接器由两三层多层感知机组成,结合维度变换和非线性激活。它保留全部视觉 token,容量和成本介于前两者之间。

随着 LLM 上下文窗口变大,保留全部视觉 token 的成本变得可以接受。MLP 因为实现简单、端到端训练稳定,且能完整保留图像信息,实测效果不输复杂结构,逐渐成为主流选择。在上下文便宜的年代,简单保留信息的 MLP 赢了需要复杂压缩的 Q-Former。

面试官会怎么追问

  • 「为什么不用更简单的平均池化?」 把整图特征平均成单个向量会导致空间结构信息全部丢失,包括位置、物体关系和文字布局。这对 OCR、目标定位和细粒度理解任务是硬伤,池化造成的信息单向损失无法弥补,而可学习的连接器至少能保留序列结构。
  • 「adapter 采用 MLP 和 Q-Former 的区别是什么?」 区别在于信息处理方式。MLP 保留所有视觉 token 不做数量压缩,侧重于特征空间的非线性映射;Q-Former 通过查询向量机制强制压缩特征数量,侧重提取浓缩信息。
  • 「为什么 MLP 会成为主流方案?」 以前 LLM 上下文长度有限,Q-Former 的高压缩率是刚需。现在长上下文能力普及,保留完整特征不丢细节更重要,Q-Former 的信息瓶颈和多阶段训练复杂性成为缺点,因此被实现更简单的 MLP 替代。

回答的坑

认为连接层的作用只是把特征维度对齐,忽略了视觉分布和文本分布差异带来的语义适配需求。 盲目认为 Q-Former 压缩特征是最佳方案,没有结合当前 LLM 长上下文发展趋势解释 MLP 成为主流的工程背景。

—— 本题完 ——