五厂面经真题集商汤科技面经高频商汤考点多模态融合Agent架构速答 · 约 5 分钟更新 2026-09-30

多模态 Agent 怎么融合视觉、语言、语音信息做决策?早期融合和晚期融合怎么选?

一句话结论

融合方式分早期、晚期、混合三种:早期融合跨模态交互充分但对模型要求高,晚期融合模块化强但会丢跨模态信息,工程上通常按模态重要性做混合融合。

多模态 Agent 怎么融合视觉、语言、语音信息做决策?早期融合和晚期融合怎么选?

先这样答

融合策略分三类。早期融合把各模态的原始特征拼接后送进同一个模型,视觉 token 和文本 token 在注意力层里自由交互,跨模态理解充分,但要求模型本身有多模态预训练基础。晚期融合让各模态独立处理,在决策层汇合,比如视觉模型先生成图像描述、语音先转文字,再把文本一起交给大模型。晚期融合模块化强,任何一个模态的模型都可以单独替换,代价是跨模态的细节信息在各自编码阶段就丢掉了。

工程上多数产品走混合路线:核心模态做早期融合,辅助模态做晚期融合。比如 GUI Agent 里视觉加语言是任务主线,必须早期融合进同一个多模态模型;背景音乐识别、传感器信号这类辅助信息,转成结构化文本再注入即可,不值得为它们改造主干模型。

Agent 架构上对应四层:感知层放多模态编码器,融合层做跨模态注意力,推理层用大模型规划,执行层负责工具调用。选融合方式的判断标准很简单:任务的关键判断是否依赖模态之间的细粒度对应关系。依赖就用早期融合,不依赖就用晚期融合省钱省事。

面试官会怎么追问

  • 「晚期融合丢了什么信息?举一个例子。」 视觉模型把图片概括成文字描述时,空间关系和精确坐标已经被压缩掉了。用户说「点右边那个按钮」,晚期融合拿到的描述里可能只剩「一个提交按钮」,左右关系没了。GUI 定位这类任务必须早期融合。
  • 「混合融合的边界怎么划?」 按模态对任务目标的贡献度划。做一个「看图回答」的产品,视觉是核心模态;做客服机器人,语音只要转写准确就行,转写质量和主任务可以解耦。解耦得越彻底,系统越好维护。
  • 「商汤的日日新走哪条路线?」 原生多模态路线,模型从预训练阶段就在图文混杂数据上训练,属于早期融合的彻底版。回答时点出「原生多模态 vs 外挂视觉编码器」这个区分就够。

回答的坑

  • 把融合方式当成信仰问题,只讲一种的优点。面试官要听的是选型依据,不是站队。
  • 说晚期融合「没有信息损失」。任何单模态编码到自然语言的转换都是有损压缩,这点要主动承认。
—— 本题完 ——