多模态小红书面经高频百度面经高频[多模态VLM数据清洗]速答 · 约 6 分钟更新 2026-09-28

多模态数据里图文不一致的样本,训练时和上线后分别怎么处理?

一句话结论

训练阶段先用CLIP类模型打分清洗数据,同时保留少量标注为矛盾的样本教模型学会拒答;上线后靠前置相关性检测拦截,并结合提示词约束模型只依据图像作答。

先这样答

面对多模态数据中图文不一致的样本,处理的核心思路是训练阶段清洗去噪与注入拒答能力并重,上线阶段依靠前置拦截与提示约束兜底。

训练侧的首要任务是过滤噪声。通常会使用预训练模型给图文对打相关性分数,比如利用CLIP类双塔模型计算相似度。得分过低的样本会进入人工复核环节或被直接剔除。如果原始数据的噪声比例偏高,可以采用课程式清洗策略,先进行粗筛,再进行更严格的精筛。但在清洗时,不需要把所有不一致的数据都清空。保留少量并专门标注为图文矛盾的样本非常关键,这能教模型学会指出矛盾。通过让模型学习回答「图里没有这个信息」,这些样本就变成了模型拒答能力的重要数据来源。

上线侧面临的实际场景多为用户配错图或上传的截图与提问无关。此时期望模型的行为是基于图像的真实内容作答,或者直接声明图文不一致,而不是顺着用户的错误文本产生幻觉。这种表现首先依赖于训练阶段见过的矛盾样本,其次需要在线上辅以提示约束,在系统提示中明确要求模型仅依据图像内容进行回答。同时,线上系统还可以增加图文相关性检测模块,作为前置拦截机制。当检测到图文相关性过低时,直接触发拦截或在提示中进行降权处理。

总结来说,训练端通过洗数据保证基础质量,留矛盾样本学拒答;上线端靠相关性检测与提示约束进行兜底。

面试官会怎么追问

  • 「多模态特征一般是怎么融合的?早期融合还是晚期融合?」 早期融合是指视觉token在进入大语言模型前几层就开始交互,这种方式交互深、计算成本高。晚期融合则是视觉和文本各自编码后,在最后阶段拼接决策,实现简单且交互浅。当前主流的视觉语言模型多采用早期融合,让视觉token与文本token在语言模型内部进行全层交互。
  • 「保留图文矛盾样本做拒答训练,期望模型输出什么样的结果?」 期望模型能够明确指出矛盾,比如直接回答「图里没有这个信息」。通过这种方式,模型不再为了迎合文本指令而强行生成内容,而是学会基于图像真实输入进行判断,以此构建起合理的拒答能力。
  • 「如果原始数据的噪声比例非常高,用相似度打分过滤有什么具体策略?」 面对高比例噪声,通常会采用课程式清洗的方法。先设定相对宽松的标准进行粗筛,过滤掉相关性极低的样本,随后再进入精筛阶段。低分样本可以引入人工复核,避免一刀切导致有效数据流失。

回答的坑

  • 认为训练时必须把所有图文不一致的样本清理干净,这会导致模型在遇到真实场景的错误配图时只会顺着文本胡说,正确的做法是保留少量矛盾样本用于训练拒答能力。
  • 忽视线上兜底机制而只讲模型自身的抗幻觉能力,正确的方向是必须结合上线侧的图文相关性前置检测与提示词约束,给出一个完整的工程方案。
—— 本题完 ——