多模态小红书面经高频[多模态幻觉RAG]速答 · 约 6 分钟更新 2026-09-28

多模态模型的幻觉主要来自哪里?怎么缓解?

一句话结论

幻觉主要来自视觉信息丢失、语言先验压过图像事实,以及图文弱相关训练数据。缓解时需区分感知性与知识性幻觉,前者靠高分辨率输入、强制视觉溯源解决,后者靠RAG补外部知识,并在规则侧用检测器交叉校验。

先这样答

多模态幻觉与纯文本幻觉的共性在于按语言概率生成而非查证,流畅度压过准确性。其特有来源需单独拆解,解答时可按机制展开,再从训练、推理、系统与规则四个层面给出缓解方案。

幻觉的特有来源有三点。一是视觉侧信息丢失,模型在压缩视觉token或处理低分辨率输入时遗漏细节,只能靠语言先验猜测。二是视觉与语言先验冲突,当图像事实不符合常理时,语言模型的世界知识会压过实际内容。比如图中有三只猫,但语言先验认为家庭照通常只有一两只,模型就会答错。三是训练数据中图文弱相关,导致模型学到不细看图也能答题的习惯。

缓解需分层处理。训练侧增加视觉定位类数据,要求描述必须依赖图中的具体区域,并引入矛盾样本。推理侧引入强制视觉溯源,要求模型先引用图中证据再作答,并通过高分辨率输入降低压缩率。系统和规则侧则用检测模型做事实一致性校验,对低置信度结果拒答。对于数量、颜色和文字等关键字段,直接走OCR或专用检测器交叉验证。

最后可以这样收束:治理多模态幻觉先要区分是感知性还是知识性幻觉,前者治视觉链路,后者治知识供给,两类问题必须分开治。

面试官会怎么追问

  • 「RAG在缓解多模态幻觉中具体起什么作用?能解决所有幻觉吗?」 RAG主要用于补充外部知识,比如图标含义或领域客观事实。它压制的是知识性幻觉,但压不住模型没看清图导致的感知性幻觉——如果模型在视觉提取阶段看错图,检索再多文档也无法纠正。
  • 「如果在推理阶段不增加额外模型,怎么降低语言先验的干预?」 可采用强制视觉溯源的提示词策略,要求模型在输出答案前,必须先输出对应物体在图中的坐标位置。这能强迫模型将注意力集中在视觉输入上,强制从图像中寻找证据,降低凭空捏造概率。
  • 「对于业务中绝对不能出错的关键字段,你们怎么用规则兜底?」 针对数量、颜色或图中文本等特定属性,纯靠生成模型很难保证绝对准确。业务中通常提取这些关键字段,调用成熟的OCR引擎或目标检测器交叉验证。如果生成内容与检测器结果冲突,则触发低置信拒答。

回答的坑

  • 认为引入RAG就能解决所有多模态幻觉,没有意识到RAG无法修复视觉链路上的感知性错误,需明确两类幻觉要分开治理。
  • 将多模态幻觉完全等同于纯文本幻觉,忽视了视觉token压缩和低分辨率输入这一多模态特有的信息丢失来源。
—— 本题完 ——