先这样答
多模态幻觉与纯文本幻觉的共性在于按语言概率生成而非查证,流畅度压过准确性。其特有来源需单独拆解,解答时可按机制展开,再从训练、推理、系统与规则四个层面给出缓解方案。
幻觉的特有来源有三点。一是视觉侧信息丢失,模型在压缩视觉token或处理低分辨率输入时遗漏细节,只能靠语言先验猜测。二是视觉与语言先验冲突,当图像事实不符合常理时,语言模型的世界知识会压过实际内容。比如图中有三只猫,但语言先验认为家庭照通常只有一两只,模型就会答错。三是训练数据中图文弱相关,导致模型学到不细看图也能答题的习惯。
缓解需分层处理。训练侧增加视觉定位类数据,要求描述必须依赖图中的具体区域,并引入矛盾样本。推理侧引入强制视觉溯源,要求模型先引用图中证据再作答,并通过高分辨率输入降低压缩率。系统和规则侧则用检测模型做事实一致性校验,对低置信度结果拒答。对于数量、颜色和文字等关键字段,直接走OCR或专用检测器交叉验证。
最后可以这样收束:治理多模态幻觉先要区分是感知性还是知识性幻觉,前者治视觉链路,后者治知识供给,两类问题必须分开治。
面试官会怎么追问
- 「RAG在缓解多模态幻觉中具体起什么作用?能解决所有幻觉吗?」 RAG主要用于补充外部知识,比如图标含义或领域客观事实。它压制的是知识性幻觉,但压不住模型没看清图导致的感知性幻觉——如果模型在视觉提取阶段看错图,检索再多文档也无法纠正。
- 「如果在推理阶段不增加额外模型,怎么降低语言先验的干预?」 可采用强制视觉溯源的提示词策略,要求模型在输出答案前,必须先输出对应物体在图中的坐标位置。这能强迫模型将注意力集中在视觉输入上,强制从图像中寻找证据,降低凭空捏造概率。
- 「对于业务中绝对不能出错的关键字段,你们怎么用规则兜底?」 针对数量、颜色或图中文本等特定属性,纯靠生成模型很难保证绝对准确。业务中通常提取这些关键字段,调用成熟的OCR引擎或目标检测器交叉验证。如果生成内容与检测器结果冲突,则触发低置信拒答。
回答的坑
- 认为引入RAG就能解决所有多模态幻觉,没有意识到RAG无法修复视觉链路上的感知性错误,需明确两类幻觉要分开治理。
- 将多模态幻觉完全等同于纯文本幻觉,忽视了视觉token压缩和低分辨率输入这一多模态特有的信息丢失来源。
同系列的题
—— 本题完 ——