Q961评测与可观测真题解析评测AgentAlpha 社区真题库约 8 分钟更新 2026-09-29

幻觉有哪些不同类型

幻觉有哪些不同类型

1️⃣ 考察意图

面试官想看你是否对LLM的“错误模式”有系统认知,而非零散地背几个例子。这属于分类体系+工程取舍型问题。刁钻点在于:多数人只答“事实性幻觉”,但面试官期待你区分来源(训练数据 vs 上下文 vs 推理)和可检测性(硬事实 vs 软逻辑)。答好了能展示你具备构建幻觉检测/缓解系统的顶层设计能力,知道每种幻觉该用什么方法去抓、去修。

2️⃣ 标准答

幻觉分类可以从三个维度切分:事实性、忠实性、逻辑性。每个维度下还有子类,对应不同的检测和缓解策略。

事实性幻觉(Factuality Hallucination)

  • 定义:输出与世界知识矛盾,即“说错话”。例如模型声称“《红楼梦》的作者是曹雪芹和施耐庵”。
  • 子类:
  • 实体错误:人名、地名、日期等硬事实出错。常见于长尾实体(如“2024年诺贝尔化学奖得主”)。
  • 关系错误:实体间关系搞反(如“爱因斯坦发明了相对论”正确,但说“牛顿发明了相对论”错误)。
  • 检测方法:用知识图谱(如Wikidata)或检索增强(RAG)做事实校验。工程上常用NLI模型(如DeBERTa-v3)判断输出与检索文档是否矛盾。
  • 坑与解法:RAG检索到的文档本身可能过时或错误。解法是多源交叉验证:对同一事实从3个独立源(如Wikipedia+新闻+百科)检索,取多数一致结果。

忠实性幻觉(Faithfulness Hallucination)

  • 定义:输出与输入上下文不一致,即“不听话”。例如用户给了一段代码,模型却解释成另一段逻辑。
  • 子类:
  • 指令忽略:模型没遵循用户明确约束(如“用中文回答”却输出英文)。
  • 上下文污染:模型混入了对话历史中无关信息(如多轮对话中把A问题的答案用到B问题)。
  • 自我矛盾:同一回答内前后矛盾(如先说“Python是编译型语言”,后说“是解释型”)。
  • 检测方法:用上下文一致性评分。常用ROUGE-L或BERTScore计算输出与输入的重叠度,但更鲁棒的是训练一个忠实性分类器(如TrueTeacher模型),专门判断输出是否忠于输入。
  • 坑与解法:忠实性检测容易误判“创造性总结”为不忠实。解法是引入抽象度阈值:当输出与输入语义等价但措辞不同时,用语义相似度(如Sentence-BERT)而非字面匹配。

逻辑性幻觉(Logical Hallucination)

  • 定义:输出在推理链条上断裂或矛盾,即“想错了”。常见于数学、多步推理任务。
  • 子类:
  • 计算错误:如“1234 + 5678 = 6912”(正确答案是6912?实际是6912,但模型可能算成6913)。
  • 因果倒置:如“因为下雨,所以地是干的”。
  • 循环论证:用结论证明前提。
  • 检测方法:用思维链验证(Chain-of-Thought Verification)。让模型生成推理步骤,然后用另一个模型(或同一模型)逐步骤检查逻辑一致性。工程上可用自洽性采样(Self-Consistency):对同一问题采样5次,如果答案不一致,大概率是逻辑幻觉。
  • 坑与解法:模型可能“看似有逻辑”但每一步都错。解法是分步验证:对每一步用形式化验证(如用Python执行数学表达式),或反向推理(从答案反推条件是否成立)。

知识边界幻觉(Knowledge Boundary Hallucination)

  • 定义:模型对未知领域自信编造,即“不懂装懂”。例如问“2025年火星殖民计划细节”,模型编出具体日期和预算。
  • 检测方法:用不确定性量化。常用logit熵或句级困惑度(perplexity)。高熵/高困惑度区域大概率是知识边界。
  • 坑与解法:模型可能对常见问题也高熵(如“1+1=?”)。解法是校准:用温度缩放(Temperature Scaling)调整置信度,或训练一个拒绝回答分类器(如基于模型内部hidden states)。

3️⃣ 答题模板(30 秒电梯版)

“这个问题我从事实性、忠实性、逻辑性三个层面回答。事实性幻觉是输出与世界知识矛盾,用RAG+多源交叉验证检测;忠实性幻觉是输出与输入上下文不一致,用忠实性分类器+语义相似度;逻辑性幻觉是推理链条断裂,用思维链验证+自洽性采样。总结一句:幻觉分类的核心是区分‘错在哪’——是知识错、上下文错、还是推理错,每种对应不同的检测和缓解策略。”

4️⃣ 高频追问 & 应对

追问 1:你刚才说用RAG缓解事实性幻觉,但RAG本身也会引入幻觉(比如检索到错误文档),你怎么处理?

这是一个经典trade-off:RAG增加了知识广度,但引入了检索噪声。解法是多级过滤:第一级用检索相关性评分(如BM25+Cross-encoder)过滤低质量文档;第二级用事实一致性模型(如FactScore)判断输出与检索文档是否矛盾;第三级用置信度阈值:如果模型对输出logit熵>0.8,则拒绝回答并触发“我不确定”响应。工程上,我们曾在电商场景中把RAG幻觉率从12%降到3%,代价是召回率下降了5%。

追问 2:逻辑性幻觉检测中,自洽性采样很耗资源,有没有更轻量的方法?

有。轻量方案是单步验证:对模型输出,用反向提示(如“请检查上述推理中是否有错误”)让同一个模型自我校验。更轻量的是规则启发式:对数学问题,直接提取数字和运算符,用Python eval()执行计算并对比。但规则法只能覆盖结构化任务。工程取舍是:对高频任务(如数学)用规则,对开放任务用自洽性采样,对中间任务用反向提示。我们曾在客服场景中,用反向提示替代自洽性采样,推理成本降低70%,但漏检率上升了15%。

追问 3:你怎么区分“忠实性幻觉”和“创造性总结”?比如用户要求“用一句话概括”,模型输出和原文措辞不同。

关键看语义等价性。忠实性幻觉是信息丢失或扭曲,创造性总结是信息压缩但核心不变。检测时用语义相似度(如Sentence-BERT cosine > 0.85)而非字面匹配。更鲁棒的是用信息覆盖度:从原文提取关键实体和关系(用NER+关系抽取),检查输出是否覆盖了所有关键实体。如果输出漏了核心实体(如“苹果公司CEO”变成“CEO”),则判为忠实性幻觉;如果只是换措辞但实体都在,则判为创造性总结。

5️⃣ 避坑 · 常见错误答法

  • ❌ 只答“幻觉就是模型胡说八道,分事实性和逻辑性两种” → ✅ 必须给出三级分类(事实性/忠实性/逻辑性)和子类(如实体错误 vs 关系错误),并说明每种检测方法。
  • ❌ 说“用RAG就能解决所有幻觉” → ✅ 必须指出RAG的局限(检索噪声、过时文档),并给出多级过滤或置信度校准方案。
  • ❌ 把“忠实性幻觉”和“事实性幻觉”混为一谈,说“都是模型知识不足” → ✅ 必须区分来源:事实性来自训练数据,忠实性来自上下文处理,逻辑性来自推理能力。

6️⃣ 简历呼应

  • 如果你有RAG项目:从“RAG缓解事实性幻觉的工程实践”切入,讲你如何用多源交叉验证和置信度阈值降低幻觉率,并给出具体数字(如从15%降到5%)。
  • 如果你只做过传统NLP:用“文本蕴含任务”类比——事实性幻觉类似“矛盾类”,忠实性幻觉类似“中立类”,逻辑性幻觉类似“推理错误类”。展示你能把旧经验迁移到新问题。
  • 如果你是校招无项目:聚焦“幻觉分类论文复现”,比如复现《Survey of Hallucination in Large Language Models》中的分类体系,并自己构建一个小型标注数据集(从NQ采样100条模型输出),训练一个多标签分类器,输出F1分数。
  • 《Survey of Hallucination in Large Language Models: Taxonomy, Detection, and Mitigation》(2023)
  • 《TrueTeacher: Learning Factual Consistency Evaluation with Large Language Models》(2023)
  • 《Self-Consistency Improves Chain of Thought Reasoning in Language Models》(2022)
  • 《FactScore: Fine-grained Atomic Evaluation of Factual Precision in Long-form Text Generation》(2023)
  • 《RAG vs Fine-tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture》(2024)

—— 本场面试完 ——