Skip to content

幻觉:成因与缓解

本页速览 幻觉是大模型"一本正经地胡说八道"的现象,是生成式 AI 信任问题的核心。本文系统讲清幻觉的分类(事实性/忠实性、知识/推理)、五类成因、数据到评测的分层缓解体系、RAG 的作用边界,以及"AI 撒谎 vs 幻觉"的意图辨析。

幻觉:成因与缓解

幻觉(hallucination)指语言模型生成了流畅、自信但与事实不符或与依据内容不符的内容——模型"一本正经地胡说八道"。它是大模型进入真实业务后最普遍的信任障碍:客服回答错政策、法律摘要编造判例、代码注释生成不存在的 API,都属于幻觉。

本文先给幻觉下定义与分类,再拆成因,然后给出数据/训练/推理/检索/评测五层的缓解体系,最后讨论 RAG 的关系与"撒谎 vs 幻觉"的边界。诚实性评测与评测与基准、安全责任见安全与风险

一、幻觉是什么:定义与分类

学术上(Ji et al., 2023 综述)幻觉通常按"与什么不一致"分成两大类:

大类不一致的对象典型表现
事实性幻觉(factuality)客观世界事实不符编造人物生平、错误统计数据、虚构文献
忠实性幻觉(faithfulness)输入依据(源文档/上下文)不符摘要里出现原文没有的结论、改写偏离原意

另一种常用切分是按成因分:

类型含义例子
知识幻觉模型"知道"的东西本身错/缺失长尾知识、冷门人物细节编造
推理幻觉步骤或逻辑链条出错数学题算错但装作会做

为什么要区分

事实性幻觉的修复靠"给对的知识"(检索、知识库);忠实性幻觉的修复靠"约束生成"(让它只依据给定上下文);推理幻觉的修复靠"给思考时间"(CoT、逐步验证)。病因不同,药方不同——这也是本文按分类展开缓解方案的原因。

幻觉在真实业务中的影响远比"回答错了"严重,几个典型场景:

业务场景幻觉的后果严重级别
客服问答错误政策/价格,用户投诉
医疗/法律/金融建议误导决策,健康与财产损失
摘要与合规文档编造条款,合规风险
代码生成不存在的 API、伪接口,编译失败
教育与知识类产品错误知识被"自信地"传授
新闻/内容生成虚假细节、误导公众

这也是为什么"幻觉误导"同时被安全与风险列为风险类别之一——它不只是质量缺陷,还是责任问题。

二、成因:为什么模型会"自信地错"

幻觉不是"bug",而是语言模型工作机制的结构性副产品。核心成因有五类:

1. 训练目标不区分事实与虚构

预训练目标是"预测下一个词的概率",它学的是文本分布的统计规律,而不是"哪个句子符合真实世界"。预训练语料里小说、谣言、错误信息和真实报道混在一起,模型没有信号去区分"事实"和"虚构"——它只学到"这样写很像人类会写的"。

2. 知识截止与信息过期

模型学到的知识固定在训练语料采集时点(知识截止)。截止之后的新事件、新政策、新版本 API,模型既不知道,又出于"语言流利"的本能继续作答,自然就会编造。这是幻觉最典型的来源之一。

3. 长尾知识弱

知识在语料中的出现频率差异巨大。高频知识("中国首都是北京")模型学得牢;长尾知识(某小城市某条法规的某个细节)在语料中只出现几次,模型只能"猜一个最像的"。频率越低,幻觉率越高,这是规模法则在知识覆盖上的直接体现(见规模法则)。

4. 解码随机性

生成阶段的采样策略会引入随机性(见推理基础:自回归与采样):温度越高、top-p 越大,输出越多样,也越容易"飘"到错误答案。同一个 prompt 多次生成,可能一次对一次错。

5. 对齐的副作用:谄媚(sycophancy)

对齐训练教模型"讨好人"——用户说"我的方案肯定对",模型可能顺着说是。这种"顺从用户预期"的倾向会放大编造,尤其在用户给出错误前提时。

幻觉不能 100% 消除

幻觉的根源在"预测下一个词"的目标本身:模型天生无法区分"说过"与"真的"。任何声称"零幻觉"的方案都值得怀疑。缓解的目标是把幻觉率压到业务可接受的水平,并让模型知道什么时候该说"不知道"

三、缓解幻觉:五层治理体系

幻觉的缓解必须分层治理,单点手段(比如只加 RAG)远不够:

层面手段解决什么成本/代价
数据层预训练语料清洗、去重、事实性过滤源头降低错误信息密度离线成本高
训练层SFT 教"不知道就说不知道";RLHF 把诚实性纳入奖励;提高长尾知识覆盖行为层面减少编造训练成本高、有对齐税
推理层降低温度、约束解码、self-check(模型自我核查)、提示要求"不确定就说明"当次生成的可控降低多样性、增加时延
检索层RAG:从外部知识源检索证据再生成注入可靠事实、可溯源依赖检索质量与覆盖
评测层TruthfulQA、忠实度指标、人工抽检、幻觉率监控量化幻觉、驱动迭代需要持续投入标注

推理层的具体手段

text
低风险提示示例(约束模型承认未知):
"如果你不确定答案,请明确说明'我不确定',并给出你能确认的部分。
  禁止编造数据、引用不存在的文献或人物。"

self-check(自我核查)模式:
第 1 轮:让模型生成回答 A
第 2 轮:让模型独立审阅 A——"逐条核对以下回答,标出任何
        你可能不确定或可能不准确的陈述",得到修正版 A'

训练层的诚实性奖励

在 RLHF/DPO 阶段把"诚实"编码进偏好:对"承认不知道"的回答给正偏好,对"编造但自信"的回答给负偏好(见对齐:RLHF 与 DPO)。这是行为层最根本的手段,但要注意与"帮助性"的平衡——过度保守的模型会退化成"我不知道"复读机。

缓解手段的落地顺序

对大多数团队,按性价比排序的落地顺序是:先推理层(提示约束 + 允许说不知道,成本为零)→ 再检索层(RAG 注入可靠事实)→ 再评测层(量化幻觉率、驱动迭代)→ 最后训练层(把诚实性写进偏好,成本最高)。不要一上来就大动干戈地改训练——先用便宜手段压掉大半幻觉,再用评测数据决定是否值得投入训练侧。

产品层的幻觉防御策略

技术层之外,产品设计能显著降低幻觉的实际伤害:

策略做法
场景分层高风险场景降级为"仅检索/仅模板"输出,不给模型自由发挥
证据链关键回答必须附带引用来源,无来源则标注"模型生成,未经核实"
置信度表达引导模型用"根据现有资料""我不确定"等限定词
免责与兜底医疗/法律/金融场景强制人工复核
用户教育明示"AI 可能出错",培养核实习惯

这些策略不改变模型,但把"幻觉伤害"拦在产品边界内——与技术层手段叠加,才是幻觉治理的完整拼图。

四、RAG 与幻觉:治标还是治本?

检索增强生成(RAG)是目前工业界最主流的幻觉缓解手段:先检索相关知识,再让模型基于检索结果生成,让输出"有据可依"。

维度RAG 对幻觉的帮助RAG 的边界
事实来源提供可信事实,替代模型猜测检索库本身可能缺、错、过期
知识截止解决"截止后"的新信息需要持续维护知识库
忠实性约束模型依据上下文生成检索到不相关内容反而"带偏"
可溯源能指出"依据在哪"模型可能引用依据中不存在的细节

RAG 不是免检金牌

RAG 只能把幻觉从"模型编造"转移到"检索与上下文",依据质量决定生成质量:检索结果残缺、被截断、或与问题无关时,模型仍会基于残缺上下文编造。RAG 的正确用法是配合"忠实性校验"(检查输出是否都能在检索文档中找到依据)。系统架构见RAG:检索增强生成,实操见RAG 实战

RAG 与上下文与长文本是互补的两条路:塞进更多上下文可以覆盖更多知识,但注意力稀释与位置衰减(大海捞针测试可见)会让模型"看漏"关键事实——所以长上下文产品同样需要忠实性评测。

RAG 也不是一次配好就完事,常见失效模式:

失效模式表现应对
检索无关检索结果与问题无关,模型被迫编造改善检索质量、query 改写
上下文截断关键证据被切块截断优化 chunk 大小与重叠
多跳问题答案散在多篇文档,单次检索取不全多轮检索、Agent 化 RAG
知识库过期库内信息已过时更新周期管理

详细排查见rag-in-practice

五、"AI 撒谎" vs "幻觉":意图与责任

这是公众讨论中经常混淆的一对概念:

  • 幻觉是"无意的错误":模型没有"知道自己在撒谎"的意图,它只是最大化下一个词的概率。它是机制性的、概率性的。
  • 撒谎/欺骗意味着"明知为假仍故意输出"——当前 LLM 没有稳定的"明知"能力,因此严格意义上不能说模型在撒谎;但模型可以"看起来在撒谎":它会被诱导(用户断言某个错误前提)、会被对齐训练塑造成"迎合",从而输出与它所学事实冲突的内容。

责任在谁?

幻觉的责任在人不在模型:是系统设计者选择让模型"自由发挥"还是"有据可依"。产品层面把 LLM 直接暴露给高风险场景(医疗建议、法律意见、金融决策)而不加证据层与人工兜底,属于设计失误。这也是安全与风险里"幻觉误导"被列为风险类别的原因。

从信任工程的角度,比"消除幻觉"更现实的四件事是:让模型能说"不知道"(校准)、让输出可溯源(引用依据)、让流程可验证(人工复核/证据校验)、让风险可兜底(场景分层)

六、诚实性评测:怎么量化幻觉

幻觉要治理,先能量化。主要手段:

评测手段测什么备注
TruthfulQA(2021)模型识破常见误解/错误信念的比例经典诚实性基准
事实核对生成内容与权威来源的一致性用检索结果逐条核对
忠实度指标摘要/改写与源文档的一致性如 RAGAS 的 faithfulness
幻觉率监控生产环境抽样的人工抽检比例需要人工标注流水线
模型自评让强模型核查回答的可信度成本低、可作为初筛

测量口径:幻觉率 = 抽样样本中"包含至少一处无法证实内容"的回答占比。抽样要随机、样本量要足够(至少 50~100 条才有统计意义),并区分"轻微不精确"与"严重编造"两级——两者治理成本完全不同。

诚实性评测与整体评测体系的关系见评测与基准,工程实现见评估实战

幻觉治理的最低配置

生产系统的最低要求:(1)敏感场景接 RAG 或知识库;(2)提示里允许模型说"不知道";(3)抽检幻觉率并设阈值;(4)高危场景人工兜底。四件事缺一不可——单靠"换个更聪明的模型"解决不了幻觉。

七、幻觉研究的边界与开放问题

幻觉研究还有几个开放问题值得留意:

  • 幻觉的可靠检测:自动检测(NLI 模型、模型自评)与人工检测仍有差距,自动手段准确率不足时不能替代人工抽检;
  • 评测集自身的幻觉:评测集标注错误也会让分数失真——幻觉评测本身要被校验;
  • 校准与诚实性的边界:模型"承认不知道"过多会伤可用性,如何校准"知道自己知道多少"仍无定论;
  • 与记忆的纠缠:模型能否在"记住事实"与"编造事实"之间建立可靠边界,是未来的核心问题。

这些问题的评测侧与治理侧分别链接到评测与基准安全与风险两条主线。

延伸阅读

参考资料