幻觉为什么会出现:大模型为什么会把不确定的内容说得像真的
从概率生成、训练目标、知识边界和上下文误读出发,理解大语言模型幻觉的成因,并掌握检索、核对和表达不确定性的缓解方法。
相关工具
幻觉不是模型故意撒谎
大模型幻觉通常指模型生成了看起来通顺、具体,甚至很有说服力,但缺少事实依据或与事实不符的内容。它可能编造不存在的书名、论文、人物经历和接口参数,也可能把两个相近的概念混在一起,或者把一个不确定的推测说成确定结论。
把它叫作‘幻觉’很形象,但模型并没有人的意图,也不是先知道真相再决定欺骗用户。它的基本工作方式仍然是根据输入上下文预测后续 Token。只要某种说法在语言上很顺、和上下文很相似,模型就可能把它生成出来,即使现实世界里没有对应的证据。
这也是大模型使用中最容易被忽略的风险:表达流畅只能说明语言组织得好,不能自动证明事实正确。模型越擅长把句子写得完整,未经核对的内容就越容易被误认为可靠。

当问题信息不足或有歧义时,模型仍会依据概率生成看似合理的续写,结果可能缺少事实依据。
第一个原因:训练目标是生成,不是查证
预训练阶段常见的目标是预测下一个 Token。这个目标能让模型从大量文本中学到语法、表达、知识关联和常见的问答结构,却没有直接要求它为每个句子附上现实世界的证据。模型学会的是‘这段话后面通常会接什么’,不是一个始终实时更新的事实数据库。
当用户提问时,模型会综合问题中的词语、上下文、训练中见过的表达和生成概率,选择一条看起来合适的回答路径。如果问题本身就要求一个具体名称、日期或出处,而模型没有足够把握,它仍然可能沿着最像答案的语言模式继续写下去。于是就出现了‘细节很多,却找不到来源’的回答。
这不代表预训练没有学到事实,而是事实知识和事实查证不是一回事。模型可能记住某个主题的常见叙述,却无法判断某个细节是否来自可靠来源,也无法保证资料没有过时。涉及重要事实时,生成能力需要和检索、引用或人工核对配合。
第二个原因:问题可能没有给模型足够依据
问题信息不足时,任何回答系统都会面临不确定性。比如只给出一个含义不明的简称,要求模型直接解释某个内部项目,或者让它总结一份实际上没有提供的文件。人通常会先追问背景,模型却可能从相似表达中猜一个最可能的方向。
上下文过长或结构混乱也会增加风险。关键信息可能被埋在大量材料中,多个版本的事实可能同时出现,模型还可能把示例、假设和真实结论混在一起。它看到的文字越多,不等于抓住的证据越准确;上下文窗口解决的是‘能看到多少’,不自动解决‘哪些内容可信’。
多轮对话还有额外问题。模型会根据当前对话维持连贯性,如果前面某一句已经出现错误,后续回答可能为了保持一致而继续沿用这个错误。连贯性在语言上是优点,在事实核查上却可能变成错误的放大器。
第三个原因:流畅度和真实性不是同一个指标
模型的输出概率主要反映某段文本在当前上下文中是否常见、是否顺接,并不等于这段文本在现实中是否成立。‘某机构发布了某报告’在语言上完全像一个正常句子,模型可能有很高的生成倾向,但这句话是否真的发生过,还需要外部资料确认。
训练中的指令微调和偏好优化会让回答更清楚、更完整、更像一个助手。它们改善了模型的使用方式,却不能凭空为每个未知事实建立可靠来源。如果偏好数据过度奖励肯定、完整和有条理的表达,模型反而可能学会在缺少依据时也给出看似完整的答案。
因此,评估模型不能只问‘写得像不像’,还要检查引用是否存在、数字是否一致、结论能否由材料推出,以及模型面对证据不足时是否会停下来说明不确定性。真实可靠需要单独评测,不能从文字风格推断。
怎样判断一条回答可能有幻觉
具体而无法核对的细节值得警惕。包括精确的论文标题、作者、发布日期、统计数字、法规条款、产品参数和网址。细节越具体,越应该要求来源或进行独立检索。找不到来源不一定能证明内容是错的,但足以说明不应该直接把它当成事实使用。
语气过于肯定也是一个信号。问题本身有歧义、资料明显不足,回答却没有任何条件说明,反而给出完整的背景、因果和结论,这时要把事实拆开检查。特别是当模型开始补充用户没有提供的机构、人物和事件时,不要因为细节丰富就提高信任度。
还可以观察回答是否能区分事实、推测和建议。可靠的回答会告诉你哪些内容来自给定材料,哪些是一般知识判断,哪些只是可能的解释。把不同证据等级混成一段肯定叙述,是幻觉最容易藏身的地方。

有来源支持的内容可以引用,一般知识判断需要核对,证据不足时应先查资料再回答。
减少幻觉,先从输入和资料做起
第一步是把问题说清楚。补充时间范围、对象、输出目标和判断标准,减少简称、代词和隐含背景。对于资料问答,直接提供原文或明确告诉模型只能依据给定材料回答,并要求它指出材料中没有覆盖的部分。问题越清楚,模型越不需要靠猜测填空。
第二步是为需要事实的任务引入可靠资料。RAG 的基本思路就是先检索相关概念,再把检索结果放进上下文,让模型根据这些材料组织回答。检索不能保证零幻觉,资料切分错误、召回不相关概念、来源本身过时,都会把错误带进回答,所以来源筛选和引用位置同样重要。
第三步是让模型保留不确定性。可以要求它在找不到依据时明确说‘资料不足’,列出需要补充的信息,或者把答案分成‘材料明确说明’和‘基于一般知识推断’两部分。让模型有权不猜,比要求它每次都给出完整答案更可靠。

明确问题、检索资料、生成回答、核对事实,并在证据不足时说明不确定性。
哪些方法不能单独解决幻觉
提高模型规模不能单独消除幻觉。更大的模型可能拥有更广的知识和更好的上下文处理能力,但也可能生成更流畅、更难察觉的错误。模型能力增强后,事实核对仍然是独立任务。
降低温度也不能把回答变成事实数据库。较低的随机性会让输出更稳定,但如果模型的高概率路径本来就是错误的,它只会更稳定地生成同一个错误。增加提示词中的‘不要幻觉’也有帮助,但不能替代可靠资料、引用和评测。
训练和对齐可以减少某些常见错误,却不可能预先覆盖所有新问题。真实应用需要把模型放在完整流程里看:什么时候检索,什么时候调用工具,哪些结果必须人工确认,哪些任务根本不应交给模型直接决定。
可以这样理解大模型幻觉
幻觉的根源,是语言模型擅长根据概率生成连贯文本,却不天然拥有实时、完整和可验证的现实世界依据。当问题有歧义、上下文缺证据、知识过时或回答被要求得过于肯定时,生成机制就可能把‘最像答案’当成‘真实答案’。
实际使用中,最有效的习惯不是要求模型永远不犯错,而是让事实任务有来源,让关键结论可核对,让证据不足时可以停下来。把模型当成能组织信息的助手,而不是自动盖章的事实机器,很多风险会更容易被看见。
常见问题
大模型产生幻觉,是不是因为它完全没有学到事实?
不是。模型可能学到大量事实关联,但生成知识和实时查证不是一回事,遇到具体、过时或缺少上下文的问题时仍可能出错。
把温度调低能不能解决幻觉?
只能减少部分随机变化,不能保证事实正确。如果错误本身就是高概率生成路径,低温度可能只是让错误更稳定。
RAG 能保证模型不再产生幻觉吗?
不能。RAG 能提供外部资料作为依据,但检索结果、资料质量和模型对资料的理解仍可能出错,需要引用和事实核对。