幻觉不是偶尔说错:一套可执行的核验程序

说明幻觉为何是生成方式的结构性产物而非偶发失误,并给出来源核对、交叉验证、抽样检查与自动校验的具体做法。

  • 幻觉
  • 核验
  • 交叉验证
  • 抽样

Reading Guide

先问一个问题

既然模型必然会出错,应当用什么程序把错误挡在成果之外?

适合读者
用 AI 处理需要准确性的资料的读者
阅读基础
what-language-models-do;knowledge-sources-and-retrieval

Key Points

先记住这些

  1. 幻觉是生成方式与训练目标共同造成的结构性现象,不能靠「多提醒几句」消除。
  2. 研究指出,通行的评测方式奖励自信作答、惩罚承认不知道,这会强化模型猜测的倾向。
  3. 错误分两类:与所给材料不符,以及与世界事实不符;前者可自动检出,后者只能靠外部核对。
  4. 同一模型重复提问不是交叉验证;有效的交叉验证必须换独立来源或独立系统。
  5. 全量核对不可行时,用固定比例的随机抽样加全量自动规则检查,是可持续的折中。
  6. 核验记录本身要留存,否则无法判断这批成果当初核到了什么程度。

Terms

几个必要概念

忠实性错误

输出与所依据的材料不一致。

这类错误有参照物,可以用程序或另一个模型作初筛,成本较低。
事实性错误

输出与外部世界的事实不符,即使所给材料中没有相关内容。

这类错误没有现成参照物,必须回到权威资料核对,是最耗人力的部分。
抽样核验

按固定比例随机抽取若干条逐一核对,据以估计整批的错误水平。

它使核验成本可控,同时保留对整批质量的可辩护判断。

为什么说它是结构性的

模型逐段抽样生成,每一步都在挑一个「读起来最像接下去该说的话」的片段。当所需信息在参数中并不确定时,这一机制并不会停下来,而是照样挑出一个最像的说法。生成的流畅程度与内容的可靠程度因此是两条独立的线,这正是幻觉难以靠语气识别的根本原因。相关综述把这类现象系统整理为「生成内容与来源或事实不一致」的若干类型。S1

另有研究进一步指出,问题不只出在预训练阶段。由于大量评测把「答对得分、答错扣分、不答不得分」当作默认规则,模型在不确定时猜一个的期望收益高于承认不知道,训练与评估的这套激励结构会持续强化猜测倾向。若这一分析成立,那么单靠扩大模型规模并不能自动消除幻觉,需要在评价方式上作出改变。这是一条有证据支持的推论,尚未成为定论。S2

在摘要与改写这类有明确原文的任务上,早有研究把错误区分为「与原文不符」与「与事实不符」两类,并发现前者相当普遍。这个区分对实务很有用,因为两类错误的检出成本相差一个量级。S3

四道工序

  • 来源核对:要求每一条结论附带所依据的原文片段与出处标识,凡附不出的一律不进入成果,只入待考清单。
  • 自动校验:把能写成规则的检查全部脚本化,包括字段完整性、编号唯一性、年份区间、来源标识是否存在、术语是否与对照表一致。
  • 交叉验证:换一份独立资料或换一个独立系统重做同一判断,比对分歧点;分歧处正是最该由人细看的地方。
  • 抽样核验:对通过前三道的成果按固定比例随机抽取,逐条回到原书或权威数据库核对,记录错误率。
S1S4

四道工序的次序不能颠倒。先做自动校验再做人工抽样,是因为前者几乎不花时间却能挡掉大量低级错误,把人的注意力留给真正需要判断的地方。先要求出处再谈其他,是因为没有出处的条目根本无从核起,讨论它对不对是浪费。

抽样比例不必追求统计上的严格,但要事先定死并记录。一个可行的起点是首批抽三成,若错误率低于事先设定的阈值则降到一成,若某一批超出阈值则该批全量复核并回头检查任务定义是哪里没写清楚。关键在于比例和阈值是事先定的,不是看到结果之后调整的。S4

看起来管用其实不管用的做法

  • 再问一遍看是否一致:同一模型的两次抽样本来就相关,一致只说明它稳定地这么认为。
  • 让模型自己检查自己:可以作为初筛,不能作为结论;它对自己的错误没有独立的检验渠道。
  • 看语气是否肯定:语气由后训练塑造,与内容可靠性没有稳定关联。
  • 看是否给出了参考文献:文献条目本身也可能是生成的,必须逐条回到原始出处确认存在且内容相符。
  • 在输入里写「不要编造」:这只是一句无法判定的要求,应改写成「无据可依时写入待考清单并注明缺什么」。
S1S2

核验记录该写什么

核验若不留下记录,与没核过在效果上几乎相同,因为半年之后无人能说清当时核到了什么程度。记录不必冗长,一页足矣,但有几项不能省。首先是范围:这次核的是哪一批材料、共多少条、按什么规则划定这一批。其次是方法:自动规则有哪几条,抽样比例多少,抽样是随机还是按某种分层,分层的依据是什么。再次是结果:发现多少处错误,各属哪一类,其中多少已改、多少存疑未决。S4

  • 范围:批次标识、条数、划定规则。
  • 方法:自动规则清单、抽样比例与方式、所用模型与日期。
  • 结果:错误条数与分类、修正情况、未决条目清单。
  • 判断:这一批是否通过,依据哪一条事先设定的阈值。
  • 遗留:本次未能核实的部分,以及为什么未能核实。

最后一项最有价值,也最容易被写成空话。「因时间不足未核」不是理由,「该书未见馆藏,待日后核对影印本」才是可用的记录,因为它指出了下一步该做什么。把未决之事写清楚,成果就从一份声称可信的材料,变成一份说明了自己边界的材料,后者在学术上远为可用。S4

错误分类也值得花点力气。若把所有问题笼统记作「有误」,日后就无从改进;若能分成材料不足、抽取有误、归并有误、体例不合、凭空生成五类,几批之后就能看出问题集中在哪里,进而知道该改任务定义、该补材料,还是该换处理方式。核验记录的用处不止于自证清白,它同时是改进工作方法的唯一依据。S1

Conclusion

结语

把核验当作工序而不是态度,是使用 AI 做学术性工作的分水岭。工序可以被记录、被交接、被他人重做;态度不能。

仍可追问

  • 评价激励导致幻觉这一分析虽有论证,但其在各类实际任务中的解释力尚待更多验证。
  • 抽样比例与阈值的设定在文献整理领域没有现成规范,本文所给数字属经验建议。
  • 让模型互相检查在多大程度上真正独立,取决于两者训练材料的重叠程度,通常无从得知。

参考资料

  1. S1

    Ziwei Ji, Nayeon Lee, Rita Frieske, Tiezheng Yu, Dan Su, Yan Xu, 等.Survey of Hallucination in Natural Language Generation.2023

    DOI / ISBN:10.1145/3571730查看来源
  2. S2

    Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang.Why Language Models Hallucinate.2025

    DOI / ISBN:arXiv:2509.04664查看来源
  3. S3

    Joshua Maynez, Shashi Narayan, Bernd Bohnet, Ryan McDonald.On Faithfulness and Factuality in Abstractive Summarization.2020

    DOI / ISBN:10.18653/v1/2020.acl-main.173查看来源
  4. S4

    National Institute of Standards and Technology.Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST AI 100-1.2023

    DOI / ISBN:10.6028/NIST.AI.100-1查看来源