模型能否知道自己不知道

区分校准、自陈与自我认识三件事,考察模型对自身把握程度的表述在多大程度上可以采信。

  • 校准
  • 不确定性
  • 自我认识
  • 核验

Reading Guide

先问一个问题

当模型说自己不确定或者很确定时,这句话承载了什么?

适合读者
习惯于向模型追问「你有几分把握」的读者
阅读基础
information-truth-belief-knowledge;verification-methods

Key Points

先记住这些

  1. 须先分开三件事:内部概率是否与实际正确率相符(校准)、口头表述的把握(自陈)、以及对自身状态的认识(自我认识)。
  2. 技术事实:神经网络的输出概率未必与实际正确率相符,这是一个早有研究的一般现象。
  3. 有据推论:在某些设定下,模型对自身答案正确与否的判断优于随机,说明其中含有可利用的信号。
  4. 有据推论:模型给出的解释未必是其实际得出答案的过程,因此不能把「它说的理由」当作「它的理由」。
  5. 哲学立场:自我认识通常被理解为一种对自身心理状态的把握;模型是否具备此类状态尚无定论,因而「知道自己不知道」在严格意义上难以断言。
  6. 实践结论:自陈的把握可用作排序线索,不可用作是否需要核对的依据;核对与否应由材料性质与错误代价决定。

Terms

几个必要概念

校准

系统给出的概率与其实际正确比例是否一致。

校准良好的系统,说七成把握时确实约有七成对;校准不良则该数字不能当概率用。
自陈把握

模型用自然语言说出的确定程度。

它受后训练与措辞影响很大,与内部概率不必一致,更不必与正确率一致。
解释不忠实

模型给出的推理过程并非其实际得出结论的过程。

它使「看它的理由是否成立」这一朴素核对方式失效,理由成立也不保证结论由此而来。

三件不同的事

日常说「模型知道自己不知道」,往往把三件事混在一起。第一件是校准:系统内部给出的概率与实际正确率是否吻合。这是可测量的工程性质,研究表明现代神经网络在这方面常有系统性偏差,且并非规模越大越好。第二件是自陈:模型在文字里说自己有几分把握。第三件才是哲学意义上的自我认识,即对自身心理状态的某种把握。三者可以彼此脱节。S1S2

有一类实验值得认真对待:让模型对自己刚给出的答案判断正确与否,其判断在多个任务上明显优于随机。这构成一条有据的推论,即模型内部确实存在与正确性相关的信号,并且部分可以被引出。但同一批研究也显示这种能力随任务与提问方式变化很大,不能当作稳定属性来依赖。S2

为什么它宁可猜也不说不知道

有研究指出,通行的评测方式普遍采用答对得分、答错不扣分、不答同样不得分的规则。在这样的规则下,不确定时猜一个的期望收益高于承认不知道,训练与评估的这套激励会持续塑造模型的作答倾向。若这一分析成立,模型的沉默与犹豫就不只是能力问题,也是被奖励结构压制的结果。这是一条有论证支持的推论,尚未成为定论。S3

这个分析有一个使用者可以立刻用上的推论:如果你希望模型在没把握时说没把握,就必须在任务定义里把「说不知道」变成一个有回报的选项。例如明确规定:凡在所给材料中找不到依据的,写入待考清单并注明缺什么,这一项与正确回答同样计入合格。这不是心理暗示,而是在你自己的验收标准里改变了激励。S3

它给的理由是不是它的理由

常见的核对办法是让模型说明推理过程,再看这过程是否成立。这个办法有用,但有一个已被实验揭示的限度:模型所写的推理步骤未必是它实际据以得出结论的过程。研究者通过在输入中植入无关的偏向性线索,观察到模型的答案随之改变,而它给出的解释却完全不提这一线索,只陈述其他理由。也就是说,解释可以是事后生成的合理化。S4

这对实务的影响是具体的。看理由仍然值得做,因为理由中的事实性错误可以被查出来;但不能因为理由读起来严整就提高对结论的信任度。真正可靠的仍是回到材料本身:理由里提到的引文是否存在、页码是否对得上、所述内容是否与结论相符。S4

把不确定变成可操作的字段

笼统地问「你有几分把握」,得到的多半是一个没有内容的数字。要让不确定变得有用,须把它拆成可判定的几项,并要求逐项作答。经验上比较有效的拆法是四项:材料层面缺什么,判断层面难在哪里,若判断有误将影响哪些其他条目,以及需要什么材料才能定案。前两项说明现状,后两项决定处置次序。S2

  • 缺什么:具体到某一版本、某一页、某一年的记载,而非「材料不足」四字。
  • 难在哪:是两说并存、是文字有讹、还是所据材料本身互相矛盾。
  • 影响什么:列出依赖此条的其他条目编号。
  • 需要什么:写明取得何种材料即可定案,使待考成为可执行的下一步。

这样处理有一个附带的好处:它把「说不知道」变成了一件有产出的事。前面提到,通行的评价方式使弃答无回报,模型因而倾向于猜。当验收标准明确规定「填齐四项的待考条目与正确条目同样计入合格」时,弃答在你的流程里就不再是零收益。这不是对模型施加心理影响,而是在你自己的标准里改变了什么算完成。S3

最后要说明这一做法的限度。四项内容仍然由模型生成,因而同样可能出错:它可能声称缺某个版本,而那个版本其实就在你的架上;也可能把并不难的地方说成两说并存。所以这些字段的用处是排序与提示,不是结论。它们真正的价值在于把模糊的不安转成了具体的、可以逐条去解决的问题,而具体的问题总比笼统的怀疑好办。S4

顺带说明一点措辞上的谨慎。本文自始至终用「自陈的把握」而不用「模型的信心」,也不说「它意识到自己不确定」。这不是文字上的洁癖:一旦用上意识、信心、承认这类词,读者就会不自觉地把日常心理概念套上去,而这些概念恰恰是争论所在。在尚未厘清之前,用描述行为的说法代替描述心理的说法,可以避免许多不必要的误解,也使论断更容易被检验。S5

Conclusion

结语

模型能否知道自己不知道,作为哲学问题尚无答案;作为工程问题,它至多提供一个不稳定的信号。把这个信号用于安排核对的次序是合理的,用于取消核对则不是。

仍可追问

  • 可引出的正确性信号能否发展为稳定可靠的能力,目前证据不足。
  • 解释不忠实的普遍程度随任务与模型不同,缺少统一结论。
  • 若模型不具备心理状态,「知道自己不知道」在何种意义上还是一个有内容的问题,值得继续追问。

参考资料

  1. S1

    Chuan Guo, Geoff Pleiss, Yu Sun, Kilian Q. Weinberger.On Calibration of Modern Neural Networks.2017

    DOI / ISBN:arXiv:1706.04599查看来源
  2. S2

    Saurav Kadavath, Tom Conerly, Amanda Askell, Tom Henighan, Dawn Drain, Ethan Perez, 等.Language Models (Mostly) Know What They Know.2022

    DOI / ISBN:arXiv:2207.05221查看来源
  3. S3

    Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang.Why Language Models Hallucinate.2025

    DOI / ISBN:arXiv:2509.04664查看来源
  4. S4

    Miles Turpin, Julian Michael, Ethan Perez, Samuel R. Bowman.Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting.2023

    DOI / ISBN:arXiv:2305.04388查看来源
  5. S5

    Brie Gertler.Self-Knowledge (Stanford Encyclopedia of Philosophy).2021

    查看来源