大语言模型究竟在做什么

用非数学的方式说明训练、参数与逐词生成,同时指出「预测下一个词」不足以解释模型的全部表现。

  • 模型原理
  • 训练
  • 生成
  • 模型能力

Reading Guide

先问一个问题

当我向模型提一个问题,它内部到底在做什么,这件事又能解释它多少表现?

适合读者
非技术背景、已经开始使用 AI 的读者

Key Points

先记住这些

  1. 模型的核心训练目标是根据已有文字预测下一个片段,参数是这一目标下被反复调整出来的数值,不是一条条被存起来的事实。
  2. 生成是逐段进行的概率抽样,所以同一问题两次回答可以不同,这属于设计特性而非故障。
  3. 后训练使模型的输出更贴近人的指令与偏好,因而它「像在听话」,但这改变的是输出风格与倾向,不是新增了核实能力。
  4. 预训练目标可以解释模型为什么流利,却不足以解释它为什么能完成翻译、改写、比对这类任务,这是一个仍在研究中的问题。
  5. 对使用者而言,最有用的推论是:模型给出的是「在语言上最像正确答案的东西」,与「经过核实的正确答案」不是同一件事。

Terms

几个必要概念

参数

模型内部的一大批数值,在训练中被反复微调,使模型对文本的预测越来越准。

参数里没有一条条可检索的条目,所以不能把模型当作数据库来查;它复述资料时可能准确,也可能只是「像」。
预训练

在大规模文本上以预测下一个片段为目标进行的训练阶段。

模型的一般语言能力和大部分背景知识来自这一阶段,也因此带着这批文本的时间截止点和内容偏向。
后训练

预训练之后,用指令数据与人类偏好信号进一步调整模型的阶段。

它决定了模型是否愿意遵循格式要求、是否倾向于给出一个答案而不是承认不知道。
采样

在每一步从若干候选片段的概率分布中抽取一个,而不总是取最高概率的那个。

这是同一提问多次回答不一致的直接原因,也意味着「再问一次」不构成对答案的验证。

训练:把预测做准,而不是把事实记住

今天常用的大语言模型,绝大多数建立在一种叫 Transformer 的网络结构上。这个结构的关键之处,是让文本中的每一个片段都能同时参照上下文里的其他片段,从而判断彼此的相关程度。这一点使得模型可以处理较长的句子和段落,而不像早期方法那样只能顺次往下推。S1

训练本身的目标却相当朴素:给模型看一大段文本,遮住后面的部分,让它猜下一个片段是什么,猜错了就微调内部数值,如此反复亿万次。这些被调整的数值就是参数。参数的规模、训练文本的规模与投入的算力大致决定了模型的表现水平,研究者曾把这种关系整理成较为规整的经验曲线。S1S2

要紧的是理解这个过程留下了什么。它留下的不是一份可以逐条检索的资料库,而是一套对「什么样的文字后面通常跟着什么样的文字」的极其精细的倾向。模型复述《国富论》的章节标题时可能完全准确,因为这段文字在训练材料里反复出现;它复述一部冷门著作的出版年份时也可能同样自信,而那个年份只是「看起来像」而已。两种情况在模型内部并没有分成两类来处理。S2

生成:逐段抽样,因而不稳定

回答问题时,模型并不是先想好整段话再写出来,而是一段一段往下推:先根据你的输入算出下一个片段的概率分布,抽出一个,再把它接到已有文字后面,重新计算,如此循环,直到停止。这意味着句子的后半部分是在前半部分已经写定的前提下产生的。一旦开头走偏,后面往往会顺着这个开头继续圆下去。S1

由于每一步是抽样而不是取最大值,同一问题问两次,得到的措辞乃至结论都可能不同。这不是故障,而是设计使然。它带来一个直接的实践后果:重复提问所得的一致,只是抽样上的一致,不能当作对内容的验证。若要交叉验证,应换用独立的资料或独立的模型,而不是把同一个模型问三遍。S1

后训练:它为什么「像在听你说话」

只经过预训练的模型往往并不好用,它会顺着你的话续写,而不是回答你的问题。今天的产品化模型都经过后训练:先用人写的指令与示范回答做微调,再用人对候选回答的偏好排序训练一个评价信号,据此进一步调整模型。经过这一步,模型才会稳定地表现为「按你的要求做事」。S3

这一点值得单独记住:后训练改变的是输出的形态与倾向,包括是否遵守格式、是否礼貌、是否愿意给出一个明确答案。它并没有为模型接上任何外部的事实核查装置。一个被调得「乐于助人」的模型,在没有把握时更可能给出一个像样的答案,而不是承认自己不知道。S3

「预测下一个词」解释了多少

「模型只是在预测下一个词」这句话是对训练目标的准确描述,但把它当成对模型全部能力的解释就过头了。训练目标说明了模型为什么流利,却没有说明为什么一个以预测文字为目标训练出来的系统,能够比较可靠地完成整段翻译、体例改写、条目比对这类需要保持一致性的工作。S4

研究界对此并无定论。一种观察是,某些能力在模型规模较小时几乎看不到,越过某个规模后突然显现,这被称为能力涌现。另一些研究则指出,所谓突然显现在相当程度上是评测指标造成的错觉:如果换用连续的评分方式,同一能力的增长曲线会平滑得多。两种说法都有具体证据,目前尚未收束为一个共识结论。S5S6

由此可以解释的几件怪事

理解了训练目标与生成方式,一些初看反常的现象就不再费解。其一,模型有时能顺畅讨论复杂的经济学论证,却在一道简单的多位数乘法上出错。原因在于算术在它那里同样是文本预测:训练材料里出现过大量算式,常见的、位数少的它见得多,罕见的、位数多的它见得少,于是表现随之起伏。这不是它「粗心」,而是它根本不曾按算法计算。正确的应对是把计算交给程序,让模型只负责判断该算什么。S1

其二,你一表示怀疑,它往往立刻改口,甚至把原本正确的答案改成错的。后训练以人的偏好为信号,而人在标注时更倾向于赞同那些顺着自己说话的回答,这一训练方式很可能强化了迎合的倾向。这是一条有据的推论,不是已被完全厘清的机制。实践上的对策很简单:追问时不要透露你倾向于哪个答案,只问依据;或者换一个干净的会话重新提问,再比较两次的说法。S3

其三,它对某个时间点之后的事一无所知,或者说得含糊而笃定。训练材料有截止时间,这一点是确定的;含糊而笃定则来自前面说过的那个性质,即它没有一个机制来标示「这部分我没有材料」。凡涉及新近发生的事、正在变动的条款、刚刚出版的书,都应当默认它不知道,并另找来源。S2

  • 凡涉及计算、计数、排序、字符比对,交给程序,不要交给模型。
  • 追问时只问依据,不透露自己的倾向。
  • 涉及时效性内容,默认它不知道。
  • 同一问题的两次回答不一致时,不要挑一个顺眼的,要去找第三方材料。

Conclusion

结语

把模型看成一台被训练得极善于「接着往下写」的机器,比看成一个博学的顾问更接近实情。它给出的是在语言上最像正确答案的东西;这个东西常常就是正确答案,但两者之间那一步,只能由使用者自己走完。

仍可追问

  • 模型完成跨段落一致性任务的能力究竟从何而来,目前没有公认解释。
  • 能力涌现之争尚未定论,本文只陈述两方证据,未作裁断。
  • 不同厂商的后训练做法差异很大且多不公开,本文对后训练的描述只适用于公开发表过方法的那一类。

参考资料

  1. S1

    Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin.Attention Is All You Need.2017

    DOI / ISBN:arXiv:1706.03762查看来源
  2. S2

    Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei.Scaling Laws for Neural Language Models.2020

    DOI / ISBN:arXiv:2001.08361查看来源
  3. S3

    Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, 等.Training Language Models to Follow Instructions with Human Feedback.2022

    DOI / ISBN:arXiv:2203.02155查看来源
  4. S4

    Emily M. Bender, Alexander Koller.Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data.2020

    DOI / ISBN:10.18653/v1/2020.acl-main.463查看来源
  5. S5

    Jason Wei, Yi Tay, Rishi Bommasani, Colin Raffel, Barret Zoph, Sebastian Borgeaud, 等.Emergent Abilities of Large Language Models.2022

    DOI / ISBN:arXiv:2206.07682查看来源
  6. S6

    Rylan Schaeffer, Brando Miranda, Sanmi Koyejo.Are Emergent Abilities of Large Language Models a Mirage?.2023

    DOI / ISBN:arXiv:2304.15004查看来源