Training & Generation

语言模型如何训练和生成

从预训练、后训练到逐 token 生成,建立理解现代语言模型的最小机制图。

The Question

模型是在查答案,还是在生成答案?

Must Know

必须掌握

  1. 预训练学习上下文中下一个 token 的概率规律,不是把网页原样存成可检索数据库。
  2. 预训练、后训练和推理是三个阶段:基础能力、可用行为和一次具体生成不能混为一谈。
  3. 输出是逐步生成的;流畅、稳定和事实正确是三项不同属性。

Know Enough

应当了解

  • 参数与训练数据的关系
  • 损失函数与泛化的直觉
  • 温度、采样和确定性输出

Put It to Work

落实到工作

  1. 01

    对同一问题重复提问三次,观察哪些内容稳定、哪些只是生成波动。

  2. 02

    要求模型分别给出结论、依据和不确定项,避免把语气当作证据。

  3. 03

    涉及事实时转入检索和原文核验,而不是继续追问模型“你确定吗”。

Common Mistakes

不要这样理解

  • 把语言模型称为数据库
  • 把后训练后的礼貌语气当成理解
  • 认为低温度就能保证事实正确

Primary Sources

继续阅读

  1. 01Attention Is All You Need
  2. 02Language Models are Few-Shot Learners
  3. 03Scaling Laws for Neural Language Models