Post-training & Reasoning

后训练、推理模型与模型行为

辨清基础能力、指令跟随、偏好塑造与推理努力之间的关系。

The Question

模型“想得更久”,是否就更可信?

Must Know

必须掌握

  1. 监督微调和人类偏好反馈主要塑造行为方式,不能把缺失知识凭空补出来。
  2. 增加推理努力可能改善多步问题,却会增加时间与成本,也不会自动消除错误前提。
  3. 自信程度、解释长度与真实正确率之间没有固定对应关系。

Know Enough

应当了解

  • SFT、RLHF 与偏好优化
  • 思考模式和努力等级
  • 系统提示、拒答与安全策略

Put It to Work

落实到工作

  1. 01

    简单任务先用低成本模式,复杂任务再逐级增加推理预算。

  2. 02

    把“列出假设”和“验证假设”分成两个步骤。

  3. 03

    同一任务比较直接回答、分步回答和工具辅助回答。

Common Mistakes

不要这样理解

  • 把思维链当作真实内部过程
  • 认为答案越长越可靠
  • 用高推理模式替代外部证据

Primary Sources

继续阅读

  1. 01InstructGPT / RLHF
  2. 02NIST Generative AI Profile