Post-training & Reasoning
后训练、推理模型与模型行为
辨清基础能力、指令跟随、偏好塑造与推理努力之间的关系。
The Question
模型“想得更久”,是否就更可信?
Must Know
必须掌握
- 监督微调和人类偏好反馈主要塑造行为方式,不能把缺失知识凭空补出来。
- 增加推理努力可能改善多步问题,却会增加时间与成本,也不会自动消除错误前提。
- 自信程度、解释长度与真实正确率之间没有固定对应关系。
Know Enough
应当了解
- SFT、RLHF 与偏好优化
- 思考模式和努力等级
- 系统提示、拒答与安全策略
Put It to Work
落实到工作
- 01
简单任务先用低成本模式,复杂任务再逐级增加推理预算。
- 02
把“列出假设”和“验证假设”分成两个步骤。
- 03
同一任务比较直接回答、分步回答和工具辅助回答。
Common Mistakes
不要这样理解
- 把思维链当作真实内部过程
- 认为答案越长越可靠
- 用高推理模式替代外部证据
Primary Sources