Verification
核验、抽样与私人测试集
用少量固定而高价值的样本,建立比公共排行榜更贴近自己的判断。
The Question
没有大型评测团队,个人怎样比较模型?
Must Know
必须掌握
- 测试集要覆盖高频任务和高损失失败。
- 评分标准必须在看答案之前确定。
- 版本、参数、工具和日期都属于实验条件。
Know Enough
应当了解
- 盲评与成对比较
- 严重度分级
- 回归测试
Put It to Work
落实到工作
- 01
每类任务选 5—10 个固定样本。
- 02
把遗漏、捏造、格式错分别计数。
- 03
升级模型后跑同一批样本。
Common Mistakes
不要这样理解
- 只挑模型擅长的题
- 边看答案边改标准
- 一次成功就宣布稳定
Primary Sources
继续阅读
- 01HELM