Verification

核验、抽样与私人测试集

用少量固定而高价值的样本,建立比公共排行榜更贴近自己的判断。

The Question

没有大型评测团队,个人怎样比较模型?

Must Know

必须掌握

  1. 测试集要覆盖高频任务和高损失失败。
  2. 评分标准必须在看答案之前确定。
  3. 版本、参数、工具和日期都属于实验条件。

Know Enough

应当了解

  • 盲评与成对比较
  • 严重度分级
  • 回归测试

Put It to Work

落实到工作

  1. 01

    每类任务选 5—10 个固定样本。

  2. 02

    把遗漏、捏造、格式错分别计数。

  3. 03

    升级模型后跑同一批样本。

Common Mistakes

不要这样理解

  • 只挑模型擅长的题
  • 边看答案边改标准
  • 一次成功就宣布稳定

Primary Sources

继续阅读

  1. 01HELM