选模型是选取舍,不是选排名

把模型选择还原为几组具体取舍:能力与速度、成本与规模、上下文长度、工具能力、隐私边界,并说明为什么排行榜帮不上多少忙。

  • 模型选择
  • 评测
  • 成本
  • 隐私

Reading Guide

先问一个问题

面对一项具体任务,应该按什么标准决定用哪一类模型?

适合读者
同时使用多个 AI 产品、需要为不同任务分配工具的读者
阅读基础
context-and-memory

Key Points

先记住这些

  1. 先描述任务的性质,再挑模型;反过来做,必然演变为追逐产品名称。
  2. 决定选择的主要是六组变量:推理能力、响应速度、单位成本、上下文长度、工具与文件能力、数据去向。
  3. 同一项目内不同环节可以用不同模型,批量粗加工与关键判断没有理由用同一个。
  4. 公开排行榜衡量的是通用基准上的平均表现,与你的具体文体、术语和体例关系有限。
  5. 评测材料混入训练数据会使分数虚高,这是公开榜单的结构性问题,不是个别现象。
  6. 真正有用的是自建一份三十到五十条的私人测试集,用自己的材料来比较。

Terms

几个必要概念

私人测试集

用自己实际工作中的材料与标准答案构成的一小批测试题。

这是判断某个模型是否适合自己文体与体例的唯一可靠办法,几十条就足以显出差别。
评测污染

公开评测集的题目或答案进入了模型的训练材料,使分数不能反映真实泛化能力。

它使排行榜名次难以直接采信,尤其在使用较老、流传较广的基准时。
数据去向

你输入的内容会被传到哪里、保存多久、是否可能用于训练。

对未刊稿件、他人来信、有版权的整本书而言,这一项常常比能力更优先。

先把任务说清楚

选择困难通常源于任务描述得太笼统。「用 AI 帮我处理古籍」不是一个任务,「把这一卷影印本的释文按体例改成竖排简体、保留异体字并标出可疑处」才是。任务一旦说清楚,多数选项会自动排除。判断时可以先问四件事:这项工作要不要真正的推理,要处理多少字,出错的代价有多大,材料能不能外传。

  • 推理密度低、量大、错了容易发现:格式转换、初步分类、批量提取。这类工作应选快而便宜的模型。
  • 推理密度高、量小、错了不易发现:疑难句译法取舍、异文判断、论证结构梳理。这类工作值得用最强的模型,并且必须人工复核。
  • 材料极长:优先考虑上下文容量,同时按前一篇的办法分段,不要指望一次投喂。
  • 需要读写文件、执行代码、访问网页:这属于产品的工具能力,与模型本身的语言能力是两回事,须分开评估。
  • 材料涉密或未刊:数据去向优先于一切,必要时选择可本地运行的较小模型,接受能力上的损失。

排行榜为什么帮不上多少忙

公开评测的价值在于横向可比,代价是必须选择通用题目。有研究者提出应当在多个场景、多个指标上做整体性评估,而不是用单一分数概括模型,正是因为不同任务上的排序可能相当不同。一个在通用基准上略逊的模型,在你的文体和术语上未必更差。S1

更结构性的问题是评测污染。公开基准流传日久,其题目与答案很可能已经进入某些模型的训练材料,使分数不再反映泛化能力。已有工作专门呼吁对每个基准逐一检测污染程度。这不是指控某家厂商作弊,而是说明用公开分数替代自己实测,在方法上就不成立。S2

厂商发布材料同样不能当作独立依据。它们通常选择对自己有利的对比条件,且更新频繁。可以把它们看作待核实的线索,实际结论仍须由自己的测试给出。

自建测试集:三十条足矣

做法并不复杂。从过去的实际工作里挑出三十到五十个片段,覆盖典型情形与已知的难点,为每一条写下你认可的处理结果和判定标准。换模型时,用同一批题目跑一遍,逐条比对。重要的是把标准写在前面,而不是看到输出以后再决定满意与否,否则比较会滑向印象。S3

六组取舍逐条说明

前面把六组变量并列提出,这里逐条说清各自的判断依据,因为它们并不同等重要,权重随任务而变。推理能力指的是模型在需要多步判断、需要权衡冲突证据时的表现。它最难从表面看出,也最需要用自己的难题去测。判断的窍门是专挑那些答案不唯一、必须给出理由的题目,看它的理由能不能站住,而不是看它的结论对不对,因为结论对而理由错的情形相当常见。S1

速度与成本通常绑在一起,且只在批量工作中才成为真问题。处理三十条时快慢无关紧要,处理三千条时它决定这件事做不做得成。判断方法是先用少量样本估算单条耗时与消耗,再乘以总量,看结果是否可以接受。若不可接受,通常应当先想办法减少交给模型的量,例如用程序先筛掉明显无需处理的部分,而不是急着换更便宜的模型。

上下文长度的取舍前一栏已详述,此处只补一句:不要为了容纳长材料而选择推理能力明显更弱的模型,因为长材料恰恰更依赖判断力。宁可分段,也不要降级。工具与文件能力属于产品层面,评估时要分清是模型不会,还是产品没提供。数据去向则是一票否决项,凡是不能接受材料外传的场合,其余五项都不必再比。

  • 推理能力:用答案不唯一、必须给理由的题目测,看理由而非结论。
  • 速度:只在批量时才是真问题,先估总量再决定。
  • 成本:先想办法减少交给模型的量,再考虑换便宜的模型。
  • 上下文:不为容量牺牲判断力,宁可分段。
  • 工具能力:分清是模型不会还是产品没提供。
  • 数据去向:一票否决,先过这一关再谈其他。

六项之外还有一项不成文的考虑:稳定性。同一个模型在同一批任务上的表现若忽好忽坏,即使平均水平更高,也不如一个稍弱但稳定的模型好用,因为不稳定意味着每一条都要复核,省不下工。测试时不妨把同一批题目跑两遍,比较两次结果的差异程度,这个数字往往比平均分更有参考价值。S1

还有一件事值得写进流程:每次换模型或发现产品有明显更新时,把测试集重跑一遍,并把结果与日期一并存档。这份逐次积累的记录,几轮之后就会变成比任何外部榜单都有用的东西,因为它衡量的正是你自己的材料、你自己的体例、你自己关心的那几类难点。别人的评测再详尽,也替代不了这一份。S4

Conclusion

结语

把选择拆成任务性质与六组取舍之后,「哪个模型最好」这个问题就消失了,剩下的是「这一步该用哪一个」。后一个问题有答案,而且答案可以由自己的材料给出。

仍可追问

  • 针对中文古籍与专业术语翻译的公开评测极少,本文所建议的自建测试集只是权宜之计。
  • 本地可运行模型在文言处理上的实际水平缺少公开对照数据,本文未作断言。
  • 各产品的数据保留政策与训练使用条款变动频繁,须在每次采用前重新核对条款原文。

参考资料

  1. S1

    Percy Liang, Rishi Bommasani, Tony Lee, Dimitris Tsipras, Dilara Soylu, Michihiro Yasunaga, 等.Holistic Evaluation of Language Models.2023

    DOI / ISBN:arXiv:2211.09110查看来源
  2. S2

    Oscar Sainz, Jon Ander Campos, Iker García-Ferrero, Julen Etxaniz, Oier Lopez de Lacalle, Eneko Agirre.NLP Evaluation in Trouble: On the Need to Measure LLM Data Contamination for each Benchmark.2023

    DOI / ISBN:arXiv:2310.18018查看来源
  3. S3

    National Institute of Standards and Technology.Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST AI 100-1.2023

    DOI / ISBN:10.6028/NIST.AI.100-1查看来源
  4. S4

    National Institute of Standards and Technology.Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST AI 100-1.2023

    DOI / ISBN:10.6028/NIST.AI.100-1查看来源