做产品 PMaker 首页
搜索
跟随系统
颜色主题
空格的键盘
三个经常被混为一谈的数字,其实互不相干参数量模型里权重的个数,决定能力的上限不决定这次任务做得好不好;多数模型已不公布上下文长度一次请求能装多少 token装得进不代表用得上,中间段会被忽略跑分在标准题库上的正确率题库可能泄漏进训练集,题型和你的场景对不上真正该看的第四个数字:拿你自己的 20 条真实用例,让候选各跑一遍

这三个数字回答的是三个不同的问题。混着看,就会买到一个榜单很好看、在你场景里很难用的模型。

参数量与跑分怎么看

参数、上下文长度、跑分,是三件不同的事,别混着看。

参数、上下文长度、跑分,是三件不相干的事。三个都高的模型未必适合你,三个都不出众的模型可能刚好够用。

你会遇到的现象:

  • 换了一个榜单排名更高的模型,你们的场景反而变差了
  • 技术同学说这个模型「更大」,你不知道大在哪、意味着什么
  • 给了 100 万上下文,你把整个知识库塞进去,答案却更含糊了

三个不同的数字

参数量是模型里权重的个数,7B 就是 70 亿个。它决定的是这个模型能装下多少统计规律,也就是能力的上限。但上限不等于表现:同样是 70B,训练数据的质量、后训练的手法不同,出来的东西能差出一大截。而且现在主流模型基本都不公布参数量了,你能拿到的通常只有一个档位名。「参数越多越强」这个规律来自 scaling laws 那类研究,它是统计趋势,不是对某个型号的保证。scaling-laws

上下文长度是一次请求能装多少 token。它跟聪明程度没关系,只跟「能不能一次读完」有关。而且能装进去不代表能用好——长上下文里,中间那一段被忽略的概率会明显上升。这一条对做 AI 产品的人非常现实:窗口大是给了你余量,不是给了你随便塞的许可。

跑分是它在若干标准题库上的正确率。它回答的问题是「这个模型在这些题上考得怎么样」,仅此而已。

数字 回答的问题 不回答的问题
参数量 能力上限有多高 这次任务做得好不好
上下文长度 一次能读多少 读进去的能不能被用上
跑分 标准题上考得好不好 你的题上考得好不好

右边那一列才是你真正关心的问题,而左边任何一个数字都答不了。这就是为什么必须自己测。

跑分为什么会骗人

  • **题库会泄漏进训练集。**公开题库放在网上,新模型训练时很难完全排除。分数高有一部分是因为它见过题。这个问题没法从外部证伪,只能对高分保持一点保留。
  • **题型和你的场景对不上。**大多数榜单考的是知识问答和标准推理,而你的产品可能是「从一堆客服记录里抽出结构化字段」。这两件事的强弱排序完全可以是反的。
  • **分数差几个点没有意义。**88.4 和 87.9 之间的差距,小于换个提示词带来的波动。只有拉开一个档位的差距才值得当回事。
  • **榜单不测你最在乎的东西。**输出格式稳不稳定、能不能守住不许做的事、长对话会不会崩、并发下延迟多少——这些没有榜,但它们才是产品上线后出问题的地方。

榜单不是不能看——像 LMArena 这种基于人类偏好的对比榜,适合看趋势,但不适合替代你自己的实测。lmarena

该怎么选

把选型变成一件可执行的事,就四步。

**一、先攒一份你自己的题。**从真实场景里挑 20 到 50 条,覆盖典型情况、边界情况和你们最怕出错的情况。每条要写清楚什么算合格。这份题库是你选型的唯一依据,也是以后每次换模型的回归测试。

**二、先测能不能过,再测哪个更好。**很多任务其实有一条明确的及格线。先用便宜的档位跑一遍,如果已经过线,更强的模型只是在浪费钱。能用小的就别用大的,这条在成本上的杠杆比任何提示词优化都大。

**三、把不同任务分开选。**一个产品里通常有好几类调用:分类、抽取、改写、复杂推理。前三类用便宜快的档位,最后一类才上贵的。分流做好,账单能砍掉大半。

**四、把可替换性设计进去。**模型半年就换一代,把调用封在一层里,换模型时只改一个地方。选型不是一锤子买卖,是一件每隔几个月要重做一次的事。

参考资料

  1. Scaling Laws for Neural Language Models — arXiv
  2. LMArena — 基于人类偏好的对比榜