参数量与跑分怎么看
参数、上下文长度、跑分,是三件不同的事,别混着看。
参数、上下文长度、跑分,是三件不相干的事。三个都高的模型未必适合你,三个都不出众的模型可能刚好够用。
你会遇到的现象:
- 换了一个榜单排名更高的模型,你们的场景反而变差了
- 技术同学说这个模型「更大」,你不知道大在哪、意味着什么
- 给了 100 万上下文,你把整个知识库塞进去,答案却更含糊了
三个不同的数字
参数量是模型里权重的个数,7B 就是 70 亿个。它决定的是这个模型能装下多少统计规律,也就是能力的上限。但上限不等于表现:同样是 70B,训练数据的质量、后训练的手法不同,出来的东西能差出一大截。而且现在主流模型基本都不公布参数量了,你能拿到的通常只有一个档位名。「参数越多越强」这个规律来自 scaling laws 那类研究,它是统计趋势,不是对某个型号的保证。scaling-laws
上下文长度是一次请求能装多少 token。它跟聪明程度没关系,只跟「能不能一次读完」有关。而且能装进去不代表能用好——长上下文里,中间那一段被忽略的概率会明显上升。这一条对做 AI 产品的人非常现实:窗口大是给了你余量,不是给了你随便塞的许可。
跑分是它在若干标准题库上的正确率。它回答的问题是「这个模型在这些题上考得怎么样」,仅此而已。
| 数字 | 回答的问题 | 不回答的问题 |
|---|---|---|
| 参数量 | 能力上限有多高 | 这次任务做得好不好 |
| 上下文长度 | 一次能读多少 | 读进去的能不能被用上 |
| 跑分 | 标准题上考得好不好 | 你的题上考得好不好 |
右边那一列才是你真正关心的问题,而左边任何一个数字都答不了。这就是为什么必须自己测。
跑分为什么会骗人
- **题库会泄漏进训练集。**公开题库放在网上,新模型训练时很难完全排除。分数高有一部分是因为它见过题。这个问题没法从外部证伪,只能对高分保持一点保留。
- **题型和你的场景对不上。**大多数榜单考的是知识问答和标准推理,而你的产品可能是「从一堆客服记录里抽出结构化字段」。这两件事的强弱排序完全可以是反的。
- **分数差几个点没有意义。**88.4 和 87.9 之间的差距,小于换个提示词带来的波动。只有拉开一个档位的差距才值得当回事。
- **榜单不测你最在乎的东西。**输出格式稳不稳定、能不能守住不许做的事、长对话会不会崩、并发下延迟多少——这些没有榜,但它们才是产品上线后出问题的地方。
榜单不是不能看——像 LMArena 这种基于人类偏好的对比榜,适合看趋势,但不适合替代你自己的实测。lmarena
该怎么选
把选型变成一件可执行的事,就四步。
**一、先攒一份你自己的题。**从真实场景里挑 20 到 50 条,覆盖典型情况、边界情况和你们最怕出错的情况。每条要写清楚什么算合格。这份题库是你选型的唯一依据,也是以后每次换模型的回归测试。
**二、先测能不能过,再测哪个更好。**很多任务其实有一条明确的及格线。先用便宜的档位跑一遍,如果已经过线,更强的模型只是在浪费钱。能用小的就别用大的,这条在成本上的杠杆比任何提示词优化都大。
**三、把不同任务分开选。**一个产品里通常有好几类调用:分类、抽取、改写、复杂推理。前三类用便宜快的档位,最后一类才上贵的。分流做好,账单能砍掉大半。
**四、把可替换性设计进去。**模型半年就换一代,把调用封在一层里,换模型时只改一个地方。选型不是一锤子买卖,是一件每隔几个月要重做一次的事。
