主流模型厂商的差异
不背厂商排名,按能力、成本、生态、部署和合规做一次真正的选型。
这一节不会给你一份「厂商排行榜」。榜单三个月就翻一遍,背下来没有意义。真正能重复使用的,是一套量的方法。
你会遇到的现象:
- 看了一堆评测,还是不知道自己该用哪个
- 按跑分选了最强的,实际用起来还不如便宜那个稳
- 接完一家才发现数据合规过不了,得从头再来
为什么不给排名
三个原因。
**一、榜单和你的任务不是一回事。**公开评测测的是竞赛题、通用问答这些标准化任务,而你要它干的是「把这类工单按我们内部的五个类别打标」。跑分高不代表你的场景好用——这两件事经常反着来。像 LMArena 这种人类偏好榜,只能看趋势,不能替代你自己的实测。lmarena
**二、差距在收窄,而且变动很快。**头部模型之间的公开基准差距一直在缩小,同时每隔几个月就有新版本、新定价。任何写死的排名,写下来的那天就开始过期。ai-index
**三、选型从来不只是选能力。**价格、稳定性、合规、迁移成本,任何一条不过关都能一票否决——哪怕它能力最强。
六个选型维度
把候选放进这张表,一个个打分,下个季度还能接着用。
| 维度 | 具体量什么 | 怎么量 |
|---|---|---|
| ① 任务表现 | 在你那类任务上的准确率与稳定性 | 20–50 条真实样例,各模型跑同一套,人工判对错 |
| ② 上下文长度 | 够不够装下你要塞的资料 | 拿最长的那份真实输入去试,别信标称值 |
| ③ 真实成本 | 一次完整调用的钱,不是每百万 token 的单价 | 用真实请求量一遍 Token,算上输入、输出和多轮重发 openrouter-models |
| ④ 稳定性 | 限流额度、超时率、故障时的表现、有没有 SLA | 压一段时间,看 P95 延迟和错误率,别只看平均值 |
| ⑤ 合规 | 数据是否出境、留存多久、是否用于训练、能否签协议 | 让法务看厂商的数据处理条款,别看营销页 |
| ⑥ 迁移成本 | 换掉它要改多少东西 | 看是否兼容通用接口格式,提示词要重调多少 |
前两条决定「能不能用」,中间两条决定「用不用得起」,后两条决定「敢不敢用」。任何一条不过关都是一票否决。
第 ① 条最花时间,也最值。准备一组真实样例、跑一遍、人工判对错——做过一次,后面每次换模型都能复用,是整个选型里回报最高的投入。
几个阵营的性格
虽然不给排名,但阵营之间确实有稳定的性格差异,这些短期内不会变。
海外头部闭源厂商(OpenAI、Anthropic、Google 这一类):能力上限通常最高,工具调用和长任务的工程成熟度好,文档与生态完整。代价是价格偏高,且国内使用涉及网络与合规问题。
国内大厂平台(阿里、字节、腾讯、百度这一类):优势在中文场景、合规资质、企业合同与发票,以及和自家云的整合。它们通常既提供自研模型,也在平台上托管第三方模型。
国产高性价比阵营(DeepSeek、月之暗面、智谱、MiniMax 这一类):定价激进,部分开放权重,性价比是主要卖点。近年国产模型的价格底线一直被这一阵营拉低。
开放权重模型:可以自己部署,数据不出门、不怕下线涨价。代价是显卡、运维和并发都得自己扛——中小规模下通常比直接调 API 更贵,买到的是可控而不是便宜。
一个参考量级:2026 年 8 月,海外旗舰模型的输入价大致在每百万 token 几美元的水平,国产主力模型则在几元人民币甚至更低,头部产品还常配免费额度。但这些数字变动极快,务必以厂商当期报价页为准。claude-pricing
怎么做一次选型
四步,一两天能走完。
**第一步,先划掉不合规的。**把数据出境、留存策略、能不能签协议这几条摆出来,过不了的直接出局。这一步放最前面,能省掉后面全部白工。
**第二步,准备一组真实样例。**20 到 50 条,覆盖常见情况和几个刁钻的边界情况。这组样例是你之后所有决策的尺子。
**第三步,同一套样例跑所有候选。**同样的提示词、同样的参数,人工判对错。注意一个坑:不同厂商对同一段提示词的反应差别很大,所以一轮结果不理想时,先给它一次针对性调整提示词的机会,再下结论。
**第四步,选两个,不是一个。**一个主力,一个备用,而且备用的接入要真的跑通过。模型限流、故障、下线都是常态,不能把产品可用性押在单一供应商身上。
