做产品 PMaker 首页
搜索
跟随系统
颜色主题
空格的键盘
榜单三个月就翻一遍,这六条不会① 任务表现在你那类任务上的准确率与稳定性20–50 条真实样例,同套提示词各跑一遍,人工判对错② 真实成本一次完整调用的钱,不是每百万 token 单价用真实请求量,算上输入、输出和多轮重发③ 稳定性与合规限流额度、超时率、数据出境、能否签协议让法务看数据处理条款,别看营销页④ 可替换性换掉它要改多少东西、提示词要重调多少选两个而不是一个,备用的接入要真跑通过用你自己的任务去量,这份表下个季度还能接着用

别背厂商排名。把候选放进同一张表,用你自己的任务去量——这份表下个季度还能接着用。

主流模型厂商的差异

不背厂商排名,按能力、成本、生态、部署和合规做一次真正的选型。

这一节不会给你一份「厂商排行榜」。榜单三个月就翻一遍,背下来没有意义。真正能重复使用的,是一套量的方法

你会遇到的现象:

  • 看了一堆评测,还是不知道自己该用哪个
  • 按跑分选了最强的,实际用起来还不如便宜那个稳
  • 接完一家才发现数据合规过不了,得从头再来

为什么不给排名

三个原因。

**一、榜单和你的任务不是一回事。**公开评测测的是竞赛题、通用问答这些标准化任务,而你要它干的是「把这类工单按我们内部的五个类别打标」。跑分高不代表你的场景好用——这两件事经常反着来。像 LMArena 这种人类偏好榜,只能看趋势,不能替代你自己的实测。lmarena

**二、差距在收窄,而且变动很快。**头部模型之间的公开基准差距一直在缩小,同时每隔几个月就有新版本、新定价。任何写死的排名,写下来的那天就开始过期。ai-index

**三、选型从来不只是选能力。**价格、稳定性、合规、迁移成本,任何一条不过关都能一票否决——哪怕它能力最强。

六个选型维度

把候选放进这张表,一个个打分,下个季度还能接着用。

维度 具体量什么 怎么量
① 任务表现 你那类任务上的准确率与稳定性 20–50 条真实样例,各模型跑同一套,人工判对错
② 上下文长度 够不够装下你要塞的资料 拿最长的那份真实输入去试,别信标称值
③ 真实成本 一次完整调用的钱,不是每百万 token 的单价 用真实请求量一遍 Token,算上输入、输出和多轮重发 openrouter-models
④ 稳定性 限流额度、超时率、故障时的表现、有没有 SLA 压一段时间,看 P95 延迟和错误率,别只看平均值
⑤ 合规 数据是否出境、留存多久、是否用于训练、能否签协议 让法务看厂商的数据处理条款,别看营销页
⑥ 迁移成本 换掉它要改多少东西 看是否兼容通用接口格式,提示词要重调多少

前两条决定「能不能用」,中间两条决定「用不用得起」,后两条决定「敢不敢用」。任何一条不过关都是一票否决。

第 ① 条最花时间,也最值。准备一组真实样例、跑一遍、人工判对错——做过一次,后面每次换模型都能复用,是整个选型里回报最高的投入。

几个阵营的性格

虽然不给排名,但阵营之间确实有稳定的性格差异,这些短期内不会变。

海外头部闭源厂商(OpenAI、Anthropic、Google 这一类):能力上限通常最高,工具调用和长任务的工程成熟度好,文档与生态完整。代价是价格偏高,且国内使用涉及网络与合规问题。

国内大厂平台(阿里、字节、腾讯、百度这一类):优势在中文场景、合规资质、企业合同与发票,以及和自家云的整合。它们通常既提供自研模型,也在平台上托管第三方模型。

国产高性价比阵营(DeepSeek、月之暗面、智谱、MiniMax 这一类):定价激进,部分开放权重,性价比是主要卖点。近年国产模型的价格底线一直被这一阵营拉低。

开放权重模型:可以自己部署,数据不出门、不怕下线涨价。代价是显卡、运维和并发都得自己扛——中小规模下通常比直接调 API 更贵,买到的是可控而不是便宜。

一个参考量级:2026 年 8 月,海外旗舰模型的输入价大致在每百万 token 几美元的水平,国产主力模型则在几元人民币甚至更低,头部产品还常配免费额度。但这些数字变动极快,务必以厂商当期报价页为准。claude-pricing

怎么做一次选型

四步,一两天能走完。

**第一步,先划掉不合规的。**把数据出境、留存策略、能不能签协议这几条摆出来,过不了的直接出局。这一步放最前面,能省掉后面全部白工。

**第二步,准备一组真实样例。**20 到 50 条,覆盖常见情况和几个刁钻的边界情况。这组样例是你之后所有决策的尺子。

**第三步,同一套样例跑所有候选。**同样的提示词、同样的参数,人工判对错。注意一个坑:不同厂商对同一段提示词的反应差别很大,所以一轮结果不理想时,先给它一次针对性调整提示词的机会,再下结论。

**第四步,选两个,不是一个。**一个主力,一个备用,而且备用的接入要真的跑通过。模型限流、故障、下线都是常态,不能把产品可用性押在单一供应商身上

参考资料

  1. Claude Platform — Pricing
  2. OpenRouter — Models
  3. Stanford HAI — AI Index Report
  4. LMArena — 基于人类偏好的对比榜