做产品 PMaker 首页
搜索
跟随系统
颜色主题
空格的键盘
六种模型,六个不同的计费单位文本模型文字进、文字出,按 Token 计费,输出比输入贵几倍最熟的一种,绝大多数 AI 功能的主力图片 / 视频按张、按秒计费,跳档式涨价,一次视频可能顶几百次文本调用成本最高的两类,预算要单独算语音 TTS / ASR按字符数、按音频时长计费,和 Token 无关时长相同,说多说少价钱一样向量模型把「意思」变成坐标,不生成内容,语义检索的地基六类里最便宜的,便宜一两个数量级估成本时六类必须分开算——任何一项用错单位,整个预算就废了

「模型」不是一种东西。六类各有各的输入输出,更要紧的是——各有各的计费单位。

模型的六种类型

文本、图片、视频、语音合成、语音识别、向量。输入输出和计费单位各不相同。

日常说的「大模型」通常只指文本模型。但你要做的产品,很可能同时用到好几类。它们的能力边界不同,计费单位更是完全不同——这一点比能力差异更容易让你在预算上翻车。

你会遇到的现象:

  • 按文本模型的经验估了个成本,做语音功能时账单差了十几倍
  • 想做「上传视频自动剪辑」,不知道该找哪种模型
  • 听说「向量」很贵,其实它是这六类里最便宜的

六种分别是什么

**文本模型。**文字进、文字出,就是你最熟的那种。按 Token 计费,输入一个价、输出一个价,输出通常贵几倍。绝大多数 AI 功能的主力。openai-models

**图片模型。**给一段描述(也可以再给一张参考图),生成一张图。按计费,分辨率越高越贵,而且是跳档式的——分辨率调一档,单价可能翻好几倍。

**视频模型。**给文字或图,生成一段视频。按秒计费,这是它和其他所有类型最不一样的地方。一段十几秒的视频,成本可能顶得上几百次文本调用。做预算时务必单独算这一项。

**语音合成(TTS)。**文字进、音频出。按字符数计费,不是按 Token。所以文本模型那套换算在这里不适用。音色克隆、情感控制通常另外收费。

**语音识别(ASR)。**音频进、文字出。按音频时长计费,跟说了多少字无关——一段沉默的录音和一段密集对话,只要时长一样,价钱就一样。

向量模型(Embedding)。文字进,出来一串数字坐标。它不生成任何内容,只负责把「意思」变成可以计算距离的坐标。这是整套语义检索和知识库的地基,而且是六类里最便宜的,通常比文本模型便宜一两个数量级。名词地图里也提到过它

计费单位才是重点

能力差异你大概能猜到,计费单位的差异才是真正会伤到你的地方。

看那张图右边的条形:**同样是「调用一次模型」,成本能差出两个数量级。**向量最便宜,视频最贵,中间隔着好几档。

这带来一条很实际的纪律:**估成本时,六类必须分开算,不能用同一套心算。**做一个「上传录音 → 转文字 → 摘要 → 生成配图」的功能,你要同时算 ASR 的时长费、文本模型的 Token 费、图片模型的张数费。任何一项用错单位,整个预算就废了。各家的报价单也只认自己的单位,跨家对照时尤其要小心。claude-pricing

还有一个常被忽略的点:**非文本模型往往还有并发和时长的硬限制。**视频生成一次可能要等几十秒到几分钟,这不只是成本问题,更是产品设计问题——你得设计一个像样的等待体验,而不是让用户对着转圈干等。

真实产品是拼出来的

实际产品很少只用一类模型。举个具体的:一个「会议纪要」功能,链路通常是这样——

录音先交给 ASR 转成文字(按时长计费);文字交给文本模型做摘要和待办提取(按 Token);如果要做语义搜索,还要把纪要切段后过一遍向量模型存进库里(按 Token,但很便宜);要是产品还想生成一张分享卡片,再叫一次图片模型(按张)。

四类模型,四种计费单位,四条独立的失败路径。拆开看,每一段的成本和风险才算得清楚。

选型时也一样:这四段可以来自不同厂商,没必要绑在一家。ASR 挑准确率和中文表现好的,文本模型挑你那类任务上实测好的,向量模型挑便宜稳定的就行。怎么把它们统一接进来是另一个话题。

参考资料

  1. Claude Platform — Pricing
  2. Models — OpenAI Docs