生图为什么贵几十倍
图片的 Token 是怎么数出来的,分辨率一调账单就跳档。
第一次往多模态模型里传图片的人,都会被账单吓到——一张图的价格能顶几千字。原因很简单:图片不是按「一张」计费,是按分辨率换算成等效 Token。
你会遇到的现象:
- 传一张截图给模型,费用比平时高出一个数量级
- 同一张图,改了下分辨率,价格翻了几倍
- 预算表里「图片调用」一项,怎么估都不准
图片怎么计费
模型处理图片时,会把图片按比例切成若干小块,每块单独理解再拼起来。小块的数目基本由分辨率决定,所以计费天然跟着分辨率走。以 Claude 为例,它以 28×28 像素为单位把图切成补丁,每个补丁算一个视觉 Token;OpenAI 的视觉模型则按补丁或瓦片计算可计费的输入 Token。openai-visionclaude-vision
各家算法略有不同,但共同点是:按长边分档。低分辨率一档,中分辨率一档,高分辨率一档,跨过阈值价格跳档。同一张图,从长边 1024 提到 2048,等效 Token 可能翻好几倍;提到 4096,再翻好几倍。
这意味着一条很容易踩的坑:**你拿原始高清图去问模型,模型也看不出比低清图多多少信息,但你的账单按高清算了。**如果只是做个快速判断,先压到缩略图往往就够用,识别率几乎不受影响。
为什么贵
贵在理解工作量。模型要看懂一张图,需要的计算量远大于读一段相同字节数的文字。像素的信息密度低但计算密度高——这就是「几十倍」的来源。
而且多模态场景往往是「多图 + 文本」一起进:好几张截图 + 一个问题,总费用会明显超过纯文本对话。输入 Token 一多,成本立刻上去。
理解了这个机制,就知道省钱的方向不是「少用图片」,而是让每张图花在刀刃上:先想清楚这次调用需要看清什么,再决定发什么、发多大。同一张图在不同档位之间的价差,可能比多数文字功能一整天的调用还大。
省钱的几招
**一、按需降分辨率。**这是最大的一招。识别图片里的文字、小字 → 用高清。识别整体构图、风格、有没有人 → 用低清就够了。**先问「模型真的需要看清那么细吗」。**把长边压到刚好够用的档位,费用可能省一个数量级。
**二、只发相关的部分。**一页 PDF 截成一张大图 vs 裁出出问题的区域——后者便宜得多,识别率还可能更高(不相关的部分会干扰判断)。这和文字检索里切分的道理一样:喂进去的内容越聚焦,效果越好、成本越低。
**三、裁剪掉无关区域。**截图里的边框、菜单、空白,裁掉再发。既省 Token 又减少干扰。
**四、批量、离线任务走低价通道。**很多厂商对不需要实时返回的离线图片任务给折扣价。
**五、分清「看懂图」和「生成图」是两种计费。**本文讲的是「让模型看懂图片」的费用(视觉理解)。生成图片是另一套计费,通常按张数、按分辨率、按生成步数算,两者别混在一起估预算。
最后一条:**把「图片调用」单独记日志、单独看成本。**它量少价高,最容易偷偷吃掉预算。单独统计之后,你才能知道哪类功能在烧钱。
