同样一次请求,把一份 3 万字的合同丢给模型抽付款条款:按量计费大约 0.15 元,按次计费固定 0.031 元,差约 4.7 倍。换成 40 万字的技术手册,按量要 1.81 元,按次还是 0.031 元,差约 58 倍。小鱼API 的 Gemini 全系走按次计费,一次请求一个固定价,输入多长都不加钱。下面把三档价位的分工、长文档的真实账、生图成本、升档判断和接入方式逐项算清。价格以各家模型官方页面的标价为准,本文仅作换算参考。
先看价目。三档的差别不在输入长度,而在任务难度。
价目表里按次单价最低的一档,吃量的活交给它。长文档抽取字段、批量分类打标、摘要、翻译、把杂乱文本转成 JSON,这类任务答案明确、对措辞不敏感。举个例子:做招投标的小团队每天要读 200 份招标文件,每份 3 万字,只抽「项目名称、预算、截止时间、资格要求」四个字段。全部交给 gemini-2.5-pro,一天 200 次请求是 6.2 元,一个月 186 元。
比 2.5-pro 贵 0.019 元一次。它接的是需要理解前后关系的活:整份代码仓库找问题、把一堆零散会议记录合成有逻辑的纪要、按业务规则写结构化报告。判断标准很简单——如果 2.5-pro 的输出你还要人工改两三遍才敢用,这个任务就该放到这一档。多花 0.019 元,抵掉一次人工返工就回本。
这一档单价 0.09 元,比 3-pro 贵 0.04 元,比 2.5-pro 贵 0.059 元。它留给真正难的活:答案散在几十页之外的跨章节问答、需要对照多份文档做一致性核对的财务与法务审阅、输出直接进正式交付物且不打算让人再读一遍的场景。难活不多时,把它当救火档用就行。
| 模型 | 按次单价(元/次) | 接什么活 | 什么时候别用它 |
|---|---|---|---|
| gemini-2.5-pro | 0.031 | 抽取字段、分类打标、摘要、翻译、长文档批处理 | 需要多步推理、答案要跨章节拼接 |
| gemini-3-pro-preview | 0.05 | 代码审阅、结构化报告、有前后逻辑的长文写作 | 高并发跑简单抽取,单次成本翻 1.6 倍 |
| gemini-3.1-pro-preview | 0.09 | 多跳问答、一致性核对、直接交付的正式文本 | 单轮问答、单一字段抽取 |
三档共享一件事:输入多长都不加价,选哪档只看任务难度。
按量计费的公式是:钱 = 输入 token 数 × 输入单价 + 输出 token 数 × 输出单价。输入和输出分开计价,输出单价通常更高。以主流旗舰的官方按量标价为例,输入约 3 元/百万 token、输出约 15 元/百万 token(以各家模型官方页面的标价为准,本文仅作换算参考)。容易漏掉的一点:输入每次请求都要重新算。同一个 40 万字文档问 10 个问题,输入 token 就按 10 份计费。
按次计费就是一次请求一个固定价。发 1 个字和发 20 万字同价,账单只跟请求次数有关。按次不等于模型不读你的文档,而是把「输入长度」从账单里拿掉了。所以吃长度的场景——整库资料问答、几十万字 PDF、长视频转写文本——塞更多内容不额外花钱。
| 单次请求输入 | 输入 token(按 1.5 估) | 按量成本(元) | 按次 2.5-pro(元) | 相差倍数 |
|---|---|---|---|---|
| 1 万字 | 1.5 万 | 0.056 | 0.031 | 约 1.8 倍 |
| 5 万字 | 7.5 万 | 0.236 | 0.031 | 约 7.6 倍 |
| 20 万字 | 30 万 | 0.911 | 0.031 | 约 29 倍 |
| 40 万字 | 60 万 | 1.811 | 0.031 | 约 58 倍 |
表里输出统一按 500 汉字(约 750 token)算,输入 3 元/百万 token、输出 15 元/百万 token。换算口径你也能复算:中文 1 个汉字约 1~1.5 个 token(不同分词器结果不同),本文统一按 1.5 估。
先写清口径,你才能自己复算:1 万字中文约 1.5 万 token,10 万字约 15 万 token,40 万字约 60 万 token,也就是 0.6 百万 token。英文另算,大致 4 个字符折 1 个 token。上长文档产品前,拿真实文件跑一次分词,把实际 token 数记下来,比看任何估算表都准。
按 3 元/百万 token 的输入价:0.6 × 3 = 1.8 元。再加输出——让模型写 500 字结论,约 750 token,按 15 元/百万 token 是 0.011 元。一次请求合计约 1.81 元。同样这次请求走按次计费,gemini-2.5-pro 收 0.031 元,1.81 ÷ 0.031 ≈ 58 倍。如果这份文档每天都要重新过一遍,按量是一天 1.81 元、一个月 54.3 元;按次是一天 0.031 元、一个月 0.93 元。
按次把输入长度剔出了账单。对做长文档产品的团队,这意味着可以把整本手册、整个知识库、整段长视频转写文本一起塞进去,成本不随资料变大而上涨。反过来看,按量计费做长文档产品有个结构性矛盾——文档给得越全、效果越好、账单越贵,很多团队是账单涨到四位数才发现这件事的。
沿用前面的招投标场景:每份 3 万字,一天 200 份。按次走 gemini-2.5-pro,单次 0.031 元,一天 6.2 元,一个月 186 元。同样的活走按量,单次约 0.146 元(输入 3 万字 4.5 万 token 算 0.135 元,加输出 0.011 元),一天 29.2 元,一个月 876 元。一个月差 690 元。这 690 元不需要改提示词、不需要换模型,只因为计费方式不同。
第二种活:一次请求带 20 张商品图加 2 万字用户反馈转写文本,做图文一致性检查。图片按每张 1000 token 估算,20 张是 2 万 token;2 万字文本约 3 万 token;输入合计 5 万 token,即 0.05 百万 token,按 3 元/百万 token 是 0.15 元;输出 500 字约 0.011 元,单次按量 0.161 元。同样的活交给 gemini-3-pro-preview 按次收 0.05 元。一天 300 次:按次 15 元、一月 450 元;按量 48.3 元、一月 1449 元。
生图也是按次计价,跟文本模型同一套账。
| 生图模型 | 按次单价(元/次) | 每天 100 张的月成本 |
|---|---|---|
| gpt-image-2-pro | 0.25 | 25 元/天,750 元/月 |
| NanoBanana-Pro | 0.27 | 27 元/天,810 元/月 |
一张商品主图 0.27 元比一次文本推理贵得多,但它替代的是几十元的外包图。算 ROI 时把两件事放一张表里,别只盯文本模型单价。
| 场景 | 每天请求数 | 用哪档 | 按次每天 | 按次每月 | 按量每月 |
|---|---|---|---|---|---|
| 长文档批处理(3 万字/份) | 200 | gemini-2.5-pro | 6.2 元 | 186 元 | 876 元 |
| 多图加长文本质检 | 300 | gemini-3-pro-preview | 15 元 | 450 元 | 1449 元 |
| 商品图生成 | 100 | NanoBanana-Pro | 27 元 | 810 元 | 按量口径不同 |
三行加起来,按次一个月 1446 元,按量光前两行就 2325 元。省下的 879 元来自同样的调用量。
只看 API 账。设便宜档有 r 比例的请求需要重跑一次,有效单价就是 单价 ÷ (1 − r)。把 gemini-3-pro-preview(0.05 元)和 gemini-3.1-pro-preview(0.09 元)拉平:0.05 ÷ (1 − r) = 0.09,解得 r ≈ 44%。再拿 gemini-2.5-pro(0.031 元)和 3.1-pro 拉平:0.031 ÷ (1 − r) = 0.09,解得 r ≈ 66%。换句话说,只算 API 成本,便宜档返工率超过 44%(相对 3-pro)或者 66%(相对 2.5-pro)时,升档才开始划算。
返工成本不只是重跑那一次的钱,还有盯屏幕确认、改提示词、重新对结果的时间。假设一次人工返工折 1 元,gemini-2.5-pro 的有效单价变成 0.031 + r × 1.031;让它等于 0.09,解得 r ≈ 6%。同样的算法套在 3-pro 上:0.05 + r × 1.05 = 0.09,解得 r ≈ 4%。返工率只要到 6%,你的时间成本就已经把升档的差价补回来了。这也是为什么「贵档更省钱」在有人工介入的流程里经常成立。
| 2.5-pro 返工率 | 有效单价(元/次,含 1 元人工) | 2.5-pro 全量月成本 | 对比 3-pro 全量 1500 元 | 对比 3.1-pro 全量 2700 元 |
|---|---|---|---|---|
| 0% | 0.031 | 930 元 | 省 570 元 | 省 1770 元 |
| 2% | 0.052 | 1549 元 | 多 49 元 | 省 1151 元 |
| 5% | 0.083 | 2477 元 | 多 977 元 | 省 223 元 |
| 8% | 0.113 | 3404 元 | 多 1904 元 | 多 704 元 |
月成本按每天 1000 次、30 天算。3-pro 全量是 0.05 × 1000 × 30 = 1500 元,3.1-pro 全量是 0.09 × 1000 × 30 = 2700 元。用法:先跑 200 次统计返工率落在哪一行,再决定档位。
该升的是:跨越几十页的多跳问答、多份文档的一致性核对、输出直接进正式交付物。不该升的是字段抽取、分类打标、翻译、摘要——这类返工通常来自「字段没抽到」「格式没对上」,把提示词和输出 schema 写清楚比升档便宜得多。升档解决的是模型能力上限,不是提示词质量。
curl https://xyuapi.top/v1/chat/completions \
-H "Authorization: Bearer $XYU_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-pro",
"messages": [{"role": "user", "content": "把这份合同的付款条款整理成表"}]
}'
备用入口 https://xyuai.cc/v1,主入口不通时换域名即可,请求体不用改。
from openai import OpenAI
client = OpenAI(
api_key="你的小鱼API令牌",
base_url="https://xyuapi.top/v1", # 备用:https://xyuai.cc/v1
)
resp = client.chat.completions.create(
model="gemini-3-pro-preview", # 模型名直接用短名
messages=[{"role": "user", "content": "读完整本手册,列出所有和安全有关的章节"}],
)
print(resp.choices[0].message.content)
原来跑 OpenAI 接口的代码,只动 base_url 和模型名两处,重试、日志、超时都不用碰。
不用加 google/ 之类的供应商前缀,直接写 gemini-2.5-pro、gemini-3-pro-preview、gemini-3.1-pro-preview;生图写 NanoBanana-Pro、gpt-image-2-pro。名字写错通常报模型不存在,先核对拼写再查别处。
# cost_compare.py —— 按量与按次成本试算
PER_M_IN = 3.0 # 按量输入:元/百万 token(以各家官方标价为准,仅作换算参考)
PER_M_OUT = 15.0 # 按量输出:元/百万 token
TOK_PER_HAN = 1.5 # 假设:1 个汉字 ≈ 1.5 个 token
PRICE = 0.031 # 按次单价:2.5-pro 用 0.031,3-pro 用 0.05,3.1-pro 用 0.09
def by_usage(han_in, han_out):
"""按量:钱 = 输入 token 数 × 输入单价 + 输出 token 数 × 输出单价"""
tok_in = han_in * TOK_PER_HAN
tok_out = han_out * TOK_PER_HAN
return tok_in / 1_000_000 * PER_M_IN + tok_out / 1_000_000 * PER_M_OUT
def by_call(times, price=PRICE):
"""按次:钱 = 请求次数 × 固定单价"""
return times * price
if __name__ == '__main__':
for han in (10000, 50000, 200000, 400000):
once = by_usage(han, 500)
print('输入 %d 字 -> 按量 %.3f 元 / 按次 %.3f 元 / 相差 %.1f 倍'
% (han, once, PRICE, once / PRICE))
print('每天 200 次、跑 30 天 -> 按次 %.1f 元' % by_call(200 * 30))
改三个数字就行:单个文档的汉字数、每次输出的汉字数、每天的请求次数。注意 1.5 这个系数偏保守(偏大),对分词器友好的内容可能只要 1.2,实际按量成本会比脚本算出来的略低,结论只会更偏向按次。
每次请求的平均输入汉字数、每天请求次数、返工率。前两个决定账单大小,第三个决定该不该升档。把这三个数记一周,你对成本的判断会比任何估算表都准。
最低充值 7 元起。7 元按 gemini-2.5-pro 的 0.031 元算能跑 225 次,按 gemini-3-pro-preview 的 0.05 元算能跑 140 次。做法:拿你准备上线的真实文档和真实提示词跑 200 次,每次记下输入字数、输出字数、要不要返工。这一步花不到 7 元,但能把你的真实成本模型定下来。
按「每天请求数 × 单价」算上限,再加 30% 缓冲。以每天 200 次、gemini-2.5-pro 为例:200 × 0.031 = 6.2 元/天,加缓冲按 260 次算是 8.06 元/天,一个月 242 元。把缓冲单独记一栏,冲进缓冲说明有异常请求,去看哪段代码在重复调用。
每天固定一个时间看三个数:请求次数、平均输入字数、失败重试次数。重试单独记一栏,重试多说明提示词或超时设置有毛病。数量对不上预算时,先查是不是有定时任务在重复跑。
gemini-2.5-pro 的 0.031 元已是价目表里便宜的一档。真要压成本先压请求次数——批量任务合并成一次请求、稳定结论缓存起来、没必要的分支砍掉,这些动作不花钱。同价位可选的还有:deepseek-v4-flash-thinking 0.05 元、kimi-k2.5 与 kimi-k2.6 各 0.09 元、claude-sonnet-4-5-thinking 0.09 元、gpt-5.5 0.2 元、claude-sonnet-4-6-thinking 0.2 元、claude-opus-4-6-thinking 0.25 元。任务吃超长上下文就留在 Gemini 这几档:长度在按次计费里不额外收费,换到按量计费上,账会随文档变大而变贵。