Gemini 全系按次价格怎么算

同样一次请求,把一份 3 万字的合同丢给模型抽付款条款:按量计费大约 0.15 元,按次计费固定 0.031 元,差约 4.7 倍。换成 40 万字的技术手册,按量要 1.81 元,按次还是 0.031 元,差约 58 倍。小鱼API 的 Gemini 全系走按次计费,一次请求一个固定价,输入多长都不加钱。下面把三档价位的分工、长文档的真实账、生图成本、升档判断和接入方式逐项算清。价格以各家模型官方页面的标价为准,本文仅作换算参考。

三档 Gemini 按次价格先摆出来

先看价目。三档的差别不在输入长度,而在任务难度。

gemini-2.5-pro:0.031 元一次

价目表里按次单价最低的一档,吃量的活交给它。长文档抽取字段、批量分类打标、摘要、翻译、把杂乱文本转成 JSON,这类任务答案明确、对措辞不敏感。举个例子:做招投标的小团队每天要读 200 份招标文件,每份 3 万字,只抽「项目名称、预算、截止时间、资格要求」四个字段。全部交给 gemini-2.5-pro,一天 200 次请求是 6.2 元,一个月 186 元。

gemini-3-pro-preview:0.05 元一次

比 2.5-pro 贵 0.019 元一次。它接的是需要理解前后关系的活:整份代码仓库找问题、把一堆零散会议记录合成有逻辑的纪要、按业务规则写结构化报告。判断标准很简单——如果 2.5-pro 的输出你还要人工改两三遍才敢用,这个任务就该放到这一档。多花 0.019 元,抵掉一次人工返工就回本。

gemini-3.1-pro-preview:0.09 元一次

这一档单价 0.09 元,比 3-pro 贵 0.04 元,比 2.5-pro 贵 0.059 元。它留给真正难的活:答案散在几十页之外的跨章节问答、需要对照多份文档做一致性核对的财务与法务审阅、输出直接进正式交付物且不打算让人再读一遍的场景。难活不多时,把它当救火档用就行。

三档怎么分工

模型按次单价(元/次)接什么活什么时候别用它
gemini-2.5-pro0.031抽取字段、分类打标、摘要、翻译、长文档批处理需要多步推理、答案要跨章节拼接
gemini-3-pro-preview0.05代码审阅、结构化报告、有前后逻辑的长文写作高并发跑简单抽取,单次成本翻 1.6 倍
gemini-3.1-pro-preview0.09多跳问答、一致性核对、直接交付的正式文本单轮问答、单一字段抽取

三档共享一件事:输入多长都不加价,选哪档只看任务难度。

按次和按量差在哪:两个公式说清

按量计费的钱是加出来的

按量计费的公式是:钱 = 输入 token 数 × 输入单价 + 输出 token 数 × 输出单价。输入和输出分开计价,输出单价通常更高。以主流旗舰的官方按量标价为例,输入约 3 元/百万 token、输出约 15 元/百万 token(以各家模型官方页面的标价为准,本文仅作换算参考)。容易漏掉的一点:输入每次请求都要重新算。同一个 40 万字文档问 10 个问题,输入 token 就按 10 份计费。

按次计费:输入多长都不加钱

按次计费就是一次请求一个固定价。发 1 个字和发 20 万字同价,账单只跟请求次数有关。按次不等于模型不读你的文档,而是把「输入长度」从账单里拿掉了。所以吃长度的场景——整库资料问答、几十万字 PDF、长视频转写文本——塞更多内容不额外花钱。

同一场景下两种计费对照

单次请求输入输入 token(按 1.5 估)按量成本(元)按次 2.5-pro(元)相差倍数
1 万字1.5 万0.0560.031约 1.8 倍
5 万字7.5 万0.2360.031约 7.6 倍
20 万字30 万0.9110.031约 29 倍
40 万字60 万1.8110.031约 58 倍

表里输出统一按 500 汉字(约 750 token)算,输入 3 元/百万 token、输出 15 元/百万 token。换算口径你也能复算:中文 1 个汉字约 1~1.5 个 token(不同分词器结果不同),本文统一按 1.5 估。

超长上下文在按量计费下贵在哪

长文档的 token 量怎么估

先写清口径,你才能自己复算:1 万字中文约 1.5 万 token,10 万字约 15 万 token,40 万字约 60 万 token,也就是 0.6 百万 token。英文另算,大致 4 个字符折 1 个 token。上长文档产品前,拿真实文件跑一次分词,把实际 token 数记下来,比看任何估算表都准。

40 万字 PDF 的实际账

按 3 元/百万 token 的输入价:0.6 × 3 = 1.8 元。再加输出——让模型写 500 字结论,约 750 token,按 15 元/百万 token 是 0.011 元。一次请求合计约 1.81 元。同样这次请求走按次计费,gemini-2.5-pro 收 0.031 元,1.81 ÷ 0.031 ≈ 58 倍。如果这份文档每天都要重新过一遍,按量是一天 1.81 元、一个月 54.3 元;按次是一天 0.031 元、一个月 0.93 元。

按次计费下这部分几乎不花钱

按次把输入长度剔出了账单。对做长文档产品的团队,这意味着可以把整本手册、整个知识库、整段长视频转写文本一起塞进去,成本不随资料变大而上涨。反过来看,按量计费做长文档产品有个结构性矛盾——文档给得越全、效果越好、账单越贵,很多团队是账单涨到四位数才发现这件事的。

每天 N 次请求,一个月花多少钱

长文档批处理:每月 186 元

沿用前面的招投标场景:每份 3 万字,一天 200 份。按次走 gemini-2.5-pro,单次 0.031 元,一天 6.2 元,一个月 186 元。同样的活走按量,单次约 0.146 元(输入 3 万字 4.5 万 token 算 0.135 元,加输出 0.011 元),一天 29.2 元,一个月 876 元。一个月差 690 元。这 690 元不需要改提示词、不需要换模型,只因为计费方式不同。

多图加长文本:每月 450 元

第二种活:一次请求带 20 张商品图加 2 万字用户反馈转写文本,做图文一致性检查。图片按每张 1000 token 估算,20 张是 2 万 token;2 万字文本约 3 万 token;输入合计 5 万 token,即 0.05 百万 token,按 3 元/百万 token 是 0.15 元;输出 500 字约 0.011 元,单次按量 0.161 元。同样的活交给 gemini-3-pro-preview 按次收 0.05 元。一天 300 次:按次 15 元、一月 450 元;按量 48.3 元、一月 1449 元。

生图:每月 810 元

生图也是按次计价,跟文本模型同一套账。

生图模型按次单价(元/次)每天 100 张的月成本
gpt-image-2-pro0.2525 元/天,750 元/月
NanoBanana-Pro0.2727 元/天,810 元/月

一张商品主图 0.27 元比一次文本推理贵得多,但它替代的是几十元的外包图。算 ROI 时把两件事放一张表里,别只盯文本模型单价。

三个场景放在一起看

场景每天请求数用哪档按次每天按次每月按量每月
长文档批处理(3 万字/份)200gemini-2.5-pro6.2 元186 元876 元
多图加长文本质检300gemini-3-pro-preview15 元450 元1449 元
商品图生成100NanoBanana-Pro27 元810 元按量口径不同

三行加起来,按次一个月 1446 元,按量光前两行就 2325 元。省下的 879 元来自同样的调用量。

升档到 gemini-3.1-pro-preview 值不值

判断方法:先算返工率门槛

只看 API 账。设便宜档有 r 比例的请求需要重跑一次,有效单价就是 单价 ÷ (1 − r)。把 gemini-3-pro-preview(0.05 元)和 gemini-3.1-pro-preview(0.09 元)拉平:0.05 ÷ (1 − r) = 0.09,解得 r ≈ 44%。再拿 gemini-2.5-pro(0.031 元)和 3.1-pro 拉平:0.031 ÷ (1 − r) = 0.09,解得 r ≈ 66%。换句话说,只算 API 成本,便宜档返工率超过 44%(相对 3-pro)或者 66%(相对 2.5-pro)时,升档才开始划算。

把人工时间折成钱,门槛会降下来

返工成本不只是重跑那一次的钱,还有盯屏幕确认、改提示词、重新对结果的时间。假设一次人工返工折 1 元,gemini-2.5-pro 的有效单价变成 0.031 + r × 1.031;让它等于 0.09,解得 r ≈ 6%。同样的算法套在 3-pro 上:0.05 + r × 1.05 = 0.09,解得 r ≈ 4%。返工率只要到 6%,你的时间成本就已经把升档的差价补回来了。这也是为什么「贵档更省钱」在有人工介入的流程里经常成立。

每天 1000 次的完整账

2.5-pro 返工率有效单价(元/次,含 1 元人工)2.5-pro 全量月成本对比 3-pro 全量 1500 元对比 3.1-pro 全量 2700 元
0%0.031930 元省 570 元省 1770 元
2%0.0521549 元多 49 元省 1151 元
5%0.0832477 元多 977 元省 223 元
8%0.1133404 元多 1904 元多 704 元

月成本按每天 1000 次、30 天算。3-pro 全量是 0.05 × 1000 × 30 = 1500 元,3.1-pro 全量是 0.09 × 1000 × 30 = 2700 元。用法:先跑 200 次统计返工率落在哪一行,再决定档位。

什么任务该升档,什么不该

该升的是:跨越几十页的多跳问答、多份文档的一致性核对、输出直接进正式交付物。不该升的是字段抽取、分类打标、翻译、摘要——这类返工通常来自「字段没抽到」「格式没对上」,把提示词和输出 schema 写清楚比升档便宜得多。升档解决的是模型能力上限,不是提示词质量。

接入只改一行 base_url

curl 最小示例

curl https://xyuapi.top/v1/chat/completions \
  -H "Authorization: Bearer $XYU_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
        "model": "gemini-2.5-pro",
        "messages": [{"role": "user", "content": "把这份合同的付款条款整理成表"}]
      }'

备用入口 https://xyuai.cc/v1,主入口不通时换域名即可,请求体不用改。

Python SDK 怎么改

from openai import OpenAI

client = OpenAI(
    api_key="你的小鱼API令牌",
    base_url="https://xyuapi.top/v1",   # 备用:https://xyuai.cc/v1
)

resp = client.chat.completions.create(
    model="gemini-3-pro-preview",       # 模型名直接用短名
    messages=[{"role": "user", "content": "读完整本手册,列出所有和安全有关的章节"}],
)
print(resp.choices[0].message.content)

原来跑 OpenAI 接口的代码,只动 base_url 和模型名两处,重试、日志、超时都不用碰。

模型名用短名

不用加 google/ 之类的供应商前缀,直接写 gemini-2.5-progemini-3-pro-previewgemini-3.1-pro-preview;生图写 NanoBanana-Progpt-image-2-pro。名字写错通常报模型不存在,先核对拼写再查别处。

先算清自己的账再充钱

成本试算脚本

# cost_compare.py —— 按量与按次成本试算
PER_M_IN = 3.0      # 按量输入:元/百万 token(以各家官方标价为准,仅作换算参考)
PER_M_OUT = 15.0    # 按量输出:元/百万 token
TOK_PER_HAN = 1.5   # 假设:1 个汉字 ≈ 1.5 个 token
PRICE = 0.031       # 按次单价:2.5-pro 用 0.031,3-pro 用 0.05,3.1-pro 用 0.09

def by_usage(han_in, han_out):
    """按量:钱 = 输入 token 数 × 输入单价 + 输出 token 数 × 输出单价"""
    tok_in = han_in * TOK_PER_HAN
    tok_out = han_out * TOK_PER_HAN
    return tok_in / 1_000_000 * PER_M_IN + tok_out / 1_000_000 * PER_M_OUT

def by_call(times, price=PRICE):
    """按次:钱 = 请求次数 × 固定单价"""
    return times * price

if __name__ == '__main__':
    for han in (10000, 50000, 200000, 400000):
        once = by_usage(han, 500)
        print('输入 %d 字 -> 按量 %.3f 元 / 按次 %.3f 元 / 相差 %.1f 倍'
              % (han, once, PRICE, once / PRICE))
    print('每天 200 次、跑 30 天 -> 按次 %.1f 元' % by_call(200 * 30))

脚本怎么用

改三个数字就行:单个文档的汉字数、每次输出的汉字数、每天的请求次数。注意 1.5 这个系数偏保守(偏大),对分词器友好的内容可能只要 1.2,实际按量成本会比脚本算出来的略低,结论只会更偏向按次。

三个要盯的指标

每次请求的平均输入汉字数、每天请求次数、返工率。前两个决定账单大小,第三个决定该不该升档。把这三个数记一周,你对成本的判断会比任何估算表都准。

你该怎么做:从试跑到监控

起步:先充 7 元跑真实流量

最低充值 7 元起。7 元按 gemini-2.5-pro 的 0.031 元算能跑 225 次,按 gemini-3-pro-preview 的 0.05 元算能跑 140 次。做法:拿你准备上线的真实文档和真实提示词跑 200 次,每次记下输入字数、输出字数、要不要返工。这一步花不到 7 元,但能把你的真实成本模型定下来。

预算怎么设

按「每天请求数 × 单价」算上限,再加 30% 缓冲。以每天 200 次、gemini-2.5-pro 为例:200 × 0.031 = 6.2 元/天,加缓冲按 260 次算是 8.06 元/天,一个月 242 元。把缓冲单独记一栏,冲进缓冲说明有异常请求,去看哪段代码在重复调用。

用量怎么监控

每天固定一个时间看三个数:请求次数、平均输入字数、失败重试次数。重试单独记一栏,重试多说明提示词或超时设置有毛病。数量对不上预算时,先查是不是有定时任务在重复跑。

该换档还是换模型

gemini-2.5-pro 的 0.031 元已是价目表里便宜的一档。真要压成本先压请求次数——批量任务合并成一次请求、稳定结论缓存起来、没必要的分支砍掉,这些动作不花钱。同价位可选的还有:deepseek-v4-flash-thinking 0.05 元、kimi-k2.5 与 kimi-k2.6 各 0.09 元、claude-sonnet-4-5-thinking 0.09 元、gpt-5.5 0.2 元、claude-sonnet-4-6-thinking 0.2 元、claude-opus-4-6-thinking 0.25 元。任务吃超长上下文就留在 Gemini 这几档:长度在按次计费里不额外收费,换到按量计费上,账会随文档变大而变贵。

相关阅读

🚀 想要立即使用?来小鱼API体验全系列AI模型

查看全部产品

支持Gemini / Claude / GPT / Grok / DeepSeek · 国内直连 · 支付宝/微信