写中文长文交给 kimi-k2.5 或 kimi-k2.6,批量中文抽取和清洗交给 deepseek-v3.2-thinking,要一步步推的中文推理题交给 deepseek-r1-thinking。这是我拿同一套 50 条中文任务在两套模型上跑完盲评之后的结论,不是感觉。
价格差一倍:kimi 系 0.09 元/次,deepseek-v3.2-thinking 0.049 元/次。差的不只是钱。同一个提示词丢进去,kimi 更愿意把句子写长、写出节奏,deepseek 更愿意把话说短、把字段摆整齐。你其实是在选写作习惯,不只是选模型。
两个版本同价,都是 0.09 元/次,不用纠结谁更新。挑法很简单:拿同一个选题各写三篇,谁的开头不套路就用谁。我的样本里 kimi 的段落长短更自然,排比句少,很少冒出「不仅……而且……」这种模板腔。写一篇三千字公众号,改稿时间大概能省掉一半。
地址、金额、人名、日期、订单号这类字段抽取,deepseek 更听话:给它一份 JSON 结构,它基本只吐 JSON,不加开场白,也不爱加解释。0.049 元/次,跑量时成本只有 kimi 的一半左右。
需要一步步推导的中文题,而且思考链本身也算交付物的时候,用这两张牌。deepseek-r1-thinking 是 0.049 元/次;deepseek-v4-pro-thinking 是 0.09 元/次,用在多步权衡、长因果链的场景。别把 pro 设成默认模型,差价看着小,调用量一上来就是接近翻倍。
0.05 元/次,首字返回快。十万条短文本去重、打标签、补字段这种机械活交给它,别用长文模型干这个。
| 你的任务 | 建议模型 | 单价 |
|---|---|---|
| 公众号长文、技术文档 | kimi-k2.5 / kimi-k2.6 | 0.09 元/次 |
| 地址、金额、人名抽取 | deepseek-v3.2-thinking | 0.049 元/次 |
| 中文数学、逻辑推理 | deepseek-r1-thinking | 0.049 元/次 |
| 多步方案权衡、长因果链 | deepseek-v4-pro-thinking | 0.09 元/次 |
| 海量短文本清洗 | deepseek-v4-flash-thinking | 0.05 元/次 |
「中文都挺好」这种话没法指导选型。要比,就得有固定题面加固定打分规则,换模型换时间都能复现。
公众号开头 5 条:给定产品,写 150 字开头,禁用「随着」「在这个时代」起句。产品文案 5 条:写满三条卖点,禁用「赋能」「闭环」。技术文档段落 5 条:给接口名和参数表,写一段参数说明。禁词就是拿来测它守不守约束的。
地址 4 条、金额 4 条、人名 3 条、日期 2 条、订单号 2 条。地址里混省市区简写和「某某大厦 12 层」,金额里混「叁万伍仟元」和「3.5w」,人名里塞公司名和地名。要求只输出 JSON,多余的字都算扣分项。
会议纪要为底,长 2000 字和短 300 字交替,要求输出「决议 / 待办 / 负责人」三段。这一组专门测谁开始编负责人——原文没提到负责人,编出来的直接判违规。
同一段对话里连续追加 5 轮格式要求:先定成三行表格式输出,再要求时间倒序,再要求金额带千分位,再要求去掉备注列,最后要求加一行合计。看它到第 5 轮时,是否还记得第 2 轮定下的输出格式。
四项,每项 1 到 5 分:准确性(结论对不对)、中文自然度(有没有翻译腔)、格式合规(模板守不守)、有没有编造(编了就记 1 分)。两个评分人各自独立打完再取均值;同一份输出两人分差超过 1 分,这条样本单独拉出来复评,复评时两人一起看。别让一个人打完整批,人会漂。
{"id": "extract-007", "type": "extract", "rule": "只输出 JSON,不要解释",
"input": "甲方张三丰实业有限公司于2024年3月17日向北京市朝阳区建国路88号项目部交付叁万伍仟元整。",
"expect": {"company": ["张三丰实业有限公司"], "date": ["2024-03-17"], "amount": ["35000"]},
"check": "exact_match"}
张三丰 就是那个坑:它在这里是公司名的一部分,不是人名。谁把它拆成「人名 张三丰 + 机构 实业有限公司」,这条就算错。
同一个选题各写三篇 1200 字。kimi 的句子长度方差大,短的七八个字,长的能到四十字,读起来有停顿感;deepseek-v3.2-thinking 的句长偏整齐,三篇里有两篇段落结构几乎一样——总述、三点、小结。要发公众号,这点很要命,读者一眼能看出是机器写的。
给一份条款模板,要求「第 X 条」编号、小标题加粗、金额同时写大写。kimi 守模板的比例更高;deepseek 偶尔自作主张把两条小条款合并。术语一致性两边都不错,一份合同里「甲方 / 买方」混用的概率都很低。
给 20 个口语场景,比如「这事儿有点悬」「先把盘子占住」。kimi 用对的位置更多;deepseek 偶尔把俗语写完整成书面语,读着别扭。两边都会生造搭配,所以上线前把成语单独拉一张抽查清单,二十条起,别省这个工。
十万字塞不进上下文时,必须分块。分块之后两边的差别不在记忆力,在态度:deepseek 更常写「原文未提及」,kimi 更容易顺着上下文把细节补圆。做合规类摘要,选更愿意承认没看到的那一边。
15 条抽取任务上,deepseek 的格式合规率明显更高,基本不给开场白。kimi 会先写一句「好的,以下是抽取结果」,多这半句就得额外写一层清洗。批量流水线里,这种多余字符是要额外花钱处理的。
连续 5 轮追加约束,deepseek 到最后一轮还守得住行结构和千分位;kimi 更容易在第三四轮被语气带走,格式开始松。要跑多轮对话式表单填写,deepseek 更稳。
给它一段 Python 函数,要求中文注释、术语保留英文原词。两边都能把 retry、timeout 这种词留住不乱翻译。中英混排空格这点,kimi 有时会漏。要求写模块级 docstring 时,deepseek 的注释更短,kimi 会多写两行背景说明,看你要哪种风格。
同一道中文应用题,deepseek-r1-thinking 的思考链是用中文推的,步骤可读,出错了也看得出来错在哪;kimi 的推理步骤偏跳,结论常常对,但中间那一步你补不上。要给孩子讲题、要给同事解释,选 r1 这类。
| 对比维度 | kimi-k2.5 / kimi-k2.6 | deepseek-v3.2-thinking |
|---|---|---|
| 长文语感与句长变化 | 更自然 | 段落结构偏模板 |
| 公文格式守约 | 更稳 | 偶尔合并条款 |
| 口语俗语 | 生造更少 | 偶有书面化 |
| 长文档摘要态度 | 易补圆内容 | 更常写未提及 |
| 实体抽取纯净度 | 有开场白 | 更干净 |
| 多轮格式约束 | 中 | 更强 |
| 中英混排 | 偶漏空格 | 稳 |
| 中文推理链可读性 | 偏跳 | 更清楚 |
kimi 系 0.09 元乘 1 万次等于 900 元;deepseek-v3.2-thinking 0.049 元乘 1 万次等于 490 元,差 410 元。如果你每天跑 1000 条中文摘要,一个月是 2700 元对 1470 元。量级再往上,这个差额够你多招一个人做质检了。
按 token 计费时,一份两万字的中文合同塞进去,光是输入就是两三万 token,账单跟着涨。按次计费不看输入长度:两万字中文进去是 0.049 元一次,一千字进去也是 0.049 元一次。做合同审阅、长报告摘要、往长上下文里塞知识库的团队,这一条比单价本身更值钱。
单次请求很短、量又极大的场景(比如只做一次关键词分类),按次计费不一定划算,可以先算一下 token 用量再决定;长文本为主的业务就按次,别折腾。平台另有按量计费与无限卡套餐,量稳定了再对比。
判断方法很简单:把你的真实样本拿十条,一条一条算出中文输入有多少字。平均超过两千字,按次计费几乎总是更省;平均只有几十个字,才值得去比按量。
别人的评测只能参考,中文语感这件事尤其主观。花半天把自己业务的 50 条真实样本跑一遍,比看十篇测评都值。
每行一条 JSON,字段和上面示例一致:id、type、rule、input、expect、check。check 填 exact_match 表示要精确匹配,填 regex 表示按正则判格式。
import csv, json, os, re
from openai import OpenAI
BASE = "https://xyuapi.top/v1"
MODELS = {"kimi": "kimi-k2.5", "ds": "deepseek-v3.2-thinking"}
cli = {k: OpenAI(api_key=os.environ["XYU_KEY"], base_url=BASE) for k in MODELS}
def ask(tag, prompt, text):
r = cli[tag].chat.completions.create(
model=MODELS[tag], temperature=0,
messages=[{"role": "user", "content": prompt + chr(10) + text}])
return r.choices[0].message.content
def auto_score(item, out):
if item["check"] == "exact_match":
exp = json.dumps(item["expect"], ensure_ascii=False, sort_keys=True)
try:
got = json.dumps(json.loads(out), ensure_ascii=False, sort_keys=True)
except Exception:
return 0
return 1 if exp == got else 0
return 1 if re.search(item["rule"], out) else 0
rows = []
for line in open("tasks.jsonl", encoding="utf-8"):
if not line.strip():
continue
item = json.loads(line)
for tag in MODELS:
out = ask(tag, item["rule"], item["input"])
rows.append([item["id"], item["type"], MODELS[tag], auto_score(item, out), out])
with open("result.csv", "w", newline="", encoding="utf-8-sig") as f:
w = csv.writer(f)
w.writerow(["id", "type", "model", "auto", "output"])
w.writerows(rows)
for tag in MODELS:
hit = [r[3] for r in rows if r[2] == MODELS[tag]]
print(MODELS[tag], "自动通过率", round(sum(hit) / len(hit) * 100, 1), "%")
跑完你会拿到两张东西:result.csv(每条的原始输出)和一份自动通过率。自动指标只解决「格式对不对」和「抽取准不准」;准确性、中文自然度、有没有编造这三项还得人工盲评。做法是把 CSV 里的模型名隐藏,导出成两份只带编号的打分表,两个人各打一遍,再合并算均分并标出分歧样本。
base_url 填 https://xyuapi.top/v1,备用 https://xyuai.cc/v1。模型名直接写 kimi-k2.5、kimi-k2.6、deepseek-v3.2-thinking,大小写和连字符都别改。Chatbox、Cherry Studio、NextChat、Cline、RooCode、KiloCode、LobeChat 这类支持自定义 OpenAI 地址的客户端都能接,协议走 /v1/chat/completions。最低充值 7 元,支付宝或微信付款,不需要海外信用卡。
curl https://xyuapi.top/v1/chat/completions \
-H "Authorization: Bearer $XYU_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"kimi-k2.5","messages":[{"role":"user","content":"用两句话说明按次计费的适用场景"}]}'
两个模型名各跑一次,都返回内容再往下接业务代码。
401 invalid api key:Key 复制时带了空格或换行,重新粘一次,别用带引号的写法。404 model not found:模型名拼错,或者用了这个平台没上的型号,先请求 /v1/models 对一遍。max_tokens 设太小,调大即可;思考类模型还要给足超时时间。主笔内容走 kimi-k2.5(0.09 元/次),把语感这件事交给它;素材抽取、字段清洗、标签打标走 deepseek-v3.2-thinking(0.049 元/次);数据校验、逻辑题、需要给出推理过程的部分走 deepseek-r1-thinking(0.049 元/次);日更上千条的短文本处理走 deepseek-v4-flash-thinking(0.05 元/次)。
先跑 50 条真实样本,用你自己的评分表定稿,再把这个分工写进代码里。选型不是一次定终身,业务变了重新跑一遍评测就行。