最新 Kimi K3 已上线大模型云服务,按量计费,稳定易用, 立即体验
共绩算力

共绩算力上的国产大模型,我们自己也跑了一遍

2026年7月21日
"共绩算力上的国产大模型,我们自己也跑了一遍"
Shiyuh
Shiyuh
技术传道者/AI 应用落地

国产大模型越来越多,选型成了开发者的麻烦事。既然咱们把 DeepSeek、Kimi、GLM 这些主流模型都接进平台了,干脆自己拿同一套题跑一遍,7 个模型拉出来溜溜,看看到底谁好用。不吹不黑,结果先放下面。

测了什么

我挨个点了一遍,共有 7 个国产顶尖模型:

题是我自己编的,一共 15 道,分了 6 类:数学 4 题、代码 3 题、逻辑 2 题、中文理解 3 题、指令遵循 2 题、工具调用 1 题。代码题是真跑测试用例的,不是看一眼像不像就给分。每个模型每道题调一次,记延迟和 token 花费。

参数这块有个坑要注意,Kimi K3 作为推理模型必须把 temperature 设成 1,设成别的会报错。GLM 系列和 DeepSeek 也是推理模型,会把大量 token 花在思考过程上,max_tokens 得给够,我一开始给 300 结果正文全是空的,后来统一拉到 2500 才正常。

整个过程跑下来 514 秒,105 次调用,花了一块多钱。按量计费这点倒是挺省心,不用开套餐。

结果先放这

模型

总分

数学

代码

逻辑

中文

指令

Agent

花费 (¥)

延迟 (s)

DeepSeek V4 Flash

14/15

3/4

3/3

2/2

3/3

2/2

1/1

0.0148

5.64

DeepSeek V4 Pro

14/15

3/4

3/3

2/2

3/3

2/2

1/1

0.0357

7.30

Kimi K3

14/15

3/4

3/3

2/2

3/3

2/2

1/1

0.8191

15.32

Kimi K2.6

13/15

2/4

3/3

2/2

3/3

2/2

1/1

0.0751

4.25

GLM 5.2

13/15

2/4

3/3

2/2

3/3

2/2

1/1

0.3235

13.50

GLM 5.1

13/15

2/4

3/3

2/2

3/3

2/2

1/1

0.3830

17.53

GLM-5

13/15

2/4

3/3

2/2

3/3

2/2

1/1

0.3861

29.99

说实话看到这个结果我是有点意外的。7 个模型最高 14 分最低 13 分,就差 1 分。代码题全员满分,逻辑题全员通过,中文题也都没掉链子。这跟一年前测模型动不动就翻车的情况完全不一样了,国产模型确实进步快。

拉开差距的就一个维度——数学。

数学题:唯一的分水岭

数学 4 道题里,基础算术、应用题、方程求解这几个大家都能做对,真正拉开差距的是那道多步工程题:

一个水池有 A、B、C 三个管。A 管单独 5 小时注满,B 管单独 3 小时注满,C 管单独 4 小时排空。若三管同时打开,几小时能注满?

这道题考验的是多步分数运算,每一步都不能错。先说结论:7 个模型列的式子全对,都知道用 1/5 + 1/3 - 1/4 算净效率,思路都没问题。真正拉开差距的是最后那步通分计算。

DeepSeek V4 Flash 的回答很干脆,式子列完直接给结果:

设水池的容量为 1 个单位。A 管每小时注水 1/5,B 管每小时注水 1/3,C 管每小时排水 1/4。 三管同时打开,净注水速率:1/5 + 1/3 - 1/4 通分(分母取最小公倍数 60):12/60 + 20/60 - 15/60 = 17/60 注满所需时间:t = 1 ÷ 17/60 = 60/17 小时,即约 3.53 小时。

GLM 三代和 Kimi K3 也都算对了,过程写得很规范。GLM 5.2 的回答步骤最完整,从设总量为 1、算各管效率、通分、求时间,一步步推导到最终答案 60/17 小时(约 3.53 小时),还贴心地换算成了带分数 3 又 9/17 小时。GLM-5 还把 0.529 小时换算成了 31.8 分钟,给出了”约 3 小时 32 分钟”这种更直观的表述。

唯一算错的是 Kimi K2.6。它的过程其实写得挺漂亮,格式很规整,思路完全对,但通分那步 12+20-15 给算成了 27(应该是 17),最后得出了 20/9 小时(约 2.22 小时)。挺可惜的,式子都对,栽在一步加法上。这也说明非推理模型在多步数值计算上还是不如推理模型稳。

代码题:全员满分,风格有差异

三道代码题(素数判断、斐波那契、归并排序)全部通过测试用例,没什么好挑的。不过不同模型的代码风格确实有差别,可以聊聊。

DeepSeek 系列和 Kimi 系列写代码偏精炼,能一行搞定的不写两行。归并排序这题,DeepSeek V4 Flash 的实现:

def merge_sorted(a, b):
i, j = 0, 0
result = []
while i < len(a) and j < len(b):
if a[i] < b[j]:
result.append(a[i])
i += 1
else:
result.append(b[j])
j += 1
result.extend(a[i:])
result.extend(b[j:])
return result

干净利落,没什么多余的东西。

GLM-5 就不一样了,代码自带详细注释和 docstring:

def merge_sorted(a, b):
"""
将两个升序列表合并为一个升序列表
"""
merged = []
i = 0
j = 0
# 遍历两个列表,比较元素大小
while i < len(a) and j < len(b):
if a[i] <= b[j]:
merged.append(a[i])
i += 1
else:
merged.append(b[j])
j += 1
...

如果你是拿来做教学或者给新人看,GLM 这种风格更友好。如果是自己用,DeepSeek 那种精炼的更舒服。

素数判断那题也有意思,DeepSeek V4 Pro 和 Kimi K2.6 用了 6k±1 优化(步长为 6,每次检查两个候选因子,比普通写法快一倍),说明这俩模型不只追求正确,还会主动优化。DeepSeek V4 Flash 和 Kimi K3 用的是跳偶数写法(步长为 2),GLM 5.1/5.2 也是跳偶数写法,GLM-5 用的是最朴素的遍历。虽然都对,但能看出不同模型在”帮你想性能”这件事上确实有差异。

逻辑推理:全员通过,思路各异

两道逻辑题全对。农夫过河(狼羊菜问题)和说谎者推理,7 个模型都给出了正确答案和完整步骤。

有意思的是解题风格。DeepSeek V4 Pro 给的是带表格的步骤说明,每一步左岸右岸剩什么都列得清清楚楚,还附了等价方案:

步骤

左岸 → 右岸

右岸 ← 左岸

左岸剩余

右岸剩余

1

农夫 + 羊

狼、白菜

2

农夫

农夫、狼、白菜

3

农夫 + 白菜

羊、白菜

4

农夫 + 羊

农夫、狼、羊

白菜

5

农夫 + 狼

狼、白菜

6

农夫

农夫、羊

狼、白菜

7

农夫 + 羊

全部

GLM-5 的回答更口语化,重点解释了”羊是核心冲突点”这个关键思路,最后还总结了”中间需要把羊带回来一次”,适合给不懂的人看。Kimi K2.6 用的是假设法分析说谎者问题,先假设 A 说真话推出矛盾,再否定,条理很清楚。

中文理解:全员优秀,有点超出预期

中文题三道:一词多义、摘要提炼、红楼梦知识。7 个模型全对,这块确实没什么好说的,国产模型在中文上就是有天然优势。不过有几个回答挺值得贴一下的。

“意思意思”那道题

这题是老经典了:

领导说”你这是什么意思?“小明说”没什么意思,意思意思。“领导说”你这就不够意思了。“小明说”小意思,小意思。”

本以为会有模型翻车,结果全对,而且答得都挺到位。Kimi K3 的回答:

这段话的背景是小明给领导送礼 (或送红包),其中”意思”一词多义,妙趣横生:

  • “你这是什么意思?” —— 意思 = 含义、意图
  • “没什么意思” —— 意思 = 特殊用意、深层含义
  • “意思意思” —— 意思 = 表示心意(动词用法)
  • “你这就不够意思了” —— 意思 = 情义、情面

不光区分了每个”意思”的含义,还把送礼这个隐含语境点出来了。

GLM 5.2 答得也挺有味道,专门提到这是”中国语言文化博大精深和只可意会的微妙之处”。DeepSeek V4 Pro 则更进一步,把每个”意思”按出现顺序编号解释,结构最清晰。

红楼梦那道题

问的是海棠诗社社长是谁。正确答案是李纨。本来以为这种冷门知识容易出错,结果 7 个模型全对。Kimi K3 的回答简洁明了:

海棠诗社的社长是李纨,自号稻香老农。诗社由贾探春发起成立,李纨”自荐掌坛”,负责出题、限韵、评诗等;迎春、惜春为副社长。

GLM 5.1 的回答更详细,把来龙去脉都讲清楚了:

海棠诗社最初是由探春发起的(见于第三十七回),她给宝玉和众姐妹写了花笺,倡议结社作诗。虽然诗社是探春发起的,但在商议谁来当社长时,探春主动提出”必得请出大嫂子来主持”,大家也一致赞同。因为李纨作为寡嫂,年纪最长,性格厚道公允,虽然她自己作诗不算最拔尖,但大家认为她”善评”,能够公正地评判众人的诗作,所以推举她为社长。

连”发起人和社长不是同一人”这种细节都讲明白了,还点出了选李纨的原因是”善评”,说明模型真理解了原文,不是背了个答案。

指令遵循和工具调用:都没掉链子

指令遵循那题让模型只输出一个 JSON 对象,不许带任何其他文字。这种题最容易看出模型听不听话。结果 7 个模型都老老实实输出了纯 JSON,没一个废话的。Kimi K2.6 最快,0.95 秒就交了:

{"name":"张三","age":25}

工具调用那题,给了个 get_weather(city, date) 工具,问”北京明天天气怎么样”,让模型输出调用 JSON。7 个模型都对了,不过 Kimi K3 有个细节挺加分的——它把”明天”自动换算成了具体日期 2025-01-16。别的模型都直接传”明天”字符串,Kimi K3 多走了一步,说明它在认真理解时间语义。这种细节在真实业务里挺重要,比如你做日程助手,模型能自己换算日期就省心了。

关于花钱这事

这可能是这次测评最值得说的部分。

同样是 15 道题,DeepSeek V4 Flash 花了 1 分 5 厘,Kimi K3 花了 8 毛 2。差了 55 倍。但俩模型总分一样,都是 14 分。

算笔账更直观。以”跑 100 万次类似复杂度的对话”来估算:

模型

单次花费

100 万次花费

说明

DeepSeek V4 Flash

¥0.001

¥1000

一顿饭钱

DeepSeek V4 Pro

¥0.0024

¥2400

还能接受

Kimi K2.6

¥0.005

¥5000

中等开销

GLM 5.2

¥0.022

¥22000

得掂量下

GLM-5

¥0.026

¥26000

同上

Kimi K3

¥0.055

¥55000

得有预算

能力差不多的情况下,选错模型一年多花几十万,这事谁都不想遇到。

GLM 三代得分一样(都是 13 分),区别主要是价格和速度。GLM-5 价格最低(输入 6 块、输出 22 块),但最慢,跑一道题平均 30 秒;GLM 5.1 和 5.2 价格一样(输入 8 块、输出 28 块),速度快不少,GLM 5.2 降到 13.5 秒。迭代还是有效果的,至少不那么慢了。如果你已经在用 GLM,升级到 5.2 体验会好不少;如果还没用,直接上 5.2 就行。

Kimi K3 作为 2.8 万亿参数的旗舰,能力确实顶,但单价也顶(输入 20、输出 100)。除非你的任务真的需要那种深度的推理能力,不然日常用确实有点奢侈。Kimi K2.6 虽然便宜不少(输入 6.5、输出 27),但数学题比 K3 少对一道,总分差 1 分。如果不需要深度推理,K2.6 性价比比 K3 高。

反过来看 DeepSeek V4 Flash,输入 1 块、输出 2 块的价格,能力跟贵 20 倍的模型打平。这个性价比确实没话说。

速度:三个梯队

延迟这块差距也不小,大致分三档:

第一档(5 秒内出结果):Kimi K2.6(4.25 秒)、DeepSeek V4 Flash(5.64 秒)。这俩适合做实时交互,用户基本不用等。

第二档(7-15 秒):DeepSeek V4 Pro(7.3 秒)、GLM 5.2(13.5 秒)、Kimi K3(15.3 秒)。可以接受,但实时对话会有点卡顿感。

第三档(17 秒以上):GLM 5.1(17.5 秒)、GLM-5(30 秒)。GLM-5 这个速度做实时交互基本没法用,一道题等半分钟,用户早跑了。不过它是推理模型,思考时间长也正常,适合离线批处理。

这里有个规律:推理模型(DeepSeek、Kimi K3、GLM 系列)普遍比非推理模型(Kimi K2.6)慢,因为它们会先在 reasoning 里想一遍再输出答案。代价是 token 消耗也大——GLM-5 跑 15 题输出了 17353 个 token,是 Kimi K2.6(2601 个)的 6.7 倍。这些 token 都是钱。

不同场景怎么选

测完之后我自己总结了一下,其实没有”最好”的模型,只有”最合适”的:

日常开发用:DeepSeek V4 Flash。便宜快好,性价比断档第一。我后来手头项目的代码补全、文档生成都换它了,一个月下来没花几个钱。如果你只想要一个”够用且便宜”的模型,选它不会错。

数学推理 / 算法题:DeepSeek V4 Pro 或者 Kimi K3。这俩在多步推理上最稳,水池那题就是它们几个算对的。Pro 性价比高一些,K3 推理更深但贵。如果你的任务涉及数学证明、逻辑链推理、算法设计,这俩最靠谱。

要快、要实时:Kimi K2.6。4 秒多出结果,是非推理模型里最快的,做客服、做对话机器人这种场景合适。而且它不搞”先想后答”那一套,直接给结果,体感很流畅。

长文本:GLM 5.2 或者 Kimi K3。都支持百万 token 上下文。GLM 5.2 官方说能承载项目级工程上下文,这个我还没测,回头可以试试把整个代码库丢进去。Kimi K3 的 1M 上下文也是标配。如果你要处理长报告分析、代码库理解、超长对话历史,这俩是首选。

Agent 开发:GLM 5.1 / 5.2 或者 Kimi K2.6。GLM 5.1 专门讲 Agentic Engineering,工具调用很稳;Kimi K2.6 本身就是多模态智能体,擅长长程任务。在共绩算力上一键切换,方便对比哪个更适合你的 Agent 业务。说实话这次工具调用题太简单了,没拉开差距,想真正分高下得设计更复杂的多步工具调用场景。

预算紧的批处理:还是 DeepSeek V4 Flash。1 块钱能跑一堆任务,离线跑数据标注、批量摘要、文档清洗这种用着不心疼。GLM-5 虽然慢,但如果你的任务对延迟不敏感、又需要推理能力,它的单价(22 块输出)比 Kimi K3(100 块输出)便宜不少,也算个折中选择。

平台体验与快速上手

既然是在共绩算力上测的,顺带说下平台体验和怎么接入。我翻了他们的快速上手文档,接入确实简单,总结下关键信息。

两个地址记住就行

用途

地址

控制台(管密钥、看模型、查账单)

console.suanli.cn/models

API 调用地址

api.suanli.cn/v1

接入只需改两个参数。因为完全兼容 OpenAI 接口,你之前用 OpenAI SDK 的代码,把 api_keybase_url 改掉就能跑,其他一行不用动。文档里给的 Python 示例:

from openai import OpenAI
client = OpenAI(
api_key="你的 API Key",
base_url="https://api.suanli.cn/v1",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[
{"role": "system", "content": "你是一个有用的 AI 助手。"},
{"role": "user", "content": "请用一句话解释什么是大语言模型。"}
],
max_tokens=1000,
temperature=0.7
)
print(response.choices[0].message.content)

不用 Python 的也可以用 cURL:

Terminal window
curl -X POST "https://api.suanli.cn/v1/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer 你的API Key" \
-d '{
"model": "deepseek/deepseek-v4-flash",
"messages": [{"role": "user", "content": "你好"}],
"max_tokens": 100,
"temperature": 0.7
}'

模型切换是真的方便。想换模型,只改 model 字段就行,比如从 deepseek/deepseek-v4-flash 换成 moonshotai/kimi-k3,其余代码不动。一个 Key 就能调全部 7 个模型,省得我注册一堆账号。写个 for 循环遍历模型列表,一次跑完所有对比,开发体验很好。如果你想看自己账号能用哪些模型,调一下 models.list() 接口就全出来了:

models = client.models.list()
for m in models.data:
print(f" - {m.id}")

按量计费没有套餐费,这次 105 次调用总共花了一块多,对个人开发者或者小团队比较友好。相比传统包月套餐,按量模式能省下约 18.6% 的成本(具体大家可以拿自家账单对比下),至少不会让你为用不上的资源买单。平台宣称 99.99% 可用率,这次跑的过程中没遇到调用失败的情况。

写在最后

这次测完最大的感受,不是哪个模型最强,而是整个国产大模型生态已经成熟到可以让开发者”不纠结”了

一年前做模型选型,你要在能力、价格、速度之间反复权衡,踩坑是常态——指令题一半模型不听话,代码题动不动就跑不通,长文本说是支持百万 token 实际几万就开始丢内容。现在呢?15 道题里除了数学有一道拉开 1 分差距,其余维度全员通过。代码全员满分、中文理解全员优秀、Agent 调用全员到位。这意味着什么?意味着你终于可以把精力从”选哪个模型”转回到”怎么用好模型”上了

而共绩算力这类平台做的事,恰恰是在降低”用好模型”的门槛。一个 API Key、一套 OpenAI 兼容接口、一行代码切换模型,让你能在同一套代码里随时对比 DeepSeek、Kimi、GLM 的表现,按实际效果选型,而不是被某一家绑定。按量计费、无套餐费的模式,也让试错成本降到了几乎可以忽略——我这次 105 次调用花了一块多,这个成本任何人都能承受。

说到底,大模型不该是奢侈品。当 DeepSeek V4 Flash 能用 1 块钱 1 百万 token 的价格,提供和贵 20 倍的旗舰模型一样的能力时,普惠就不是一句口号了。国产模型这一年的进步,配得上”惊喜”这个词。

如果你也在选模型,别光看跑分,自己跑一遍最实在。控制台地址 console.suanli.cn/models,注册就能用,第一次调用花不了几毛钱。

准备好开始您的 AI 之旅了吗?

读完这篇文章,想必您对 AI 技术有了更深的了解。现在就来体验共绩算力,让您的想法快速变成现实。

✓ 已有 10 万 + 开发者在使用

✓ 99.9% 服务可用性

✓ 开箱即用的容器托管