国产大模型越来越多,选型成了开发者的麻烦事。既然咱们把 DeepSeek、Kimi、GLM 这些主流模型都接进平台了,干脆自己拿同一套题跑一遍,7 个模型拉出来溜溜,看看到底谁好用。不吹不黑,结果先放下面。
测了什么
我挨个点了一遍,共有 7 个国产顶尖模型:
- DeepSeek V4 Flash / Pro
- Kimi K2.6 / K3
- GLM-5 / 5.1 / 5.2
题是我自己编的,一共 15 道,分了 6 类:数学 4 题、代码 3 题、逻辑 2 题、中文理解 3 题、指令遵循 2 题、工具调用 1 题。代码题是真跑测试用例的,不是看一眼像不像就给分。每个模型每道题调一次,记延迟和 token 花费。
参数这块有个坑要注意,Kimi K3 作为推理模型必须把 temperature 设成 1,设成别的会报错。GLM 系列和 DeepSeek 也是推理模型,会把大量 token 花在思考过程上,max_tokens 得给够,我一开始给 300 结果正文全是空的,后来统一拉到 2500 才正常。
整个过程跑下来 514 秒,105 次调用,花了一块多钱。按量计费这点倒是挺省心,不用开套餐。
结果先放这
模型 | 总分 | 数学 | 代码 | 逻辑 | 中文 | 指令 | Agent | 花费 (¥) | 延迟 (s) |
DeepSeek V4 Flash | 14/15 | 3/4 | 3/3 | 2/2 | 3/3 | 2/2 | 1/1 | 0.0148 | 5.64 |
DeepSeek V4 Pro | 14/15 | 3/4 | 3/3 | 2/2 | 3/3 | 2/2 | 1/1 | 0.0357 | 7.30 |
Kimi K3 | 14/15 | 3/4 | 3/3 | 2/2 | 3/3 | 2/2 | 1/1 | 0.8191 | 15.32 |
Kimi K2.6 | 13/15 | 2/4 | 3/3 | 2/2 | 3/3 | 2/2 | 1/1 | 0.0751 | 4.25 |
GLM 5.2 | 13/15 | 2/4 | 3/3 | 2/2 | 3/3 | 2/2 | 1/1 | 0.3235 | 13.50 |
GLM 5.1 | 13/15 | 2/4 | 3/3 | 2/2 | 3/3 | 2/2 | 1/1 | 0.3830 | 17.53 |
GLM-5 | 13/15 | 2/4 | 3/3 | 2/2 | 3/3 | 2/2 | 1/1 | 0.3861 | 29.99 |
说实话看到这个结果我是有点意外的。7 个模型最高 14 分最低 13 分,就差 1 分。代码题全员满分,逻辑题全员通过,中文题也都没掉链子。这跟一年前测模型动不动就翻车的情况完全不一样了,国产模型确实进步快。
拉开差距的就一个维度——数学。
数学题:唯一的分水岭
数学 4 道题里,基础算术、应用题、方程求解这几个大家都能做对,真正拉开差距的是那道多步工程题:
一个水池有 A、B、C 三个管。A 管单独 5 小时注满,B 管单独 3 小时注满,C 管单独 4 小时排空。若三管同时打开,几小时能注满?
这道题考验的是多步分数运算,每一步都不能错。先说结论:7 个模型列的式子全对,都知道用 1/5 + 1/3 - 1/4 算净效率,思路都没问题。真正拉开差距的是最后那步通分计算。
DeepSeek V4 Flash 的回答很干脆,式子列完直接给结果:
设水池的容量为 1 个单位。A 管每小时注水 1/5,B 管每小时注水 1/3,C 管每小时排水 1/4。 三管同时打开,净注水速率:1/5 + 1/3 - 1/4 通分(分母取最小公倍数 60):12/60 + 20/60 - 15/60 = 17/60 注满所需时间:t = 1 ÷ 17/60 = 60/17 小时,即约 3.53 小时。
GLM 三代和 Kimi K3 也都算对了,过程写得很规范。GLM 5.2 的回答步骤最完整,从设总量为 1、算各管效率、通分、求时间,一步步推导到最终答案 60/17 小时(约 3.53 小时),还贴心地换算成了带分数 3 又 9/17 小时。GLM-5 还把 0.529 小时换算成了 31.8 分钟,给出了”约 3 小时 32 分钟”这种更直观的表述。
唯一算错的是 Kimi K2.6。它的过程其实写得挺漂亮,格式很规整,思路完全对,但通分那步 12+20-15 给算成了 27(应该是 17),最后得出了 20/9 小时(约 2.22 小时)。挺可惜的,式子都对,栽在一步加法上。这也说明非推理模型在多步数值计算上还是不如推理模型稳。
代码题:全员满分,风格有差异
三道代码题(素数判断、斐波那契、归并排序)全部通过测试用例,没什么好挑的。不过不同模型的代码风格确实有差别,可以聊聊。
DeepSeek 系列和 Kimi 系列写代码偏精炼,能一行搞定的不写两行。归并排序这题,DeepSeek V4 Flash 的实现:
def merge_sorted(a, b): i, j = 0, 0 result = [] while i < len(a) and j < len(b): if a[i] < b[j]: result.append(a[i]) i += 1 else: result.append(b[j]) j += 1 result.extend(a[i:]) result.extend(b[j:]) return result干净利落,没什么多余的东西。
GLM-5 就不一样了,代码自带详细注释和 docstring:
def merge_sorted(a, b): """ 将两个升序列表合并为一个升序列表 """ merged = [] i = 0 j = 0 # 遍历两个列表,比较元素大小 while i < len(a) and j < len(b): if a[i] <= b[j]: merged.append(a[i]) i += 1 else: merged.append(b[j]) j += 1 ...如果你是拿来做教学或者给新人看,GLM 这种风格更友好。如果是自己用,DeepSeek 那种精炼的更舒服。
素数判断那题也有意思,DeepSeek V4 Pro 和 Kimi K2.6 用了 6k±1 优化(步长为 6,每次检查两个候选因子,比普通写法快一倍),说明这俩模型不只追求正确,还会主动优化。DeepSeek V4 Flash 和 Kimi K3 用的是跳偶数写法(步长为 2),GLM 5.1/5.2 也是跳偶数写法,GLM-5 用的是最朴素的遍历。虽然都对,但能看出不同模型在”帮你想性能”这件事上确实有差异。
逻辑推理:全员通过,思路各异
两道逻辑题全对。农夫过河(狼羊菜问题)和说谎者推理,7 个模型都给出了正确答案和完整步骤。
有意思的是解题风格。DeepSeek V4 Pro 给的是带表格的步骤说明,每一步左岸右岸剩什么都列得清清楚楚,还附了等价方案:
步骤 | 左岸 → 右岸 | 右岸 ← 左岸 | 左岸剩余 | 右岸剩余 |
1 | 农夫 + 羊 | 狼、白菜 | 羊 | |
2 | 农夫 | 农夫、狼、白菜 | 羊 | |
3 | 农夫 + 白菜 | 狼 | 羊、白菜 | |
4 | 农夫 + 羊 | 农夫、狼、羊 | 白菜 | |
5 | 农夫 + 狼 | 羊 | 狼、白菜 | |
6 | 农夫 | 农夫、羊 | 狼、白菜 | |
7 | 农夫 + 羊 | 全部 |
GLM-5 的回答更口语化,重点解释了”羊是核心冲突点”这个关键思路,最后还总结了”中间需要把羊带回来一次”,适合给不懂的人看。Kimi K2.6 用的是假设法分析说谎者问题,先假设 A 说真话推出矛盾,再否定,条理很清楚。
中文理解:全员优秀,有点超出预期
中文题三道:一词多义、摘要提炼、红楼梦知识。7 个模型全对,这块确实没什么好说的,国产模型在中文上就是有天然优势。不过有几个回答挺值得贴一下的。
“意思意思”那道题
这题是老经典了:
领导说”你这是什么意思?“小明说”没什么意思,意思意思。“领导说”你这就不够意思了。“小明说”小意思,小意思。”
本以为会有模型翻车,结果全对,而且答得都挺到位。Kimi K3 的回答:
这段话的背景是小明给领导送礼 (或送红包),其中”意思”一词多义,妙趣横生:
- “你这是什么意思?” —— 意思 = 含义、意图
- “没什么意思” —— 意思 = 特殊用意、深层含义
- “意思意思” —— 意思 = 表示心意(动词用法)
- “你这就不够意思了” —— 意思 = 情义、情面
不光区分了每个”意思”的含义,还把送礼这个隐含语境点出来了。
GLM 5.2 答得也挺有味道,专门提到这是”中国语言文化博大精深和只可意会的微妙之处”。DeepSeek V4 Pro 则更进一步,把每个”意思”按出现顺序编号解释,结构最清晰。
红楼梦那道题
问的是海棠诗社社长是谁。正确答案是李纨。本来以为这种冷门知识容易出错,结果 7 个模型全对。Kimi K3 的回答简洁明了:
海棠诗社的社长是李纨,自号稻香老农。诗社由贾探春发起成立,李纨”自荐掌坛”,负责出题、限韵、评诗等;迎春、惜春为副社长。
GLM 5.1 的回答更详细,把来龙去脉都讲清楚了:
海棠诗社最初是由探春发起的(见于第三十七回),她给宝玉和众姐妹写了花笺,倡议结社作诗。虽然诗社是探春发起的,但在商议谁来当社长时,探春主动提出”必得请出大嫂子来主持”,大家也一致赞同。因为李纨作为寡嫂,年纪最长,性格厚道公允,虽然她自己作诗不算最拔尖,但大家认为她”善评”,能够公正地评判众人的诗作,所以推举她为社长。
连”发起人和社长不是同一人”这种细节都讲明白了,还点出了选李纨的原因是”善评”,说明模型真理解了原文,不是背了个答案。
指令遵循和工具调用:都没掉链子
指令遵循那题让模型只输出一个 JSON 对象,不许带任何其他文字。这种题最容易看出模型听不听话。结果 7 个模型都老老实实输出了纯 JSON,没一个废话的。Kimi K2.6 最快,0.95 秒就交了:
{"name":"张三","age":25}工具调用那题,给了个 get_weather(city, date) 工具,问”北京明天天气怎么样”,让模型输出调用 JSON。7 个模型都对了,不过 Kimi K3 有个细节挺加分的——它把”明天”自动换算成了具体日期 2025-01-16。别的模型都直接传”明天”字符串,Kimi K3 多走了一步,说明它在认真理解时间语义。这种细节在真实业务里挺重要,比如你做日程助手,模型能自己换算日期就省心了。
关于花钱这事
这可能是这次测评最值得说的部分。
同样是 15 道题,DeepSeek V4 Flash 花了 1 分 5 厘,Kimi K3 花了 8 毛 2。差了 55 倍。但俩模型总分一样,都是 14 分。
算笔账更直观。以”跑 100 万次类似复杂度的对话”来估算:
模型 | 单次花费 | 100 万次花费 | 说明 |
DeepSeek V4 Flash | ¥0.001 | ¥1000 | 一顿饭钱 |
DeepSeek V4 Pro | ¥0.0024 | ¥2400 | 还能接受 |
Kimi K2.6 | ¥0.005 | ¥5000 | 中等开销 |
GLM 5.2 | ¥0.022 | ¥22000 | 得掂量下 |
GLM-5 | ¥0.026 | ¥26000 | 同上 |
Kimi K3 | ¥0.055 | ¥55000 | 得有预算 |
能力差不多的情况下,选错模型一年多花几十万,这事谁都不想遇到。
GLM 三代得分一样(都是 13 分),区别主要是价格和速度。GLM-5 价格最低(输入 6 块、输出 22 块),但最慢,跑一道题平均 30 秒;GLM 5.1 和 5.2 价格一样(输入 8 块、输出 28 块),速度快不少,GLM 5.2 降到 13.5 秒。迭代还是有效果的,至少不那么慢了。如果你已经在用 GLM,升级到 5.2 体验会好不少;如果还没用,直接上 5.2 就行。
Kimi K3 作为 2.8 万亿参数的旗舰,能力确实顶,但单价也顶(输入 20、输出 100)。除非你的任务真的需要那种深度的推理能力,不然日常用确实有点奢侈。Kimi K2.6 虽然便宜不少(输入 6.5、输出 27),但数学题比 K3 少对一道,总分差 1 分。如果不需要深度推理,K2.6 性价比比 K3 高。
反过来看 DeepSeek V4 Flash,输入 1 块、输出 2 块的价格,能力跟贵 20 倍的模型打平。这个性价比确实没话说。
速度:三个梯队
延迟这块差距也不小,大致分三档:
第一档(5 秒内出结果):Kimi K2.6(4.25 秒)、DeepSeek V4 Flash(5.64 秒)。这俩适合做实时交互,用户基本不用等。
第二档(7-15 秒):DeepSeek V4 Pro(7.3 秒)、GLM 5.2(13.5 秒)、Kimi K3(15.3 秒)。可以接受,但实时对话会有点卡顿感。
第三档(17 秒以上):GLM 5.1(17.5 秒)、GLM-5(30 秒)。GLM-5 这个速度做实时交互基本没法用,一道题等半分钟,用户早跑了。不过它是推理模型,思考时间长也正常,适合离线批处理。
这里有个规律:推理模型(DeepSeek、Kimi K3、GLM 系列)普遍比非推理模型(Kimi K2.6)慢,因为它们会先在 reasoning 里想一遍再输出答案。代价是 token 消耗也大——GLM-5 跑 15 题输出了 17353 个 token,是 Kimi K2.6(2601 个)的 6.7 倍。这些 token 都是钱。
不同场景怎么选
测完之后我自己总结了一下,其实没有”最好”的模型,只有”最合适”的:
日常开发用:DeepSeek V4 Flash。便宜快好,性价比断档第一。我后来手头项目的代码补全、文档生成都换它了,一个月下来没花几个钱。如果你只想要一个”够用且便宜”的模型,选它不会错。
数学推理 / 算法题:DeepSeek V4 Pro 或者 Kimi K3。这俩在多步推理上最稳,水池那题就是它们几个算对的。Pro 性价比高一些,K3 推理更深但贵。如果你的任务涉及数学证明、逻辑链推理、算法设计,这俩最靠谱。
要快、要实时:Kimi K2.6。4 秒多出结果,是非推理模型里最快的,做客服、做对话机器人这种场景合适。而且它不搞”先想后答”那一套,直接给结果,体感很流畅。
长文本:GLM 5.2 或者 Kimi K3。都支持百万 token 上下文。GLM 5.2 官方说能承载项目级工程上下文,这个我还没测,回头可以试试把整个代码库丢进去。Kimi K3 的 1M 上下文也是标配。如果你要处理长报告分析、代码库理解、超长对话历史,这俩是首选。
Agent 开发:GLM 5.1 / 5.2 或者 Kimi K2.6。GLM 5.1 专门讲 Agentic Engineering,工具调用很稳;Kimi K2.6 本身就是多模态智能体,擅长长程任务。在共绩算力上一键切换,方便对比哪个更适合你的 Agent 业务。说实话这次工具调用题太简单了,没拉开差距,想真正分高下得设计更复杂的多步工具调用场景。
预算紧的批处理:还是 DeepSeek V4 Flash。1 块钱能跑一堆任务,离线跑数据标注、批量摘要、文档清洗这种用着不心疼。GLM-5 虽然慢,但如果你的任务对延迟不敏感、又需要推理能力,它的单价(22 块输出)比 Kimi K3(100 块输出)便宜不少,也算个折中选择。
平台体验与快速上手
既然是在共绩算力上测的,顺带说下平台体验和怎么接入。我翻了他们的快速上手文档,接入确实简单,总结下关键信息。
两个地址记住就行:
用途 | 地址 |
控制台(管密钥、看模型、查账单) |
|
API 调用地址 |
|
接入只需改两个参数。因为完全兼容 OpenAI 接口,你之前用 OpenAI SDK 的代码,把 api_key 和 base_url 改掉就能跑,其他一行不用动。文档里给的 Python 示例:
from openai import OpenAI
client = OpenAI( api_key="你的 API Key", base_url="https://api.suanli.cn/v1",)
response = client.chat.completions.create( model="deepseek/deepseek-v4-flash", messages=[ {"role": "system", "content": "你是一个有用的 AI 助手。"}, {"role": "user", "content": "请用一句话解释什么是大语言模型。"} ], max_tokens=1000, temperature=0.7)
print(response.choices[0].message.content)不用 Python 的也可以用 cURL:
curl -X POST "https://api.suanli.cn/v1/chat/completions" \ -H "Content-Type: application/json" \ -H "Authorization: Bearer 你的API Key" \ -d '{ "model": "deepseek/deepseek-v4-flash", "messages": [{"role": "user", "content": "你好"}], "max_tokens": 100, "temperature": 0.7 }'模型切换是真的方便。想换模型,只改 model 字段就行,比如从 deepseek/deepseek-v4-flash 换成 moonshotai/kimi-k3,其余代码不动。一个 Key 就能调全部 7 个模型,省得我注册一堆账号。写个 for 循环遍历模型列表,一次跑完所有对比,开发体验很好。如果你想看自己账号能用哪些模型,调一下 models.list() 接口就全出来了:
models = client.models.list()for m in models.data: print(f" - {m.id}")按量计费没有套餐费,这次 105 次调用总共花了一块多,对个人开发者或者小团队比较友好。相比传统包月套餐,按量模式能省下约 18.6% 的成本(具体大家可以拿自家账单对比下),至少不会让你为用不上的资源买单。平台宣称 99.99% 可用率,这次跑的过程中没遇到调用失败的情况。
写在最后
这次测完最大的感受,不是哪个模型最强,而是整个国产大模型生态已经成熟到可以让开发者”不纠结”了。
一年前做模型选型,你要在能力、价格、速度之间反复权衡,踩坑是常态——指令题一半模型不听话,代码题动不动就跑不通,长文本说是支持百万 token 实际几万就开始丢内容。现在呢?15 道题里除了数学有一道拉开 1 分差距,其余维度全员通过。代码全员满分、中文理解全员优秀、Agent 调用全员到位。这意味着什么?意味着你终于可以把精力从”选哪个模型”转回到”怎么用好模型”上了。
而共绩算力这类平台做的事,恰恰是在降低”用好模型”的门槛。一个 API Key、一套 OpenAI 兼容接口、一行代码切换模型,让你能在同一套代码里随时对比 DeepSeek、Kimi、GLM 的表现,按实际效果选型,而不是被某一家绑定。按量计费、无套餐费的模式,也让试错成本降到了几乎可以忽略——我这次 105 次调用花了一块多,这个成本任何人都能承受。
说到底,大模型不该是奢侈品。当 DeepSeek V4 Flash 能用 1 块钱 1 百万 token 的价格,提供和贵 20 倍的旗舰模型一样的能力时,普惠就不是一句口号了。国产模型这一年的进步,配得上”惊喜”这个词。
如果你也在选模型,别光看跑分,自己跑一遍最实在。控制台地址 console.suanli.cn/models,注册就能用,第一次调用花不了几毛钱。