最新 Kimi K3 已上线大模型云服务,按量计费,稳定易用, 立即体验
共绩算力

GPU 利用率,才是真正的成本

2026年7月30日
"GPU 利用率才是真成本,单价只是表象"
Shiyuh
Shiyuh
技术传道者/AI 应用落地

我们跟客户算账,经常被单价带偏。A 家卡比 B 家便宜两成,客户就觉得 A 家划算。我们一般会多问一句,你那张卡实际用满了多少。

利用率三成,等于单价翻三倍多

答案常常不太好听。很多团队卡的利用率在三成到四成之间。也就是说,你花一百块租的卡,只有三四十块真正在干活,剩下的大半在空转,钱照扣。利用率三成,等于你实际为有效算力付的价钱是标价的三倍多。我们见过一个团队,单价压得行业最低,结果他的卡平均利用率只有两成五,算下来为单位有效算力付的钱,比隔壁用贵两成卡但利用率七成的团队还高。

为什么利用率上不去

原因很实在。任务来了才开机器,开机的空窗期白搭;任务跑完机器没立刻释放,人去喝杯咖啡的功夫卡还在计费;给稳态配的资源去扛突发,要么不够要么过剩;不同任务抢同一类卡,单看某张卡很忙,看全局一大片在睡觉。

着力点:让卡在闲置时立刻让出来

单价是表象,利用率才是成本的地基。我们给一个客户做调优,没换一张卡,只把调度策略改了,三个月后他的平均利用率从三成六涨到六成八,同等支出下多干了近一倍的活。他后来跟我们说,早知道该早点看利用率,不该只看单价。

两种平台思路,区别在客户手上有什么人

一种上来就给你大规模、给你 Kubernetes 原生能力,适合本来就有一支很强基础设施团队的客户,他们要掌控感。另一种把开发者体验做得很轻,开箱即用,适合想把精力放业务上的小团队。两种都对,区别在客户自己手上有什么人。我们要的是第二种的省心,但也得把第一种的掌控感留给需要的客户,比如给个可选的高级视图。

利用率不是越高越好

有个细节值得提。利用率逼到九成以上,突发一来就毫无缓冲,反而容易掉链子。好的调度留一点余量,平时八成上下的利用率,既省又稳。这个度平台替客户把着。我们给一个做实时推荐的用户留的余量,比给一个跑离线训练的留得紧,因为前者怕抖,后者不怕慢,同样是八成,背后的算法不一样。

两个客户的真实对比

我们拿两个做相似训练的团队比过。甲团队租的卡单价低两成,但没人管利用率,平均三成二,月底为有效算力实付单价相当于标价的 3.1 倍。乙团队卡贵一成五,但调度帮他把利用率做到六成五,实付单价只有标价的 1.5 倍。乙比甲每张有效算力便宜一半还多,单价却更贵。客户听到这个对比一般会愣一下,因为他之前只看了报价单的第一行。

把利用率当产品指标,不当口号

这事我们不是嘴上说说。每个客户接入第一周,我们先拉他的利用率基线,而不是给他报单价。基线低于四成的,调度策略第一版就往攒批、切分、跨区挪这三个方向调,一般两周内能看到变化。我们给客户出的月度报告,第一页永远是利用率曲线,不是消费总额。哪张卡连续空转,报告里直接点名,连同建议一起给。客户省不省钱,我们和他看同一张图。

有个细节。利用率低往往不是客户懒,是他看不到。很多团队的控制台只显示机器在不在跑,不显示它跑得满不满。我们特意把实时利用率做成每张卡都看得见的高亮,低于阈值就变红。一个客户就是看到那片红,才发现他有个调试环境开了三周没关。看得见,才谈得上省。

我们见过最可惜的客户,是冲着最低单价来的,半年后因为利用率一直三成出头又走了,走的时候说他的卡又空转回去了,没人替他管。这事让我们更确信,单价是入口,利用率才是留人的理由。把账算到有效算力这一层,单价就成了最不重要的那个数字。

靠单价低吸引来的客户,也会被更低的单价带走。靠帮他真把卡用满留下的客户,关系要稳得多。我们宁可在单价上不抢第一,也要把利用率这件事做扎实。客户月底看总账的时候,心里有数。

准备好开始您的 AI 之旅了吗?

读完这篇文章,想必您对 AI 技术有了更深的了解。现在就来体验共绩算力,让您的想法快速变成现实。

✓ 已有 10 万 + 开发者在使用

✓ 99.9% 服务可用性

✓ 开箱即用的容器托管