最新 Kimi K3 已上线大模型云服务,按量计费,稳定易用, 立即体验
共绩算力

2.8 万亿参数的 Kimi K3,到底能不能干活?

2026年7月17日
"2.8 万亿参数的 Kimi K3,到底能不能干活?"
Shiyuh
Shiyuh
技术传道者/AI 应用落地

01 引言:一张牌拍在桌上

2026 年 7 月 16 日,世界人工智能大会开幕前一天,月之暗面把一张牌拍在了桌上——Kimi K3。2.8 万亿参数,全球首个开源 3T 级模型,权重承诺 7 月 27 日前完全开放。消息一出,Hacker News 的讨论帖冲上 1023 分、630 条评论,海外社区的态度从”又一个中国模型”迅速转向认真审视。

参数和跑分只是故事的一半。官方博客坦言,Kimi K3 的综合水平仍落后于 Claude Fable 5 和 GPT-5.6。这种”整体追赶、专项反超”的姿态,恰恰是我们想验证的——在那些需要空间想象、代码工程、多步骤协作的复杂任务上,Kimi K3 究竟能走多远。

所以这篇测评不复述参数表。我们直接上手让它把长征十号火箭的发射与回收过程做成 3D 模拟。考验前端代码与 3D 渲染的功底,又考验物理建模与空间推理的极限。Kimi K3 自称在 3D 生成和智能体协作上表现强劲——空口无凭,上手见真章。

02 Kimi K3 速览:2.8T、开源、能看能写

先给没跟发布会的人补个课。Kimi K3 是月之暗面的旗舰基座模型,也是全球第一个摸到 3 万亿参数门槛的开源模型。官方博客提到一个细节:过去十二个月里,Kimi 模型有九个月保持着开源模型参数规模的上限——Kimi K3 不是一次孤注一掷的跳投,而是一条持续推进的 Scaling 曲线上的最新一步。

定位上,月之暗面很诚实。官方博客明确写道:Kimi K3 的综合表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在评测套件中展现出前沿水准,“持续优于其他受测模型”。换句话说,它不号称已登顶,而是把自己摆在”开源第一梯队、闭源顶尖之下”的位置——这个姿态反而比”吊打一切”的宣传更可信。

03 架构拆解:KDA 与注意力残差

Kimi K3 的架构不是”把 Transformer 堆到 2.8T”那么简单。官方博客亮出两根自研支柱,以及一套围绕稀疏训练的工程方案。

Kimi Delta Attention (KDA) 解决的是注意力随序列变长而衰减的老问题。传统标准注意力下,文本越长计算量成倍下降,读 100 万字可能要等十几分钟。KDA 重新设计了信息留存逻辑,只保留关键信息、过滤无效重复,让长上下文窗口不再是一句营销话术。月之暗面还把对应的 prefix cache 实现贡献给了 vLLM 社区,意味着第三方推理框架开箱即用。

注意力残差(Attention Residuals, AttnRes) 解决的是另一维度的信息流失——模型深度方向上的表征传递。传统做法是逐层均匀累积,AttnRes 改为跨深度选择性检索表征。官方的说法是,KDA 和 AttnRes “共同构成了一个设计用于在万亿参数规模之上继续扩展的架构骨架”。

Stable LatentMoE 把稀疏化做到了极致:896 个专家,每次推理只激活 16 个。这个比例意味着模型拥有海量知识容量,但单次推理的算力开销只相当于一个小得多的模型。配合几项关键创新——Quantile Balancing(从路由分数分位数直接推导专家分配,砍掉了敏感的超参数)、Per-Head Muon(逐注意力头独立优化)、SiTU 激活函数和 Gated MLA——Kimi K3 在 2.8T 规模上实现了稳定训练。

这套架构的回报是量化的:官方称相比 K2,整体 Scaling 效率提升约 2.5 倍——同样的算力能换回更多的智能。量化方面,Kimi K3 从 SFT 阶段起就采用 MXFP4 权重 + MXFP8 激活的量化感知训练,兼顾精度与硬件兼容性。

不过,部署门槛是真实存在的。官方推荐在 64 张以上加速器的超节点配置上运行 Kimi K3,本地推理对多数开发者而言仍是奢望——这一点我们在后面综合评价里还会提到。

04 官方成绩单:从竞技场到造芯

跑分部分我们不铺陈数字,只说反差。Frontend Code Arena 上,Kimi K3 以 1679 分拿下全球第一,超过 Claude Fable 5(1631)和 GPT-5.6 Sol(1618),7 个细分领域拿下 6 个榜首,比上代 K2.6 跃升 17 位。但官方博客同时承认整体仍落后于这两位对手——专项反超、整体追赶,这是 Kimi K3 当前的真实位置。

真正让人意外的,是官方放出的几个端到端案例。这些不是刷榜题,而是”让模型独立干一件完整的事”:

造了一个 GPU 编译器。 Kimi K3 从零构建了 MiniTriton——一个类 Triton 的 GPU 编译器,自带 tile 级 IR 层(基于 MLIR)、优化 pass 和 PTX 代码生成管线。在支持的 roofline 基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 持平甚至更优,还能支撑端到端的 nanoGPT 训练并稳定收敛。这不是写几个 kernel,而是从 DSL 前端到代码生成到运行时的完整编译器。

02-gba-emulator.mp4

造了一块芯片。 在一次 48 小时的自主运行中,Kimi K3 用开源 EDA 工具在 Nangate 45nm 工艺库上设计、优化并验证了一块芯片——用来跑一个基于 Kimi K3 自身架构的 nano 模型。芯片面积 4 平方毫米,时序闭合在 100MHz,仿真解码吞吐超过 8,700 tokens/s,塞进了146万个标准单元。“一块由模型设计、为模型服务的芯片”,官方这句概括很有画面感。

09-gargantua.mp4

两天的工作压缩到两小时。 在计算天体物理方向,Kimi K3 复现了 I-Love-Q 普适关系——交叉验证了 20 余篇论文,实现完整数值管线,评估了 300+ 种状态方程,发现已发表公式中的不一致,生成 3,000+ 行 Python 代码,并产出可交互的 HTML 仪表盘。官方说这通常需要一个有经验的研究者一到两周。

01-open-world.mp4

还有一个案例和我们的实测直接相关:3D 开放世界游戏。Kimi K3 用 Three.js WebGPU 和 GPU 计算构建了一个程序化生成的浏览器 3D 探索游戏——森林、木屋村落、雪山、动态天气一应俱全,骑手和马匹模型由 3D 资产生成工具产出。官方特别强调了一个概念叫 “vision in the loop”(视觉闭环):Kimi K3 能在代码和实时截图之间无缝迭代,“边写边看边改”。

这恰好是我们设计的 Case 要考验的能力。竞技场是标准题,官方案例是精心挑选的展示题——接下来,我们出道自己的题。

05 实测:3D 模拟长征十号火箭发射与回收

空间推理 × 物理建模

提问 / Prompt

指令只有一行:

3d 模拟长征十号火箭发射与回收

没有更多了。没有指定用什么引擎、怎么分阶段、回收方式是陆地还是海上、火箭构型是基本型还是甲构型。这些隐含决策全部留给模型自己判断。

这条指令的杀机在于三层叠加:第一层是前端工程——Three.js 场景搭建、几何体建模、粒子系统、相机导演、UI 交互,一个都不能少;第二层是空间推理——火箭的姿态角随时间怎么变、级间分离后两截各自飞向哪里、回收船该放在什么方位、相机该从哪个角度跟拍;第三层是物理直觉——点火时烟雾从导流槽往两侧喷而不是往上冒、上升段要有程序转弯而不是直上直下、着陆时发动机推力要从大变小而不是恒定到底。三层叠加,任何一层掉链子,画面都会”不对劲”。

用户追加了一句”细节能否再多完善下 还有建模”——等于在原有基础上加考一轮:不是”能跑就行”,而是”经得起细看”。

过程

模型接到指令后做的第一件事不是写代码,而是列了一张七步 todo 清单:下载 Three.js 到本地 → 搭页面 UI → 建 3D 场景环境 → 建火箭模型 → 写粒子特效 → 写飞行动画时间线 → 联调测试。这个拆解本身暴露了模型对”3D 可视化项目”的工程理解——它知道依赖管理要先于业务代码,知道特效和动画要解耦,知道最后必须留一步给浏览器实测。

代码被拆成五个 JS 模块,各管一摊:

模块

职责

行数

environment.js

发射场、海洋、回收船、天空、光照

423

rocket.js

一级 + 二级 + 梦舟飞船建模、栅格舵/着陆腿展开

469

effects.js

火焰、烟雾粒子系统(自定义 ShaderMaterial)

321

simulation.js

关键帧轨迹、姿态插值、事件触发、遥测

344

main.js

相机导演、UI 交互、渲染循环

310

关键帧插值是整个动画的骨架。模型没有硬编码每一帧的位置,而是定义了一组关键时间点的位置和姿态,用 smoothstep 函数在关键点之间平滑过渡。一级火箭的轨迹用了 17 个关键帧,从 T+0 的发射台到 T+88 的回收船甲板;姿态角用了 16 个关键帧,从 0° 到 33°(分离时倾角)再到 168°(返场掉头)最后回正到 0°(着陆)。这种做法的好处是改弹道只需要调几个数字,不用重写动画逻辑。

模型还自主完成了三轮迭代。第一轮搭出基本盘——五个模块全部能跑,但从截图里发现回收船被陆地圆盘盖住了,看起来像停在草地上。第二轮修复了陆地范围和光照参数。第三轮响应用户”细节完善”的要求,给火箭加了镂空栅格舵、着陆腿支撑杆、发动机万向节、RCS 姿控喷口、太阳能帆板、飞船舷窗、箭体管路纹理——七项建模升级。

整个过程中,模型没有写”实施计划”或”30 天行动表”,而是用”先做→截图→看→改”的循环推进。这种 vision-in-the-loop 的工作方式,恰好对应官方强调的”视觉闭环”能力。

结果

模拟全程约 90 秒,覆盖从点火到海上着陆的完整任务剖面。以下是各阶段截图与分析。

T+3s · 点火

发动机启动,发射台导流槽两侧喷出灰白色烟雾。烟雾粒子由自定义 ShaderMaterial 渲染,每个粒子有独立的生命周期、尺寸增长曲线和颜色衰减——从截图可以看到两团翻涌的烟雾云分布在发射台基座两侧,符合真实发射中导流槽将废气向两侧排开的物理逻辑。火箭仍矗立在发射台上,橙色勤务塔的臂架结构清晰可辨,左右两侧的避雷塔、白色球形储罐、黄色龙门架等发射场设施一览无余。

T+5s · 起飞

推力超过重力,火箭离开发射塔。此时相机切到自动跟踪视角,能看到火箭缓缓抬升、底部烟雾持续翻涌的完整过程。箭体上的”中国载人航天”竖排文字和国旗标识清晰可辨——这些不是贴图文件,而是用 Canvas2D 现场画出来的纹理。火箭与发射台之间已经出现明显的间隙,上升态势确认无误。

T+14s · 最大动压(Max-Q)

穿越大气稠密区。火箭已开始程序转弯——姿态不再是纯垂直,而是沿发射方位角倾斜了约 6°。底部尾焰明亮,在身后拖出一条白色烟柱。天空颜色开始从地面蓝向高空深蓝过渡,这是 updateSky 函数根据相机高度做的渐变计算。地平线清晰可见,海面与天空的分界线提供了高度参照。

T+28s · 上升段

高度约 40 公里(显示遥测),速度约 3.5 km/s。一级发动机全推力工作,尾迹在身后拖出一条明亮的橙黄色火焰柱。火箭倾角已增大到 14°,沿预定的回收方位角飞向外海方向。这个角度不是随便选的——它决定了分离后一级能靠惯性飞回回收船上方。截图右下角的控制面板显示时间轴已走过”Max-Q”节点,正在接近”级间分离”。

T+42s · 级间分离

一级关机,两截火箭在太空中清晰分离。截图同时捕捉到两个关键主体:右上方是二级火箭携梦舟飞船继续爬升——底部发动机喷出明亮的橙黄色火焰,两侧太阳能帆板已展开;右下方是一级助推器,发动机已关机,处于无动力滑行状态,即将开始调姿翻转。背景是深蓝色的太空和地球大气层的弧线,稀疏的星点点缀其间。这是整个模拟中信息密度最高的一刻——两截火箭各奔东西,一个上天一个回头。

T+52s · 返场点火

一级发动机重新启动,推力约 45%。此时火箭已经完成 115° 翻转——发动机朝前,正在”倒着飞”减速并返回。从截图可以清晰看到箭体上的”CZ-10”编号和蓝色标识条纹,四片栅格舵已从贴附状态旋转到展开位置(金色/棕色镂空舵面),发动机喷口喷出典型的锥形橙黄色羽流。背景的深蓝色天空和稀疏星点表明火箭仍在高空。

T+61s · 再入点火

穿越大气层前的减速点火。火箭完整可见,发动机火焰清晰喷出——白色高温核心区外裹着橙色扩散羽流,在深蓝色高空背景下对比鲜明。姿态已从 168° 回正到 128°,火箭逐渐从”倒飞”转为”正向”再入。背景中可见两团柔软的白色云层,暗示火箭正在从太空向大气层过渡。此时高度约 1.7 公里(显示值),水平距离回收船约 18 公里。

T+78s · 着陆点火

临近回收船上空,发动机再次启动,推力从 70% 逐级降低到 35%。从截图可以看到火箭完整构型:顶部黑色整流罩带蓝色环带,四片栅格翼呈 X 型展开,箭体上”CZ-10”和”MARCH 10”标识清晰可辨,底部四条着陆腿已展开,发动机喷出白色至橙黄色的减速火焰。下方是深蓝色海面和海天交界线,火箭正从天而降。

T+85s · 着陆腿展开

4 条着陆腿从收拢状态完全展开,围绕箭体呈 X 形对称分布。每条腿含主撑杆、副支撑、球形关节和圆形足垫。发动机仍在工作,底部喷射火焰表明火箭处于主动减速悬停状态。甲板上开始出现径向扩散的白色气雾——这是着陆喷流冲击甲板表面产生的效果。展开时机在着陆前 3 秒——和真实任务中”最后一刻展开”的逻辑一致。

T+92s · 着陆

一级稳稳站立在海上回收平台甲板上。甲板上的红色着陆圈、白色”海上回收”文字清晰可见。火箭底部的 4 条着陆腿支撑在甲板上,发动机已关机。远处是发射场的避雷塔和勤务塔轮廓,深蓝色海面环绕着回收平台。俯视角度同时呈现了火箭直立状态、甲板靶心位置关系和海上环境——核心要素一览无余。

遥测面板显示最终状态:T+ 01:32,高度 0.00 km,速度 0.00 km/s,水平距离 22.54 km——任务完成。

评价

空间准确度:8/10。 火箭的飞行轨迹在空间逻辑上是自洽的——发射方位角、回收船位置、一级返场路径三者构成一条连贯的弹道。程序转弯的角度变化曲线(0° → 33° → 168° → 0°)符合”重力转弯”的物理直觉:不是生硬的折线,而是 smoothstep 平滑过渡。级间分离的截图尤其能说明问题——两截火箭在同一画面中各奔不同方向,上级带火焰上升、下级无动力下滑,空间关系一目了然。扣分点在于高度和速度的换算系数是示意值而非物理积分结果——但这在”概念演示”的定位下可以接受。

物理真实感:7/10。 点火烟雾从导流槽两侧喷出(不是往上冒)、着陆时推力从大到小递减(不是恒定)、栅格舵在分离后才展开(不是一开始就打开)、着陆腿在最后 3 秒才展开(不是提前打开)——这些细节说明模型对火箭发射流程有正确的物理直觉。返场点火时火箭已完成 115° 翻转、发动机朝前倒飞减速,这个姿态逻辑完全正确。扣分点在于再入阶段缺少明显的烧蚀辉光效果(虽然代码里有 reentryGlow 对象但未被主循环调用),以及 Max-Q 蒸汽锥特效未在画面中呈现。

工程完成度:9/10。 2176 行代码、5 个模块、3 轮迭代、10 个飞行阶段全覆盖、5 种相机视角、4 档播放速度、时间轴可跳转、遥测实时更新、全部资源离线化——作为一个”一行指令”的产出,工程完成度相当高。模型还自主发现了回收船被陆地覆盖的视觉 bug 并修复,说明它确实在”看”自己生成的画面,而不是盲写代码。

一句话结论: Kimi K3 在这个 Case 上展现了”能干活的模型”而非”能聊天的模型”的特质——它不是在描述一个 3D 模拟长什么样,而是直接把它造出来了,而且经得起细看。

06 综合评价:长板与短板

长板

短板

适用建议

08 结语:答卷交给时间

看完这些 Case,Kimi Kimi K3 留给我们的印象很具体:这是一个能干活的模型。3D GBA 模拟器的生成,展示了它在前端工程与 3D 渲染上的扎实功底;长征十号火箭的发射回收模拟,把它在空间推理和物理建模上的能力推到了极限。官方案例里从 GPU 编译器到芯片设计再到天体物理复现,也都指向同一个判断——Kimi K3 不是参数堆出来的花架子,而是能端到端完成复杂工程任务的工具。放在一年前,即便是最强的闭源模型,做这些事也需要反复调教、多次返工。

Kimi K3 也有短板。2.8 万亿参数意味着部署门槛不低,本地推理对多数开发者仍是奢望;官方也坦承综合水平仍落后于闭源顶尖。但开源的意义恰在此处——社区会替它把这些问题一个个暴露,再一个个修补。月之暗面把权重交出来,等于把答案交给了所有人。

一个模型到底成色如何,跑分说了不算,开发者用它做出的东西才算。Kimi K3 交出了答卷,剩下的,交给时间。

跑分和官方案例终究只是参考,一个模型到底成色几何,只有在真实任务里过秤才算数。

Kimi K3 从火箭发射模拟到 GPU 编译器,展现出的不是“能聊天的模型”那种轻巧,而是实打实的工程交付能力。但 2.8 万亿参数带来的部署门槛,此前确实让多数开发者只能旁观。

现在这道门槛被抹平了。

共绩算力已经正式上线 Kimi K3 最新模型,无需自建超节点,开箱即可调用。如果你手里也有需要空间推理、代码生成或多步骤协作的硬任务,不妨直接上手试一试——让模型干一次活,比读十篇测评都管用。

https://console.suanli.cn/models

准备好开始您的 AI 之旅了吗?

读完这篇文章,想必您对 AI 技术有了更深的了解。现在就来体验共绩算力,让您的想法快速变成现实。

✓ 已有 10 万 + 开发者在使用

✓ 99.9% 服务可用性

✓ 开箱即用的容器托管