01 引言:一张牌拍在桌上
2026 年 7 月 16 日,世界人工智能大会开幕前一天,月之暗面把一张牌拍在了桌上——Kimi K3。2.8 万亿参数,全球首个开源 3T 级模型,权重承诺 7 月 27 日前完全开放。消息一出,Hacker News 的讨论帖冲上 1023 分、630 条评论,海外社区的态度从”又一个中国模型”迅速转向认真审视。
参数和跑分只是故事的一半。官方博客坦言,Kimi K3 的综合水平仍落后于 Claude Fable 5 和 GPT-5.6。这种”整体追赶、专项反超”的姿态,恰恰是我们想验证的——在那些需要空间想象、代码工程、多步骤协作的复杂任务上,Kimi K3 究竟能走多远。
所以这篇测评不复述参数表。我们直接上手让它把长征十号火箭的发射与回收过程做成 3D 模拟。考验前端代码与 3D 渲染的功底,又考验物理建模与空间推理的极限。Kimi K3 自称在 3D 生成和智能体协作上表现强劲——空口无凭,上手见真章。
02 Kimi K3 速览:2.8T、开源、能看能写
先给没跟发布会的人补个课。Kimi K3 是月之暗面的旗舰基座模型,也是全球第一个摸到 3 万亿参数门槛的开源模型。官方博客提到一个细节:过去十二个月里,Kimi 模型有九个月保持着开源模型参数规模的上限——Kimi K3 不是一次孤注一掷的跳投,而是一条持续推进的 Scaling 曲线上的最新一步。
定位上,月之暗面很诚实。官方博客明确写道:Kimi K3 的综合表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在评测套件中展现出前沿水准,“持续优于其他受测模型”。换句话说,它不号称已登顶,而是把自己摆在”开源第一梯队、闭源顶尖之下”的位置——这个姿态反而比”吊打一切”的宣传更可信。
03 架构拆解:KDA 与注意力残差
Kimi K3 的架构不是”把 Transformer 堆到 2.8T”那么简单。官方博客亮出两根自研支柱,以及一套围绕稀疏训练的工程方案。
Kimi Delta Attention (KDA) 解决的是注意力随序列变长而衰减的老问题。传统标准注意力下,文本越长计算量成倍下降,读 100 万字可能要等十几分钟。KDA 重新设计了信息留存逻辑,只保留关键信息、过滤无效重复,让长上下文窗口不再是一句营销话术。月之暗面还把对应的 prefix cache 实现贡献给了 vLLM 社区,意味着第三方推理框架开箱即用。
注意力残差(Attention Residuals, AttnRes) 解决的是另一维度的信息流失——模型深度方向上的表征传递。传统做法是逐层均匀累积,AttnRes 改为跨深度选择性检索表征。官方的说法是,KDA 和 AttnRes “共同构成了一个设计用于在万亿参数规模之上继续扩展的架构骨架”。
Stable LatentMoE 把稀疏化做到了极致:896 个专家,每次推理只激活 16 个。这个比例意味着模型拥有海量知识容量,但单次推理的算力开销只相当于一个小得多的模型。配合几项关键创新——Quantile Balancing(从路由分数分位数直接推导专家分配,砍掉了敏感的超参数)、Per-Head Muon(逐注意力头独立优化)、SiTU 激活函数和 Gated MLA——Kimi K3 在 2.8T 规模上实现了稳定训练。
这套架构的回报是量化的:官方称相比 K2,整体 Scaling 效率提升约 2.5 倍——同样的算力能换回更多的智能。量化方面,Kimi K3 从 SFT 阶段起就采用 MXFP4 权重 + MXFP8 激活的量化感知训练,兼顾精度与硬件兼容性。
不过,部署门槛是真实存在的。官方推荐在 64 张以上加速器的超节点配置上运行 Kimi K3,本地推理对多数开发者而言仍是奢望——这一点我们在后面综合评价里还会提到。
04 官方成绩单:从竞技场到造芯
跑分部分我们不铺陈数字,只说反差。Frontend Code Arena 上,Kimi K3 以 1679 分拿下全球第一,超过 Claude Fable 5(1631)和 GPT-5.6 Sol(1618),7 个细分领域拿下 6 个榜首,比上代 K2.6 跃升 17 位。但官方博客同时承认整体仍落后于这两位对手——专项反超、整体追赶,这是 Kimi K3 当前的真实位置。
真正让人意外的,是官方放出的几个端到端案例。这些不是刷榜题,而是”让模型独立干一件完整的事”:
造了一个 GPU 编译器。 Kimi K3 从零构建了 MiniTriton——一个类 Triton 的 GPU 编译器,自带 tile 级 IR 层(基于 MLIR)、优化 pass 和 PTX 代码生成管线。在支持的 roofline 基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 持平甚至更优,还能支撑端到端的 nanoGPT 训练并稳定收敛。这不是写几个 kernel,而是从 DSL 前端到代码生成到运行时的完整编译器。
造了一块芯片。 在一次 48 小时的自主运行中,Kimi K3 用开源 EDA 工具在 Nangate 45nm 工艺库上设计、优化并验证了一块芯片——用来跑一个基于 Kimi K3 自身架构的 nano 模型。芯片面积 4 平方毫米,时序闭合在 100MHz,仿真解码吞吐超过 8,700 tokens/s,塞进了146万个标准单元。“一块由模型设计、为模型服务的芯片”,官方这句概括很有画面感。
两天的工作压缩到两小时。 在计算天体物理方向,Kimi K3 复现了 I-Love-Q 普适关系——交叉验证了 20 余篇论文,实现完整数值管线,评估了 300+ 种状态方程,发现已发表公式中的不一致,生成 3,000+ 行 Python 代码,并产出可交互的 HTML 仪表盘。官方说这通常需要一个有经验的研究者一到两周。
还有一个案例和我们的实测直接相关:3D 开放世界游戏。Kimi K3 用 Three.js WebGPU 和 GPU 计算构建了一个程序化生成的浏览器 3D 探索游戏——森林、木屋村落、雪山、动态天气一应俱全,骑手和马匹模型由 3D 资产生成工具产出。官方特别强调了一个概念叫 “vision in the loop”(视觉闭环):Kimi K3 能在代码和实时截图之间无缝迭代,“边写边看边改”。
这恰好是我们设计的 Case 要考验的能力。竞技场是标准题,官方案例是精心挑选的展示题——接下来,我们出道自己的题。
05 实测:3D 模拟长征十号火箭发射与回收
空间推理 × 物理建模
提问 / Prompt
指令只有一行:
3d 模拟长征十号火箭发射与回收
没有更多了。没有指定用什么引擎、怎么分阶段、回收方式是陆地还是海上、火箭构型是基本型还是甲构型。这些隐含决策全部留给模型自己判断。
这条指令的杀机在于三层叠加:第一层是前端工程——Three.js 场景搭建、几何体建模、粒子系统、相机导演、UI 交互,一个都不能少;第二层是空间推理——火箭的姿态角随时间怎么变、级间分离后两截各自飞向哪里、回收船该放在什么方位、相机该从哪个角度跟拍;第三层是物理直觉——点火时烟雾从导流槽往两侧喷而不是往上冒、上升段要有程序转弯而不是直上直下、着陆时发动机推力要从大变小而不是恒定到底。三层叠加,任何一层掉链子,画面都会”不对劲”。
用户追加了一句”细节能否再多完善下 还有建模”——等于在原有基础上加考一轮:不是”能跑就行”,而是”经得起细看”。
过程
模型接到指令后做的第一件事不是写代码,而是列了一张七步 todo 清单:下载 Three.js 到本地 → 搭页面 UI → 建 3D 场景环境 → 建火箭模型 → 写粒子特效 → 写飞行动画时间线 → 联调测试。这个拆解本身暴露了模型对”3D 可视化项目”的工程理解——它知道依赖管理要先于业务代码,知道特效和动画要解耦,知道最后必须留一步给浏览器实测。
代码被拆成五个 JS 模块,各管一摊:
模块 | 职责 | 行数 |
environment.js | 发射场、海洋、回收船、天空、光照 | 423 |
rocket.js | 一级 + 二级 + 梦舟飞船建模、栅格舵/着陆腿展开 | 469 |
effects.js | 火焰、烟雾粒子系统(自定义 ShaderMaterial) | 321 |
simulation.js | 关键帧轨迹、姿态插值、事件触发、遥测 | 344 |
main.js | 相机导演、UI 交互、渲染循环 | 310 |
关键帧插值是整个动画的骨架。模型没有硬编码每一帧的位置,而是定义了一组关键时间点的位置和姿态,用 smoothstep 函数在关键点之间平滑过渡。一级火箭的轨迹用了 17 个关键帧,从 T+0 的发射台到 T+88 的回收船甲板;姿态角用了 16 个关键帧,从 0° 到 33°(分离时倾角)再到 168°(返场掉头)最后回正到 0°(着陆)。这种做法的好处是改弹道只需要调几个数字,不用重写动画逻辑。
模型还自主完成了三轮迭代。第一轮搭出基本盘——五个模块全部能跑,但从截图里发现回收船被陆地圆盘盖住了,看起来像停在草地上。第二轮修复了陆地范围和光照参数。第三轮响应用户”细节完善”的要求,给火箭加了镂空栅格舵、着陆腿支撑杆、发动机万向节、RCS 姿控喷口、太阳能帆板、飞船舷窗、箭体管路纹理——七项建模升级。
整个过程中,模型没有写”实施计划”或”30 天行动表”,而是用”先做→截图→看→改”的循环推进。这种 vision-in-the-loop 的工作方式,恰好对应官方强调的”视觉闭环”能力。
结果
模拟全程约 90 秒,覆盖从点火到海上着陆的完整任务剖面。以下是各阶段截图与分析。
T+3s · 点火
发动机启动,发射台导流槽两侧喷出灰白色烟雾。烟雾粒子由自定义 ShaderMaterial 渲染,每个粒子有独立的生命周期、尺寸增长曲线和颜色衰减——从截图可以看到两团翻涌的烟雾云分布在发射台基座两侧,符合真实发射中导流槽将废气向两侧排开的物理逻辑。火箭仍矗立在发射台上,橙色勤务塔的臂架结构清晰可辨,左右两侧的避雷塔、白色球形储罐、黄色龙门架等发射场设施一览无余。
T+5s · 起飞
推力超过重力,火箭离开发射塔。此时相机切到自动跟踪视角,能看到火箭缓缓抬升、底部烟雾持续翻涌的完整过程。箭体上的”中国载人航天”竖排文字和国旗标识清晰可辨——这些不是贴图文件,而是用 Canvas2D 现场画出来的纹理。火箭与发射台之间已经出现明显的间隙,上升态势确认无误。
T+14s · 最大动压(Max-Q)
穿越大气稠密区。火箭已开始程序转弯——姿态不再是纯垂直,而是沿发射方位角倾斜了约 6°。底部尾焰明亮,在身后拖出一条白色烟柱。天空颜色开始从地面蓝向高空深蓝过渡,这是 updateSky 函数根据相机高度做的渐变计算。地平线清晰可见,海面与天空的分界线提供了高度参照。
T+28s · 上升段
高度约 40 公里(显示遥测),速度约 3.5 km/s。一级发动机全推力工作,尾迹在身后拖出一条明亮的橙黄色火焰柱。火箭倾角已增大到 14°,沿预定的回收方位角飞向外海方向。这个角度不是随便选的——它决定了分离后一级能靠惯性飞回回收船上方。截图右下角的控制面板显示时间轴已走过”Max-Q”节点,正在接近”级间分离”。
T+42s · 级间分离
一级关机,两截火箭在太空中清晰分离。截图同时捕捉到两个关键主体:右上方是二级火箭携梦舟飞船继续爬升——底部发动机喷出明亮的橙黄色火焰,两侧太阳能帆板已展开;右下方是一级助推器,发动机已关机,处于无动力滑行状态,即将开始调姿翻转。背景是深蓝色的太空和地球大气层的弧线,稀疏的星点点缀其间。这是整个模拟中信息密度最高的一刻——两截火箭各奔东西,一个上天一个回头。
T+52s · 返场点火
一级发动机重新启动,推力约 45%。此时火箭已经完成 115° 翻转——发动机朝前,正在”倒着飞”减速并返回。从截图可以清晰看到箭体上的”CZ-10”编号和蓝色标识条纹,四片栅格舵已从贴附状态旋转到展开位置(金色/棕色镂空舵面),发动机喷口喷出典型的锥形橙黄色羽流。背景的深蓝色天空和稀疏星点表明火箭仍在高空。
T+61s · 再入点火
穿越大气层前的减速点火。火箭完整可见,发动机火焰清晰喷出——白色高温核心区外裹着橙色扩散羽流,在深蓝色高空背景下对比鲜明。姿态已从 168° 回正到 128°,火箭逐渐从”倒飞”转为”正向”再入。背景中可见两团柔软的白色云层,暗示火箭正在从太空向大气层过渡。此时高度约 1.7 公里(显示值),水平距离回收船约 18 公里。
T+78s · 着陆点火
临近回收船上空,发动机再次启动,推力从 70% 逐级降低到 35%。从截图可以看到火箭完整构型:顶部黑色整流罩带蓝色环带,四片栅格翼呈 X 型展开,箭体上”CZ-10”和”MARCH 10”标识清晰可辨,底部四条着陆腿已展开,发动机喷出白色至橙黄色的减速火焰。下方是深蓝色海面和海天交界线,火箭正从天而降。
T+85s · 着陆腿展开
4 条着陆腿从收拢状态完全展开,围绕箭体呈 X 形对称分布。每条腿含主撑杆、副支撑、球形关节和圆形足垫。发动机仍在工作,底部喷射火焰表明火箭处于主动减速悬停状态。甲板上开始出现径向扩散的白色气雾——这是着陆喷流冲击甲板表面产生的效果。展开时机在着陆前 3 秒——和真实任务中”最后一刻展开”的逻辑一致。
T+92s · 着陆
一级稳稳站立在海上回收平台甲板上。甲板上的红色着陆圈、白色”海上回收”文字清晰可见。火箭底部的 4 条着陆腿支撑在甲板上,发动机已关机。远处是发射场的避雷塔和勤务塔轮廓,深蓝色海面环绕着回收平台。俯视角度同时呈现了火箭直立状态、甲板靶心位置关系和海上环境——核心要素一览无余。
遥测面板显示最终状态:T+ 01:32,高度 0.00 km,速度 0.00 km/s,水平距离 22.54 km——任务完成。
评价
空间准确度:8/10。 火箭的飞行轨迹在空间逻辑上是自洽的——发射方位角、回收船位置、一级返场路径三者构成一条连贯的弹道。程序转弯的角度变化曲线(0° → 33° → 168° → 0°)符合”重力转弯”的物理直觉:不是生硬的折线,而是 smoothstep 平滑过渡。级间分离的截图尤其能说明问题——两截火箭在同一画面中各奔不同方向,上级带火焰上升、下级无动力下滑,空间关系一目了然。扣分点在于高度和速度的换算系数是示意值而非物理积分结果——但这在”概念演示”的定位下可以接受。
物理真实感:7/10。 点火烟雾从导流槽两侧喷出(不是往上冒)、着陆时推力从大到小递减(不是恒定)、栅格舵在分离后才展开(不是一开始就打开)、着陆腿在最后 3 秒才展开(不是提前打开)——这些细节说明模型对火箭发射流程有正确的物理直觉。返场点火时火箭已完成 115° 翻转、发动机朝前倒飞减速,这个姿态逻辑完全正确。扣分点在于再入阶段缺少明显的烧蚀辉光效果(虽然代码里有 reentryGlow 对象但未被主循环调用),以及 Max-Q 蒸汽锥特效未在画面中呈现。
工程完成度:9/10。 2176 行代码、5 个模块、3 轮迭代、10 个飞行阶段全覆盖、5 种相机视角、4 档播放速度、时间轴可跳转、遥测实时更新、全部资源离线化——作为一个”一行指令”的产出,工程完成度相当高。模型还自主发现了回收船被陆地覆盖的视觉 bug 并修复,说明它确实在”看”自己生成的画面,而不是盲写代码。
一句话结论: Kimi K3 在这个 Case 上展现了”能干活的模型”而非”能聊天的模型”的特质——它不是在描述一个 3D 模拟长什么样,而是直接把它造出来了,而且经得起细看。
06 综合评价:长板与短板
长板
- 前端代码与 3D 渲染(Case 1):官方已用 3D 开放世界游戏和前端竞技场 1679 分证明,Kimi K3 在这个方向上是开源模型里最强的一档。如果 Case 1 的 GBA 模拟器能一次跑通,这条长板就再次得到验证。
- 空间推理与物理建模(Case 2):官方案例里的芯片设计和天体物理复现,都涉及精确的数值推理而非”看起来像就行”。Case 2 的火箭模拟能检验这种能力是否延伸到动态物理场景。
- 长上下文与成本:KDA 让 100 万 token 不再是摆设,API 定价(缓存命中 $0.30/MTok)在 2.8T 参数的模型里有竞争力。配合 vLLM 的 prefix cache 支持,工程友好度高于多数同规模模型。
短板
- 部署门槛:官方推荐 64 张以上加速器的超节点配置,本地推理对多数开发者不现实。想私有化部署,先掂量硬件预算。
- 整体仍落后闭源顶尖:官方承认综合水平不及 Fable 5 和 GPT-5.6 Sol。在需要极致推理深度的场景里,Kimi K3 还不是最优解。
- 长上下文极端稳定性:100 万 token 的窗口在理论上有 KDA 保障,但极端长度下的信息保真度,还需要社区在权重开放后用真实场景去压测。
适用建议
- 前端开发、3D 交互、游戏原型:优先选 Kimi K3,这是它的主场。
- 长文档分析、知识工作:值得用,尤其适合需要生成可交互产出的场景(官方的知识工作案例很有说服力)。
- 极致推理深度、私有化部署:谨慎评估,闭源顶尖模型或更小参数的开源模型可能更合适。
08 结语:答卷交给时间
看完这些 Case,Kimi Kimi K3 留给我们的印象很具体:这是一个能干活的模型。3D GBA 模拟器的生成,展示了它在前端工程与 3D 渲染上的扎实功底;长征十号火箭的发射回收模拟,把它在空间推理和物理建模上的能力推到了极限。官方案例里从 GPU 编译器到芯片设计再到天体物理复现,也都指向同一个判断——Kimi K3 不是参数堆出来的花架子,而是能端到端完成复杂工程任务的工具。放在一年前,即便是最强的闭源模型,做这些事也需要反复调教、多次返工。
Kimi K3 也有短板。2.8 万亿参数意味着部署门槛不低,本地推理对多数开发者仍是奢望;官方也坦承综合水平仍落后于闭源顶尖。但开源的意义恰在此处——社区会替它把这些问题一个个暴露,再一个个修补。月之暗面把权重交出来,等于把答案交给了所有人。
一个模型到底成色如何,跑分说了不算,开发者用它做出的东西才算。Kimi K3 交出了答卷,剩下的,交给时间。
跑分和官方案例终究只是参考,一个模型到底成色几何,只有在真实任务里过秤才算数。
Kimi K3 从火箭发射模拟到 GPU 编译器,展现出的不是“能聊天的模型”那种轻巧,而是实打实的工程交付能力。但 2.8 万亿参数带来的部署门槛,此前确实让多数开发者只能旁观。
现在这道门槛被抹平了。
共绩算力已经正式上线 Kimi K3 最新模型,无需自建超节点,开箱即可调用。如果你手里也有需要空间推理、代码生成或多步骤协作的硬任务,不妨直接上手试一试——让模型干一次活,比读十篇测评都管用。