7 月 27 日晚,月之暗面在 Hugging Face 开放了 Kimi K3 的完整模型权重,同步公开技术报告和三项训练基础设施技术。这是全球首个迈入 3 万亿参数级别的开源模型,开源社区的大模型军备竞赛进入新阶段。
我们在共绩算力平台上第一时间对 Kimi K3 做了系统实测,结合官方技术报告,从架构设计、能力表现、工程部署三个维度做一次完整解读。
1. 模型概览
1.1 基本参数
项目 | 参数 |
总参数量 | 2.8 万亿 |
激活参数 | 1040 亿(每个 Token) |
架构 | Stable LatentMoE 混合专家 |
专家模块 | 896 个路由专家,每 Token 激活 16 个 |
上下文窗口 | 100 万 Token |
视觉能力 | 原生视觉理解(MoonViT-V2 编码器) |
开源协议 | 修改版 MIT 许可证 |
1.2 发布背景
Kimi K3 于 7 月 16 日在 WAIC 2026 前夕首次发布,7 月 27 日开放权重。参数规模是上一代 Kimi K2.5 的 3 倍左右。过去 12 个月里,Kimi 系列有 9 个月维持着全球开源模型的参数规模峰值。
值得注意的是,K3 不是单纯堆参数。在算力资源有限的前提下,通过 Kimi Delta Attention、Attention Residuals、MoonEP 等技术组合,相比 K2 整体算力拓展效率提升约 2.5 倍。
K2 到 K3 的扩张路径很清晰:主隐藏维度 7168 不变,层数从 61 加到 93,路由专家从 384 扩到 896,训练上下文从 128K 拉到 1M。新增的参数主要放进了更多层和更大的专家池,而不是把主干加宽。
2. 架构解析
K3 的架构不是一条普通的 Transformer 流水线,而是三条互相垂直的混合路径:序列方向由 KDA + MLA 混合,深度方向由 AttnRes 选择此前层的表示,宽度方向由 Stable LatentMoE 在专家间分配 Token。
2.1 Stable LatentMoE:896 选 16 的稀疏激活
MoE(混合专家)架构的核心思想是:模型有很多”专家”,每个 Token 只调用其中一小部分,用稀疏激活换取大容量和低计算量的平衡。
Kimi K3 把这个思路推到了极致:896 个路由专家,每个 Token 只激活 16 个。稀疏度(激活比例)约 1.8%,意味着模型 98% 以上的参数在单次前向传播中处于休眠状态。
这带来两个直接好处:
推理成本可控。2.8 万亿总参数听着吓人,但每个 Token 实际参与计算的只有 1040 亿参数,推理成本远低于同等能力的稠密模型。
专业化分工。大量专家意味着模型可以为不同领域(代码、数学、中文、视觉)培养专门的”子网络”,互不干扰。
MoE 的老问题是路由不稳定——训练过程中专家负载不均,容易出现”少数专家忙死、多数专家闲死”的坍缩。K3 的 Stable LatentMoE 配合 MoonEP 通信库解决的就是这个问题,官方称实现了”完美负载均衡”。
路由专家不直接处理 7168 维完整 hidden state,而是先投影到 3584 维 latent space,16 个被选中的专家在半宽空间中计算,聚合后经 RMSNorm 再投影回 7168 维。2 个共享专家保留全宽路径。Quantile Balancing 负责路由层均衡,MoonEP 在分布式执行层动态复制热点专家,两层配合解决 896 专家规模下的负载问题。
2.2 Kimi Delta Attention:百万上下文的工程基础
100 万 Token 上下文不是宣传数字,背后是注意力机制层面的重构。
标准 Transformer 注意力是 O(n²) 复杂度,上下文到百万级别,计算和显存开销都不可接受。Kimi K3 采用自研的 Kimi Delta Attention(KDA)混合线性注意力机制,配合 Attention Residuals 技术,把长上下文的计算成本压到可工程化的水平。
K3 不是纯线性注意力模型,而是把 3 层 KDA 和 1 层 Gated MLA 组成基本块按 3:1 重复,最后再放一层 MLA 确保骨干网末端执行一次全局注意力。KDA 用固定大小的循环状态压缩历史,MLA 定期恢复全局检索能力。
配套的 FlashKDA 高性能算子也同步开源了。官方数据:在英伟达 H20 上,预填充速度相比基线提升 1.72 至 2.22 倍。
KDA 能工程化的一个关键细节:K3 把逐步 log-decay 限制在 (-5, 0),对应的 retention factor 始终大于 e^-5,16-token tile 的累计 log-decay 落在 (-80, 0),倒数缩放仍在 BF16 动态范围内。对角和非对角因果 tile 都可以改用密集 Tensor Core 矩阵乘法,不再需要特殊的对角路径。这项改动不改变 KDA 是循环状态的定义,但直接决定了 kernel 能用哪条硬件路径。
对开发者来说,百万上下文的实际意义在于:整本书级别的文档分析、超长代码仓库的理解、跨多轮长对话的 Agent 记忆,这些场景不再需要复杂的 RAG 切片工程。
配合 KDA 的还有 Attention Residuals(AttnRes)。普通 Transformer 的残差连接是固定权重相加,第 90 层看到的只是此前所有层压进同一个 hidden state 的结果。AttnRes 把注意力的思想从 token 轴转到 layer 轴,让每一层能选择性地读取此前层的表示。K3 用 Block AttnRes 把 93 层分成 8 个块,跨块状态内存和通信从 O(Ld) 降到 O(Nd),工程上可行。
推理侧的缓存设计也跟着变了。KDA 保存固定大小循环状态,MLA 保存逐 token 的 KV Cache,两种状态生命周期不同。K3 把它们放进同一个 paged pool 统一管理,prefix 只有在 MLA KV 和对应位置的 KDA state 都命中时才能复用。百万上下文能不能落地,最后取决于状态能否被保存、转移、命中和调度,不只是配置文件里写个 context_length。
2.3 MoonViT-V2:原生视觉,不是外挂
很多多模态模型的视觉能力是”外挂”的——拿一个现成的视觉编码器(比如 SigLIP)接在语言模型上,通过对比学习对齐。这种方式训练流程繁琐,视觉和语言之间始终有层隔阂。
Kimi K3 的视觉编码器 MoonViT-V2 从零开始,直接用 next-token prediction 方式训练,没有用 SigLIP 等对比学习模型做初始化,和语言模型用同一套目标函数,省掉了对比预训练环节。技术报告里的对比实验显示,用预训练视觉编码器初始化时联合训练会出现更高、更频繁的梯度尖峰,而从零训练的 MoonViT-V2 收敛更稳定,最终效果达到 SigLIP 初始化的基线水平。
原生视觉的好处是视觉信息进入模型的方式更”深”,不是翻译成文本再理解,而是在表征层面直接融合。
3. 能力实测
技术报告的跑分是一回事,实际调用是另一回事。我们在共绩算力平台上用 21 道测评题(来源晚点测评、量子位等公开测试集)对 Kimi K3 做了实测,挑几个有代表性的结果。
3.1 复杂逻辑:推理链最完整
用”囚犯帽子”题测试多层嵌套推理(我知道你知道我不知道什么):
A 能看到 B 和 C,B 能看到 C,C 谁也看不到。3 顶红帽子 2 顶蓝帽子,A 说不知道,B 说不知道,问 C 能否确定自己帽子的颜色。
Kimi K3 的回答分两层推进:先分析 A 的话排除”双蓝”可能性,再分析 B 在已知 A 信息的情况下仍说不知道,反推 C 必为红色。逻辑链条完整,没有跳步。
星球版农夫过河题(防背诵变体),K3 用表格列出每一步的操作和两岸状态,还主动补充了一个边界条件分析:“若额外规定地球每次过河都必须带一个星球、绝不能空船,则此题无解。“这种主动考虑边界条件的行为,在同场测试的 7 个模型里只有 K3 做了。
3.2 事实核查:满分
三道事实核查题(错误前提纠正、虚构论文识别、矛盾信源交叉验证),Kimi K3 全部正确。让它回顾一篇不存在的 Nature 论文,它直接指出论文不存在,没有顺着 prompt 编造内容。
3.3 调用参数注意
实测中两个关键细节:
temperature 必须设为 1。K3 对采样温度有强制约束,设其他值会直接报错,这是和绝大多数模型不同的地方,迁移代码时容易踩坑。
max_tokens 要给足。作为深度推理模型,K3 在复杂任务上 reasoning 阶段消耗的 token 较多,复杂任务建议 max_tokens 至少 4096,否则可能出现推理完成了但答案没写完的情况。
实测延迟数据:简单问答几秒返回,复杂逻辑题 35-134 秒。深度推理换的是推理质量,不适合对延迟敏感的实时场景。
4. 工程能力:不只是模型
这次开源最有分量的部分,其实是技术报告里披露的两组工程实验。
4.1 GPU 内核自主优化
技术报告披露,Kimi K3 在 24 小时内独立完成了四种代表性 GPU 内核的优化:AttnRes 延迟从 283.6ms 降到 114.4ms,DSA 和 KDA 运行时间分别减少 55.1% 和 73.6%,MLA 接近峰值 TFLOPS。该表现与 Claude Fable 5 持平,超过 GPT-5.6 Sol。
K3 还自主开发了名为 MiniTriton 的紧凑型 GPU 编译器,从 Python 前端到 PTX 代码生成全链路由模型完成。
更关键的信号是:测试环境同时覆盖了 NVIDIA H200 和其他供应商的 GPGPU。这意味着 K3 的部署能力不绑定英伟达生态,对国产算力卡的适配是现实可选项。
4.2 48 小时设计一颗芯片
技术报告还披露了一个概念验证:K3 在 48 小时自主运行中,基于开源 EDA 工具和 Nangate 45nm 工艺库,为一颗采用混合 KDA、MLA 注意力和 MoE 路由结构的微型模型完成了推理芯片原型的设计、优化与验证。芯片面积 4 平方毫米,集成 146 万个标准单元和 0.277MB SRAM,100MHz 时序闭合,解码吞吐超过 8700 tokens/秒。
一颗由模型设计、为模型服务的芯片。从算法到硬件的全栈自主工程能力,这个信号比跑分本身更值得关注。
5. 快速上手
Kimi K3 已在共绩算力平台上线,兼容 OpenAI 接口,改两个参数就能调:
from openai import OpenAI
client = OpenAI( api_key="你的 API Key", base_url="https://api.suanli.cn/v1",)
response = client.chat.completions.create( model="moonshotai/kimi-k3", messages=[ {"role": "user", "content": "9.9 和 9.11 哪个大?"} ], max_tokens=4096, temperature=1.0 # 注意:K3 必须为 1)
print(response.choices[0].message.content)不用自己部署 2.8 万亿参数的权重,不用管 MoonEP、FlashKDA 这些底层优化,一个 Key 直接调满血版。按量计费,用多少算多少。
控制台:console.suanli.cn/models,接入文档见快速上手指南。
6. 总结
Kimi K3 这次开源的核心信息可以归纳成三点:
架构上,896 选 16 的 Stable LatentMoE 把稀疏激活推到新高度,2.8 万亿总参数只激活 1040 亿,大容量和可控推理成本兼得。KDA 线性注意力支撑起真正的百万上下文。
能力上,从我们的实测看,K3 的强项在复杂逻辑推理的完整性和事实核查的可靠性,推理链细致、主动考虑边界条件。代价是响应速度慢于非推理模型,适合深度任务而非高频快答。
生态上,权重、技术报告、训练基础设施三件套全部开放,GPU 内核优化和芯片设计的实验展示了超出模型本身的工程潜力。部署能力不绑定单一芯片生态,这一点对国内开发者尤其重要。
开源大模型正式进入 3 万亿参数时代。接下来的看点是:谁能把这些能力以足够低的门槛交到开发者手里。