引言
月之暗面AI(Moonshot AI)兑现了其承诺,正式发布了其迄今最大、最具雄心的模型——Kimi K3 的完整权重。
该模型现已通过月之暗面AI的官方Hugging Face和GitHub页面开放下载,并附有详细的技术报告及配套基础设施项目。
Kimi K3 是一款原生多模态混合专家模型,拥有 2.8万亿总参数,每个Token约激活 1040亿参数,并具备 100万Token的上下文窗口。
月之暗面将其定位为一款开放权重的前沿模型,专为长周期编程、研究、多模态理解、智能体知识工作以及可能涵盖数百或数千步骤的推理任务而设计。
此次发布的重要性体现在两方面。
首先,模型本身将开放权重规模推向了3万亿参数级别。
其次,月之暗面所披露的内容远不止模型检查点。公开资料详细描述了其架构、后训练策略、长上下文强化学习基础设施、专家并行训练系统、推理优化、基准测试结果以及多个长期运行的工程案例研究。

Kimi K3 完整权重现已可用
月之暗面此前宣布推出Kimi K3,并承诺于2026年7月27日前发布完整权重。
该发布现已完成。
官方模型可通过以下渠道获取:
GitHub仓库包含README文件、Kimi K3许可证、完整技术报告、架构与基准测试资源、部署指南以及模型使用说明。
Hugging Face模型卡提供了模型配置及已发布权重的访问方式。
这意味着该模型已从一个计划开放发布的托管式前沿系统,转变为一个研究人员及有资质的基础设施团队能够根据Kimi K3许可证条款实际下载、检查、部署、微调和适配的模型。

Kimi K3 的"开放"意味着什么
Kimi K3 最适合被描述为一个拥有公开代码和文档的开放权重模型。
该许可证授予广泛的权利,允许用户根据许可证条款使用、复制、修改、微调、部署、创建衍生作品、再分发、再许可和出售副本。
然而,
该许可证包含额外的商业要求。
例如,一家运营合格模型即服务(Model-as-a-Service)业务且连续12个月内总营收超过2000万美元的公司,在使用Kimi K3或其衍生成果进行商业用途前,必须先与Moonshot AI另行签订协议。
该许可证还针对某些超出指定用户或营收门槛的极大型商业产品或服务,提出了展示要求。
内部使用以及通过Moonshot AI官方产品或认证推理合作伙伴进行的使用,将区别对待。
因此,任何将Kimi K3用于商业目的的人,都应仔细阅读实际许可证,而非假设其与Apache 2.0、MIT或其他标准宽松许可证相同。
一款拥有104B激活参数的2.8万亿参数模型
Kimi K3总容量极为庞大,但其混合专家(MoE)设计意味着,并非每个令牌都会激活全部2.8万亿参数。
官方模型卡列出以下信息:
| 规格 | Kimi K3 |
|---|---|
| 架构 | 混合专家(MoE) |
| 总参数量 | 2.8T |
| 激活参数量 | 104B |
| 层数 | 93 |
| 密集层数 | 1 |
| 路由专家数 | 896 |
| 每令牌选择的专家数 | 16 |
| 共享专家数 | 2 |
| 词汇表大小 | 160K |
| 上下文长度 | 1,048,576 个令牌 |
| 视觉编码器 | MoonViT-V2 |
| 视觉编码器参数量 | 401M |
| 量化方式 | MXFP4 权重 / MXFP8 激活 |
| 模态 | 文本和图像 |
技术报告给出了与Kimi K2更精确的架构对比。

与Kimi K2相比,K3增加了模型深度和专家稀疏性,同时引入了新的注意力和残差机制。
Moonshot表示,在Kimi K2的基础上,通过架构和训练方式的综合改进,整体扩展效率提升了约2.5倍。
这一说法指的是额外计算能力转化为模型能力的效率,而非普遍意义上的2.5倍推理速度提升。
原生多模态与百万令牌上下文窗口
Kimi K3被设计为原生多模态模型,而非仅在训练结束时接入视觉模块的语言模型。
其视觉编码器MoonViT-V2拥有约4.01亿个参数。
技术报告指出,MoonViT-V2是通过模型的下一个令牌预测目标从头开始训练的,而非从类似SigLIP这样的对比预训练视觉模型初始化。
Moonshot报告称,该方法在训练过程中保持稳定,并达到了具有竞争力的视觉性能。

该模型支持的上下文长度为:
1,048,576 个 token
这一规模对于智能体系统尤为重要,因为一个长时间运行的编码或研究任务可能会积累仓库内容、工具输出、日志、截图、研究资料、中间计划、测试失败记录、先前推理结果以及多轮修正信息。
百万级 token 的上下文并不能消除上下文管理的需求,但它允许 K3 保留一个比传统短上下文系统大得多的工作历史记录。
三大主要架构变化
技术报告将 K3 的规模和稳定性归功于几项架构变化。
其中最为显著的三项是:
- 混合 KDA + 门控 MLA 注意力机制。
- 注意力残差。
- 稳定的潜在混合专家模型。

- 混合注意力机制:KDA + 门控 MLA
Kimi K3 采用了混合注意力设计。
官方模型卡列出了:
69 层 KDA + 24 层门控 MLA
该架构遵循一种重复模式,其中多个 Kimi Delta 注意力层与周期性的门控多头潜在注意力层相结合。
Kimi Delta 注意力
KDA 是一种线性注意力机制,旨在减少与极长上下文相关的内存和计算负担。
KDA 不采用以与标准全注意力相同的方式随每个 token 增长的传统 KV 缓存,而是维护一个循环状态。
这使得它对于百万 token 序列具有吸引力。
Moonshot 此前通过 Kimi 线性研究系列引入了 KDA,该团队报告称,在其评估条件下,与全注意力相比,KDA 降低了 KV 缓存需求并提升了长上下文解码吞吐量。
门控 MLA
K3 并未完全取代全局注意力。
周期性的门控 MLA 层保留了模型在上下文中全局检索信息的能力。
因此,这种混合设计试图平衡两个目标:
- 高效的长序列处理。
- 强大的全局检索。
其理念并非线性注意力总是优于全局注意力,而是每种机制处理长上下文问题的不同部分。
- 注意力残差
深度神经网络需要通过多个层级传递信息,同时避免有用的表示逐渐丢失。
Kimi K3 引入了注意力残差(AttnRes),以改变信息在深度中的传递方式。
该机制不依赖于统一的顺序残差流,而是允许后续模块有选择性地检索先前模块产生的表示。
从概念上讲,这为网络提供了一种学习机制,使得它能够
决定哪些早期信息应保持直接可访问。
目标是在一个 93 层模型中改善信息流动,而无需让每个特征都严格通过完全相同的残差路径。
- 稳定型 LatentMoE
Kimi K3 显著提升了 MoE 的稀疏度。
该模型包含:
896 个路由专家
但每个 token 仅激活:
16 个路由专家
此外,模型还包含两个共享专家。
这使得模型总参数量非常庞大,但活跃计算量远小于总参数量。
在此稀疏度下,训练稳定性和专家均衡成为棘手问题。
Moonshot 的稳定型 LatentMoE 设计包含了若干旨在解决这些问题的机制。
SiTU-GLU
Kimi K3 用 SiTU-GLU 替代了 SwiGLU,这是一种旨在避免在极端扩展下出现无界增长的激活函数。
![图片展示了GLU、SwiGLU和SiTU-GLU的门支路(Gate branch)和上支路(Up branch)结构,以及它们的标量响应曲线。所有支路接收标量输入x,曲线共享x ∈ [−10, 100]的定义域,右下角放大显示了原点附近的区域。SiTU-GLU在β1 = 4、β2 = 25时,其曲线在原点附近与SwiGLU接近,且当x为大正数时,SiTU-GLU的|f(x)| ≤ β1β2 = 100,而SwiGLU仍无界。该图与上下文介绍Kimi K3中SiTU-GLU替代SwiGLU以避免极端缩放下无界增长的内容相关。](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/fefa954c-d8a3-4294-a43b-b222b3386796-9daf2fb4-86f3-4c9a-96cf-f477c6f49b97.png)
分位数均衡
该系统还采用了一种基于动态路由偏置的负载均衡方法,而非完全依赖传统的辅助均衡损失函数。
其目标是在不引入过多训练干扰的情况下,使路由后的 token 在专家间分布更加均匀。
百万 Token 智能体训练
Kimi K3 的技术报告特别强调了面向长时间运行智能体的后训练。
该模型在三大领域进行了训练:
- 通用推理。
- 通用智能体任务。
- 编程智能体。
它还支持多种推理精细度级别:
- 低。
- 高。
- 最高。
最终模型通过多教师在线策略蒸馏(MOPD)组合了多种专门策略。
Moonshot 并非为每个领域和精细度级别训练各自独立的永久模型,而是训练专门的教师模型,并将其行为整合到一个统一的 K3 策略中。
AgentENV:长时程沙盒训练
技术报告中描述了 AgentENV,这是一个为持久化智能体部署构建的基础设施层。
该系统采用基于 Firecracker 的微虚拟机环境,使得智能体能够在可复现的沙盒中执行长序列操作。
一个训练任务可能包括:
- 读取文件。
- 编写代码。
- 运行命令。
- 打开应用程序。
- 截取屏幕截图。
- 使用模拟的工作场所工具。
- 调试错误。
- 长时间延迟后返回。
- 从之前的环境状态继续执行。
这与基于简短问答回合的强化学习不同。
一个智能体可能执行数百次工具调用,并在模拟环境中维持状态,持续数个虚拟日。
源文章描述了涉及 Slack、Notion 和 Gmail 等应用程序的模拟环境。
主要的训练挑战是持久性:环境和模型的长上下文状态都必须保持可用。
在漫长的部署过程中。
知识图谱引导的任务合成
长周期训练还需要大量困难任务。
Moonshot 描述了一个任务生成流水线,该流水线围绕一个层级化的知识图谱组织。
该图谱涵盖计算机科学、人工智能、编码、数学、物理、化学、生物医学和人文等多个领域。
相关概念可以一起被采样,检索相关的公开资料,然后从这些资料中合成新的评估或训练任务。
该图的目的是创建需要实际工具使用和多步骤推理的任务,而不仅仅是记忆答案。
3T 级 MoE 模型的基础设施
一个拥有百万 token 上下文窗口的 2.8T 模型,无法仅通过模型架构实现高效的训练和服务。
Moonshot 的技术报告描述了涵盖 KDA 内核、上下文并行、专家并行、内存管理、长周期 RL 调度、前缀缓存、推测解码和服务准入控制等方面的系统工作。
其中部分内容已经公开。
MoonEP:均衡的专家并行
MoonEP 是 Moonshot 开源的一个专家并行通信库。
在 MoE 训练中,路由可能会出现严重不均衡。
由于路由器偏好某些专家,一个排名可能接收比另一个排名多得多的 token。当这种情况发生时,最快的设备必须等待最慢的设备。
MoonEP 使用动态冗余专家来解决这个问题。
它可以根据当前的路由模式创建临时的专家副本,从而使各排名上的 token 工作负载保持均衡。
该项目将其目标描述为使每个排名恰好保持在预期的路由 token 负载量,同时减少通信开销。
这在 K3 的规模下至关重要,因为将 896 个专家分布在一个大型集群中会带来巨大的同步问题。
FlashKDA:高性能 KDA 内核
FlashKDA 提供了基于 CUTLASS 实现的高性能 Kimi Delta 注意力内核。
该公开仓库目前列出的要求包括:
数分で紹介サイトを作り、リード獲得を伸ばす
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
SM90 或更新版本
CUDA 12.9 或更新版本
PyTorch 2.4 或更新版本
该仓库包含针对支持硬件的正确性测试和基准数据。
FlashKDA 旨在加速使 K3 长上下文架构变得实用的注意力机制。
原生 MXFP4 量化
Kimi K3 从监督微调阶段开始就使用量化感知训练。
官方配置列出:
MXFP4 权重
MXFP8 激活值
这与先训练一个完全高精度模型,然后在训练后才进行量化不同。
该模型被训练成在流水线中直接使用这些较低精度格式进行运算。
这有助于减少内存和通信开销。
要求,但这并不会将2.8T模型变成普通桌面模型。
能否在本地运行Kimi K3?
权重是公开的,但“可下载”并不意味着“能在笔记本电脑上轻松运行”。
Kimi K3 总参数量为 2.8 万亿。
即使采用稀疏激活和低位格式,运行完整模型也需要大量聚合加速器内存、高带宽设备互连、专家并行执行、兼容的推理引擎,以及对KDA、MLA和MoE的高效支持。
Moonshot 官方仓库推荐:
生态系统仍在快速演进。支持可能取决于特定的方案、内核、量化模式和硬件。
在构建自托管环境之前,请确认最新的 Kimi K3 部署文档,不要假设标准的 Transformer 服务设置能够正常工作。
对于大多数个人和小团队而言,托管 API 可能比运行完整模型要容易得多。
Kimi K3 API 与推理努力程度
Moonshot 还通过其官方 API 平台提供 Kimi K3:
模型标识符为:
kimi-k3
Kimi K3 使用推理功能,并返回 reasoning_content 字段。
官方模型卡描述了三种推理努力程度:
low
high
max
一个重要实现细节是 保留的思考历史。
对于多轮智能体工作流,Moonshot 表示开发者应将完整的先前助手消息(包括 reasoning_content、content 和 tool_calls)传递回下一个请求。
丢弃其中部分状态可能会损害连续性,因为 K3 的训练方式要求保留推理历史。
基准测试性能
Moonshot 的技术报告在推理与知识、编码、智能体工作流和视觉方面评估了 Kimi K3。
该公司自己的评估套件将 K3 列为最强可用模型之一,并在特定任务中领先于许多开放权重和专有系统。
同时,报告明确说明该模型 整体上仍落后于最强的专有系统,特别是 Claude Fable 5 和 GPT-5.6 Sol。
这一限定条件很重要。
声明并不是说 K3 赢得了所有基准测试。
更站得住脚的结论是,Kimi K3 将开放权重带入了直到最近主要与前沿专有系统相关的性能领域。

多个基准测试对比也依赖于不同的智能体工具,包括 Kimi Code、Claude Code、Codex 和官方基准测试工具。
因此,智能体基准测试分数不应被解读为纯粹的模型能力体现。
测量结果。周围的工具、提示词、上下文管理、回退机制以及评估器都会对结果产生实质性影响。
长周期编码案例研究
报告提供了几个案例,旨在证明K3能够胜任远超短代码补全任务的复杂工程工作。
这些案例由模型开发者提供,应视作案例展示,而非普遍的性能保证。
MiniTriton:构建GPU编程系统
Moonshot报告称,Kimi K3开发了MiniTriton,一个紧凑的类Triton GPU编程系统。
该项目包含中间表示、编译器流程、PTX生成、前端语言、运行时组件、GPU内核优化以及分布式训练原语。

Moonshot表示,K3还优化了与其自身架构相关的复杂内核,并在选定的内核上实现了显著的加速效果。
这展示了该模型的预期行为:检查复杂代码库、进行性能分析、编写底层代码、对结果进行基准测试并迭代改进。
但这并不意味着每个模型生成的编译器或内核无需人工审查和测试即可完全信任。
一个48小时的芯片设计实验
另一项案例研究中,Kimi K3被置于沙盒环境中运行48小时,并被要求为一个小型模型创建一个推理芯片原型,该模型的设计思路与上述架构有相似之处。
该模型使用了开源电子设计自动化工具以及Nangate 45纳米标准单元库。
Moostshot报告称,最终的设计仿真在4平方毫米的分析面积预算内完成,在100MHz时钟频率下实现时序闭合,包含约146万个标准单元,使用了0.277 MiB的SRAM,并通过RTL仿真达到了每秒超过8,700个token的解码吞吐量。

这是一个基于仿真的概念验证,并非量产芯片。
科研编码与天体物理学
K3还在一个计算天体物理学复现任务中接受了评估。
Moonshot表示,该模型阅读并交叉验证了20多篇论文,实现了一套完整的数值计算流程,评估了超过300个物态方程,识别了已发表公式中的不一致之处,编写了超过3,000行Python代码,并生成一个交互式的HTML仪表板。



