月の暗面(Moonshot AI)は、長時間のコーディング、知識作業、視覚推論、およびエージェントベースのワークフロー向けに設計されたネイティブマルチモーダルモデル Kimi K3 を発表しました。 このモデルは 2.8兆の総パラメータ数、100万トークンのコンテキストウィンドウ...

月の暗面(Moonshot AI)は、長時間のコーディング、知識作業、視覚推論、およびエージェントベースのワークフロー向けに設計されたネイティブマルチモーダルモデル Kimi K3 を発表しました。
このモデルは 2.8兆の総パラメータ数、100万トークンのコンテキストウィンドウ、および高度にスパースな混合専門家アーキテクチャを備えており、各トークンに対して896の専門家から16のみを活性化します。月の暗面はこれを初のオープンな3T級モデルと説明していますが、同社の発表によると、完全なモデルウェイトは 2026年7月27日 にリリースされる予定です。
Kimi K3は、フロントエンド開発、自律型GPUカーネル最適化、MiniTritonと呼ばれる小型GPUコンパイラの作成、およびオープンソースの電子設計自動化ツールを使用して48時間で完了したチップ設計実験などの成果により、すぐに注目を集めています。
月の暗面はまた、K3がすべてのカテゴリーでリードしているわけではないことを認めています。同社の自己評価によると、このモデルは全体的なパフォーマンスでClaude Fable 5およびGPT-5.6 Solに劣るものの、複数のコーディングおよび長時間エージェントタスクでより優れた結果を示しています。
画像は記事で共有されているArtificial Analysisのインテリジェント比較を示しており、Kimi K3の位置を示しています。
Kimi K3は、月の暗面のAPI価格を初期のKimiコーディングモデルよりも高いレベルに押し上げました。
元のレポートの価格表には、中国地域API向けの以下の料金が記載されています:
| モデル | キャッシュヒット入力 | キャッシュミス入力 | 出力 |
|---|---|---|---|
| Kimi K3 | 百万トークンあたり¥2 | 百万トークンあたり¥20 | 百万トークンあたり¥100 |
| Kimi K2.7 Code | 百万トークンあたり¥1.30 | 百万トークンあたり¥6.50 | 百万トークンあたり¥27 |
元記事によるKimi K3とKimi K2.7 Codeの価格比較。
月の暗面の国際APIプラットフォームに記載されているKimi K3の価格は以下の通りです:
これはKimi K2.7 Codeよりもはるかに高価ですが、月の暗面が発表比較で引用したClaude Fable 5の価格よりも依然として低くなっています。
価格比較表は、Kimi K3の出力価格がClaude Fable 5の提示価格のわずか30%であることを示しています。
価格比較を読む際には注意が必要です。API料金は地域、ベンダー、キャッシュ動作、およびその後の製品アップデートによって異なる場合があります。デプロイメント前には、公式のKimi APIページが現在の課金基準を確認する最良の方法です。
最も注目すべき初期の成果はフロントエンド開発分野から来ています。
本稿執筆時点で、Kimi K3は Arenaフロントエンドコードアリーナの暫定WebDevリーダーボード で首位を獲得しています。元のグラフは76%の勝率を示しており、Claude Fable 5およびGPT-5.6 Solをリードしています。
Kimi K3は、レポートで提示された暫定フロントエンドコードアリーナ結果で首位を獲得しています。
7つのフロントエンドカテゴリーのうち、元のレポートではK3が6つのカテゴリーで首位を獲得したとされています:
ゲームカテゴリーでは2位だったと報告されています。
これらの結果は、フロントエンド作業が単なるコード生成の問題ではないため、特に重要です。有能な大規模モデルは、視覚的な要件を解釈し、機能的なアプリケーションを作成し、それを実行し、結果を確認し、インターフェースが期待されるデザインと一致しない場合に実装を修正できなければなりません。
元の記事で引用されている例の1つは、エージェントクラスターを使用して約6時間でmacOS 27スタイルのインターフェースを再現したことです。
その結果は、単なる静止スクリーンショットではありません。レポートによると、ブラウザや電話機能などのいくつかの例外を除いて、ほとんどのデスクトップアプリケーションとインタラクションが正常に機能しました。
エージェントによって生成された、最新のデスクトップオペレーティングシステムを模倣したブラウザインターフェース。
その他のデモには、ロボットアームシミュレーターや、Three.jsとWebGPUを使用した完全プログラムベースのブラウザ内3Dゲームも含まれています。
これらの例は依然としてデモンストレーションであり、標準化されたベンチマークではありませんが、MoonshotがK3でサポートしたいワークフローのタイプ(長時間実行、視覚的、反復的なソフトウェア作成)を示しています。
MoonshotはK3のフロントエンドワークフローを ループ内の視覚 と説明しています。
このモデルはコードを一度生成して停止するのではなく、以下のことが可能です:
このプロセスは、コード生成と視覚的評価の間のギャップを埋めます。
モデルは構文的に有効なHTML、CSS、JavaScriptを生成するかもしれませんが、それでもインターフェースが悪くなる可能性があります。レンダリング出力を観察することで、K3はソースコードだけでは発見しにくい問題を特定できます。
より大きなフロントエンドリポジトリの場合、100万トークンのコンテキストウィンドウも重要です。これにより、多数のコンポーネント、型定義、デザインシステムルール、プロジェクトドキュメント、およびファイル間の依存関係を1つの作業コンテキストに収容できます。
元の記事ではトレードオフも言及されています。一部のユーザーは、複雑なフロントエンドタスクに20分から1時間かかると報告しています。これらは個々の観察であり、制御された遅延測定ではありませんが、K3が
プログラミングはKimi K3の中核的な強みの一つです。
元のレポートのベンチマーク表には、以下の結果が示されています。
| ベンチマーク | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 |
| Program Bench | 77.8 | 76.8 | 77.6 |
| SWE Marathon | 42.0 | 35.0 | 39.0 |

複数のプログラミングおよびソフトウェアエンジニアリング評価における、Kimi K3の報告結果。
Kimi K3の公式ブログでは、重要な方法論の説明が提供されています。
DeepSWEに関して、Moonshotは主要な比較においてKimi Codeフレームワークの結果を報告していますが、公開されているmini-SWE-agentのランキング結果は67.3とされています。したがって、フレームワークや評価設定の違いにより、わずかな差異が生じる可能性があります。
SWE Marathonに関して、Moonshotは公式タスクのH20キャリブレーションブランチを使用しました。同社はまた、Claude Fable 5が一部の評価でフォールバック動作を示し、それが測定スコアを低下させた可能性があると指摘しています。
これらの詳細は結果を否定するものではありませんが、モデルを比較する際には重要です。エージェントフレームワーク、ツールの権限、ハードウェア、推論設定、フォールバック動作、タスクキャリブレーションのすべてが最終スコアに影響を与える可能性があります。
Moonshotは、Kimi K3が人間の監督を最小限にしてGPUカーネルを最適化できるかどうかをテストしました。
各モデルには同一のサンドボックス環境が与えられ、最大24時間以内に以下の関連カーネルの分析、書き換え、ベンチマーク、最適化を完了することが求められました。
NVIDIAテストはH200ハードウェア上で実行されました。
Attention Residualsワークロードについて、原文はK3が新しい2段階カーネルアルゴリズムを考案し、それにより
順方向および逆方向実行の合計時間が 283.6ミリ秒から114.4ミリ秒に短縮 されたことを示しています。
これはベースラインと比較して約59.7%の高速化に相当し、Moonshotの実験構成においてKimi K3はClaude Fable 5のスコアに迫りました。

AttnResカーネルタスクにおける、Kimi K3の報告された改善軌跡図。
この図は、エージェントが時間の経過とともに改善していく様子も示しています。K3は実行の初期段階で複数の大きな進歩を遂げ、その後の反復を通じてカーネルを継続的に最適化しました。
ゼロからのMLA-512タスクにおいて、Kimi K3のカーネルは、順方向と逆方向の複合負荷下で、報告された 517.8 TFLOPS を達成しました。
報告で示された2番目に高い結果は約492.7 TFLOPSでした。

MLA-512最適化タスクにおいて、報告された517.8 TFLOPSを達成したKimi K3。
Moonshotは、モデル開発の後期段階では、初期バージョンのK3がチームのカーネル最適化作業の大部分を担っていたと述べています。これは同社が自己申告したワークフローであり、ソースにリンクされた資料において独立した審査を受けたものではありません。
次の実験は、個々のカーネルの最適化を超えたものでした。
Moonshotは、Kimi K3がゼロから小型のGPUプログラミングシステムを構築できるかどうかを探求しました。その成果が MiniTriton であり、Tritonに似たコンパクトなコンパイラで、以下を含みます。
Moonshotは、MiniTritonがサポートされているルーフラインベンチマークにおいて、特定のワークロードではTritonを上回るなど、Tritonおよび torch.compile のパフォーマンスに達するか、それを超えたと報告しています。

MiniTriton が NVIDIA L20 GPU 上で報告した CUDA コアのルーフラインパフォーマンス。
このコンパイラは、エンドツーエンドの nanoGPT トレーニングもサポートし、安定した収束を実現しています。Moonshot によると、損失曲線は参照実装と近い値を保ち、わずかなずれしか生じていません。
これは、孤立したマイクロベンチマークによる評価よりも意味のある結果です。生成されたシステムが、フロントエンド言語、中間表現、最適化パイプライン、PTX 生成、ランタイムを一貫したワークフローに統合できることを示しています。
ただし、本稿執筆時点では、Moonshot は MiniTriton のコードベースを公開していません。そのため、パフォーマンスの主張は Kimi K3 の発表資料に基づいており、公開されたコードによる再現はまだ不可能です。
Kimi K3 はチップ設計においてもテストされました。
48時間の自律実行中に、このモデルはオープンソースの EDA ツールと Nangate 45nm プロセス設計キットを使用して、K3 アーキテクチャに基づく小規模モデルを処理するためのチップを構築、最適化、検証しました。
Moonshot は以下のシミュレーション設計結果を報告しています。

アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
このチップ設計のケーススタディでは、シミュレーションで毎秒8700トークン以上の処理速度が報告されています。
検証されたデジタル設計と実際に製造された物理チップの違いは重要です。
公開されている資料には、EDA 設計、最適化、タイミング、シミュレーションの演習について記載されています。これらは、チップがテープアウト、製造、パッケージングされ、シリコン上でテストされたことを示すものではありません。
この制限があるとしても、拡張されたハードウェア設計パイプラインを完了することは、注目すべき長期コーディングの事例です。エージェントがアーキテクチャの決定、ハードウェア記述、合成、配置配線、タイミング検証、検証、反復的な最適化の間で協調して動作する必要があります。
Kimi K3 は、Moonshot AI が開発した2つの技術に基づいています。
このモデルは、これらの技術を、より活性化が疎な混合エキスパートアーキテクチャと組み合わせています。

Kimi K3 は、KDA、アテンション残差、Gated MLA、Stable LatentMoE を組み合わせています。
Kimi Delta Attention、略して KDA は、アテンション機構を長いシーケンスに対してより効率的にすることを目的としています。
KDA は、コンテキスト全体にわたる標準的なフルアテンションに完全に依存するのではなく、エンコーディング、推論、エージェントタスクに必要な情報を保持しながら、長い入力を処理するための効率的なメカニズムを提供します。
これは、K3 モデルの数百万トークンのコンテキストウィンドウを支える基盤の1つです。
従来の Transformer 層は、新しい各層の出力を累積された隠れ状態に繰り返し追加します。
**アテンション残差機構(AttnRes)**は、このパターンを変更します。これにより、後続の層は、すべての初期層を単一の累積フローの一部として扱うのではなく、異なる深さから表現を選択的に取得できるようになります。
月之暗面(Moonshot AI)は、これを超深度モデルにおける情報フローを実現する、より柔軟な方法であると説明しています。
Kimi K3 は 896個のエキスパートモジュール を持ちますが、各トークンは 16個のエキスパート のみを活性化します。
この極度の疎性は、モデル全体のサイズと比較してトークンあたりの計算量を削減する一方で、ルーティングと負荷分散の難易度を高めます。月之暗面の安定潜在MoEフレームワークは、このような疎な構成下でのトレーニングの安定性を維持することを目的としています。
混合エキスパートモデルは、一部のエキスパートに過剰な負荷がかからないように、トークンをエキスパート間で適切に分散する必要があります。
K3 は 分位数均衡 技術を採用しており、手動で調整されたバランス戦略に依存するのではなく、ルータースコアの分位数に基づいてエキスパートを割り当てます。月之暗面は、これにより敏感な負荷分散ハイパーパラメータが不要になり、大規模なエキスパート割り当てがより安定すると述べています。
K3 は Muon オプティマイザを拡張し、ヘッド単位の Muon 最適化 を実現しています。
このアプローチは、アテンションパラメータを独立した構造に分解し、各アテンションヘッドを個別に最適化します。目標は、大規模トレーニングにおいて、各アテンションヘッドにより適応的な最適化動作を提供することです。
2つの追加コンポーネントが活性化とアテンション制御をサポートします。
KDA、AttnRes、安定潜在MoE、分位数均衡、ヘッド単位Muonを組み合わせることで、月之暗面はこれらの改善により、Kimi K2 と比較して全体的なスケーリング効率が約 2.5倍 向上したと述べています。
Kimi K3 は、教師ありファインチューニングの段階から量子化対応トレーニングを採用しています。
公式テクニカルブログには以下が記載されています。
目標は、この規模のモデルのトレーニングとデプロイ可能性を維持しつつ、さまざまなアクセラレータハードウェア間の互換性を向上させることです。
月之暗面は同時に、効率的な推論のために 64個以上のアクセラレータ を使用するスーパーノードデプロイメントを推奨しています。これは、オープンウェイトが容易なローカルデプロイを意味するわけではないことを明確に示しています。この2.8兆パラメータモデルは、依然として大規模なインフラストラクチャシステムです。
KDA は、従来のプレフィックスキャッシュに新たな課題をもたらします。
月之暗面は、対応するプリフィルキャッシュ実装を開発し、vLLM エコシステムに貢献したと述べています。その公式 API は、コード関連のワークロードにおいて90%以上のキャッシュヒット率を達成しています。
このキャッシュ層は、キャッシュありとキャッシュなしの入力間の価格の大きな差を説明しています。この実装はモデルと同時にオープンソース化され、開発者は Kimi と vLLM の公式発表を確認できます。
現在の可用性と統合ステータスのコードリポジトリです。
月之暗面は、Kimi K3 の3つの重要な制限事項を挙げています。
K3 のトレーニングパターンは、モデルの以前の思考履歴を保持します。
エージェントフレームワークが期待される完全な履歴を返さない場合、生成品質が不安定になる可能性があります。ユーザーがアクティブなセッションの途中で他のモデルから切り替えた場合、
K3でも同様の問題が発生する可能性があります。
月之暗面は、検証済みの互換ツール(Kimi Codeなど)の使用を推奨しており、セッション途中でのモデル切り替えを避けるよう注意を促しています。
K3は、長時間・高難度のタスクに対して大規模なトレーニングを受けています。
そのため、小さな問題や曖昧な指示に過剰に反応し、ユーザーが予期しない判断を下す可能性があります。
厳格な境界設定が必要なアプリケーションでは、システムプロンプトまたは AGENTS.md ファイル内で、それらの境界を明確に定義する必要があります。
月之暗面は、Claude Fable 5やGPT-5.6 Solと比較して、K3には依然として明らかなユーザー体験の差があると述べています。
この限定的な条件は貴重です。ベンチマークスコアや自律エンジニアリングのデモだけでは、応答の一貫性、レイテンシ、指示の解釈、ツールの信頼性、会話の流暢さなど、プロダクション体験のすべての側面を網羅することはできないからです。
Kimi K3は、以下のチャネルから利用可能です。
リリース時、K3はデフォルトで最大思考強度を使用します。月之暗面は、今後のアップデートで低い思考強度と高い思考強度のオプションを追加すると述べています。
同社は、完全なモデルウェイトを2026年7月27日までに公開すると発表しています。これらのウェイトとテクニカルレポートが公開されるまでは、一部のアーキテクチャ、ベンチマーク設定、MiniTriton実装、およびチップ設計フローは、月之暗面が公開した説明に依存しています。

Kimi K3は、月之暗面が報告したオープンモデルの規模を2.8兆パラメータにまで引き上げました。
Kimi K3は、月之暗面AIが開発した2.8兆パラメータのネイティブマルチモーダルモデルであり、長期にわたるコーディング、ナレッジワーク、ビジュアル推論、エージェントタスクに適しています。100万トークンのコンテキストウィンドウをサポートし、トークンごとに896個のエキスパートのうち16個を活性化します。
月之暗面はK3をオープンな3T級モデルと呼び、完全なモデルウェイトを2026年7月27日までに公開すると発表しています。本稿執筆時点では、K3の完全なウェイト公開とテクニカルレポートは完了していません。
国際的なKimi APIの価格は次のとおりです:キャッシュされた入力トークン100万あたり0.30ドル、キャッシュされていない入力トークン100万あたり3.00ドル、出力トークン100万あたり15.00ドル。価格は変動する可能性があります。
そのため、プロダクションユーザーは公式APIプラットフォームで現在の料金を確認する必要があります。
Kimi K3はリリース時にArena WebDevランキングで暫定的に1位になりました。より多くの投票とモデルが追加されるにつれてランキングは動的に変化するため、最新のランキングはリアルタイムのArenaページを参照してください。
MiniTritonは、月之暗面によればKimi K3がゼロから構築したコンパクトなGPUコンパイラです。これには、MLIRベースのタイルレベルの中間表現、最適化パス、PTXコード生成パイプラインが含まれており、エンドツーエンドのnanoGPTトレーニングをサポートします。
物理的なテープアウトに関する公式情報は公開されていません。月之暗面は、Nangate 45nmライブラリを使用してチップ設計、最適化、検証、シミュレーションを完了する48時間の自律型電子設計自動化(EDA)実行について説明しています。
このモデルは非常に大規模であり、月之暗面は、推論のためのデプロイメント構成には効率的な実行のために少なくとも64個のアクセラレータが必要であると推奨しています。ウェイトが公開された後でも、ローカル実行には大規模な専用インフラストラクチャか、大幅に改造されたデプロイメントソリューションが必要です。
月之暗面は、保持思考履歴に対する感度、曖昧なタスクにおける過度の積極性、そしてClaude Fable 5やGPT-5.6 Solと比較したユーザー体験の差を指摘しています。明示的なエージェント制約と互換性のある適応フレームワークの使用が推奨されます。
kimi-k3や他のKimiモデルにアクセスするための公式APIサービスです。Kimi K3は、月之暗面がこれまでに公開した中で最大のモデルであり、総パラメータ数は2.8兆です。
8兆パラメータ、ネイティブなマルチモーダル入力をサポートし、100万トークンのコンテキストウィンドウを備え、896のエキスパートの中から16個をスパースに活性化する。
最も顕著な初期成果は、長周期エンジニアリング領域で見られた。K3はフロントエンドコードアリーナの初期ランキングで1位となり、GPUカーネルを最適化し、MiniTritonコンパイラを構築し、オープンソースのEDAツールを用いて48時間のアナログチップ設計ワークフローを完了した。
このアーキテクチャは、Kimi Deltaアテンション機構、アテンション残差接続、安定した潜在MoE、分位数バランス、ヘッドごとのMuon最適化器、SiTU、ゲート付きMLAを融合している。月の暗面は、Kimi K2と比較して拡張効率が2.5倍向上したと報告する一方、エージェントとの互換性、積極性、全体的なユーザーエクスペリエンスにおいて重要な限界があることも認めている。
Kimi K3の最も重要な主張は、すべてのベンチマークで勝利したことではなく、異常に長期にわたり、視覚に依存し、ツールチェーンを活用するエンジニアリングタスクにおいて、高い生産性を維持できる点にある。
ひとことから始めて、数分で完全なサイトを手に入れましょう。