Kimi K3 の重みが公開:月の裏側AIの2.8Tパラメータ最先端モデルを探る

月の裏側AIは約束を果たし、これまでで最大かつ最も野心的なモデルであるKimi K3の完全な重みを公開しました。このモデルは、詳細な技術レポートと関連インフラプロジェクトとともに、月の裏側AIの公式Hugging FaceとGitHubページで公開されています。Kimi K3は、2.8兆の総パラメータ、トークンあたり約1040億のアクティブパラメータ、100万トークンのコンテキストウィンドウを持つ、ネイティブマルチモーダル混合専門家モデルです。月の裏

发布于 2026年7月30日generalGEO 评分: 07 次阅读
この画像は、月の裏側AIがKimi K3大規模モデルを公開するためのプロモーションビジュアルです。濃い黒の背景に紫と青のテクノロジースタイルデザインが施されています。中央には白色のテキスト「Kimi K3 Is Now Open-Weight」が強調表示され、その上に半透明の「Kimi」ロゴ、下にブランド名「moonshot AI」があります。右側には、幾何学的なノード接続パターンを持つ光る紫色のテクノロジースタイルの南京錠アイコンがあり、光輪のあるプラットフォームに浮かび、周りを点状の光跡が取り囲んでいます。左側にはコードシンボル付きのモデルカードがあり、この2.8Tパラメータの最先端モデルのオープンウェイト特性を強調しています。

Kimi K3、ウェイトを公開:月の暗面AIが開発した2.8兆パラメータの最先端モデルを探る

はじめに

月の暗面AI(Moonshot AI)は約束を果たし、これまでで最大かつ最も野心的なモデルであるKimi K3の完全なウェイトを正式に公開しました。

本モデルは現在、月の暗面AIの公式Hugging FaceおよびGitHubページからダウンロード可能であり、詳細な技術レポートと関連インフラストラクチャプロジェクトも併せて公開されています。

Kimi K3は、ネイティブなマルチモーダル混合エキスパートモデルであり、総パラメータ数2.8兆、各トークンあたり約1040億パラメータを活性化し、100万トークンのコンテキストウィンドウを備えています。

月の暗面は、本モデルをオープンウェイトの最先端モデルと位置づけており、長期にわたるプログラミング、研究、マルチモーダル理解、エージェント型知識業務、そして数百から数千ステップに及ぶ可能性のある推論タスク向けに設計されています。

今回の公開が重要な理由は2つあります。

第一に、モデル自体がオープンウェイトの規模を3兆パラメータの領域に押し上げたことです。

第二に、月の暗面が公開した内容はモデルのチェックポイントにとどまりません。公開資料には、アーキテクチャ、後訓練戦略、長文脈強化学習インフラストラクチャ、エキスパート並列訓練システム、推論最適化、ベンチマーク結果、そして複数の長期実行エンジニアリングケーススタディが詳細に記述されています。

この画像は、Moonshot AIがKimi K3オープンソースモデルを公開したGitHubプロジェクトページを示しています。プロジェクトのブランチはmain、ブランチ数は1、タグ数は0、最新のコミットは7分前の初期コミットです。ページ内には、assetsフォルダ、LICENSEファイル、README.mdファイル、そしてk3_tech_report.pdfという技術レポートファイルが含まれており、これらはドキュメントで言及されているKimi K3と共に公開された付帯資料です。ユーザーはページの「Code」ボタンからプロジェクトコードの関連内容を確認できます。

Kimi K3 完全ウェイトが利用可能に

月の暗面は以前、Kimi K3を発表し、2026年7月27日までに完全なウェイトを公開することを約束していました。

本公開は完了しました。

公式モデルは以下のチャネルから入手できます。

GitHubリポジトリには、READMEファイル、Kimi K3ライセンス、完全な技術レポート、アーキテクチャとベンチマークのリソース、デプロイガイド、モデル使用手順が含まれています。

Hugging Faceのモデルカードでは、モデル設定と公開ウェイトへのアクセス方法が提供されています。

これにより、本モデルは、公開リリースが計画されていたマネージド型の最先端システムから、研究者や適切な資格を有するインフラストラクチャチームがKimi K3ライセンスの条項に従って実際にダウンロード、検査、デプロイ、ファインチューニング、適応できるモデルへと変貌しました。

画像はKimi K3に関する情報を示しています。Kimi K3は本日、Kimi.com、Kimi Work、Kimi Code、Kimi APIで利用可能になります。起動時には、Kimi K3はデフォルトで最大思考努力を使用し、今後のアップデートで低・高努力モードが導入されます。現在、推論パートナーやオープンソースメンテナーと緊密に協力し、技術的な詳細の一貫性を確保し、エコシステムでの信頼性の高いデプロイを実現しています。全モデルウェイトは2026年7月27日に公開され、アーキテクチャ、訓練、評価の詳細はKimi K3技術レポートと共に公開されます。

Kimi K3が「オープン」であることの意味

Kimi K3は、公開されたコードとドキュメントを備えたオープンウェイトモデルと表現するのが最も適切です。

本ライセンスは広範な権利を付与し、ライセンス条項に従って、使用、複製、修正、ファインチューニング、デプロイ、派生物の作成、再配布、サブライセンス、およびコピーの販売を許可します。

ただし、

本ライセンスには追加の商業要件が含まれています。

例えば、Qualified Model-as-a-Service(MaaS)ビジネスを運営し、連続する12ヶ月間の総収益が2000万米ドルを超える企業は、Kimi K3またはその派生物を商業目的で使用する前に、Moonshot AIと別途契約を締結する必要があります。

本ライセンスはまた、特定のユーザー数または収益の閾値を超える非常に大規模な商業製品またはサービスに対して、表示要件を課しています。

内部使用、およびMoonshot AIの公式製品または認証された推論パートナーを通じた使用は、別途扱われます。

したがって、Kimi K3を商業目的で使用する予定のある方は、Apache 2.0、MIT、またはその他の標準的な寛容なライセンスと同じであると想定せず、実際のライセンスを注意深く読む必要があります。

104Bの活性化パラメータを持つ2.8兆パラメータモデル

Kimi K3の総容量は非常に大きいですが、その混合エキスパート(MoE)設計により、すべてのトークンで2.8兆パラメータのすべてが活性化されるわけではありません。

公式モデルカードには以下の情報が記載されています:

仕様 Kimi K3
アーキテクチャ 混合エキスパート(MoE)
総パラメータ数 2.8T
活性化パラメータ数 104B
層数 93
密層数 1
ルーティングエキスパート数 896
トークンあたりの選択エキスパート数 16
共有エキスパート数 2
語彙サイズ 160K
コンテキスト長 1,048,576 トークン
視覚エンコーダ MoonViT-V2
視覚エンコーダパラメータ数 401M
量子化方式 MXFP4 ウェイト / MXFP8 アクティベーション
モダリティ テキストと画像

技術レポートでは、Kimi K2とのより正確なアーキテクチャ比較が示されています。

画像はKimi K2とKimi K3のアーキテクチャ比較表であり、両者の層数、総パラメータ、活性化パラメータ、隠れ次元、エキスパート次元などの違いを示しています。Kimi K3は層数、総パラメータ、活性化パラメータ、エキスパート次元などで向上しており、例えば層数は52%増加、総パラメータは167%増加、活性化パラメータは220%増加しています。また、Kimi K3は新しい注意機構と残差機構を導入しており、訓練コンテキスト長、注意機構、活性化関数などに変更があります。この表はコンテキストと密接に関連しており、Kimi K3のKimi K2に対するアーキテクチャの改善を視覚的に示しています。

Kimi K2と比較して、K3はモデルの深さとエキスパートのスパース性を増加させると同時に、新しい注意機構と残差機構を導入しています。

Moonshotは、Kimi K2をベースに、アーキテクチャと訓練方法の総合的な改善により、全体のスケーリング効率が約2.5倍向上したと述べています。

この主張は、追加の計算能力がモデルの能力に変換される効率に関するものであり、一般的な意味での2.5倍の推論速度向上を指すものではありません。

ネイティブマルチモーダルと百万トークンのコンテキストウィンドウ

Kimi K3は、訓練の最後に視覚モジュールを追加した言語モデルではなく、ネイティブなマルチモーダルモデルとして設計されています。

その視覚エンコーダMoonViT-V2は、約4.01億のパラメータを持っています。

技術レポートによると、MoonViT-V2は、SigLIPのような対比学習済みの視覚モデルから初期化されるのではなく、モデルの次のトークン予測目標を使用してゼロから訓練されました。

Moonshotは、この手法が訓練プロセス中に安定しており、競争力のある視覚性能を達成したと報告しています。

AIの事前学習アブレーション実験において、異なるモデルの視覚タワー勾配ノルムが訓練ステップ数に伴って変化する様子を示す。図(a)は全訓練軌跡、図(b)は14k〜16kステップの拡大図である。青線はSigLIPから初期化されたMoonViT-3Dを、赤線はゼロから訓練されたMoonViT-V2を表す。SigLIP初期化モデルと比較して、ゼロから訓練されたMoonViT-V2は勾配ノルムが低く、変動も少なく、より安定した最適化を示している。この図は文脈と密接に関連し、MoonViT-V2の訓練過程における安定性を視覚的に示している。](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/63b386e9-0be5-4813-a254-4665269d9469-a3cea91a-babc-4ab7-9d22-af510c0efa46.jpeg)

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/b6691c45-6229-4970-8a27-4e5a6deb00e1-dc511091-a635-4fc2-a80b-ab2e008b1415.png)

このモデルがサポートするコンテキスト長は以下の通りである:

1,048,576 トークン

この規模はエージェントシステムにとって特に重要である。というのも、長時間実行されるコーディングや研究タスクでは、リポジトリの内容、ツールの出力、ログ、スクリーンショット、研究資料、中間計画、テストの失敗記録、以前の推論結果、複数回の修正情報などが蓄積される可能性があるからである。

百万トークンレベルのコンテキストはコンテキスト管理の必要性をなくすわけではないが、K3は従来の短いコンテキストシステムよりもはるかに大きな作業履歴を保持することを可能にする。

3つの主要なアーキテクチャ変更

技術報告書では、K3の規模と安定性はいくつかのアーキテクチャ変更によるものとされている。

その中でも特に顕著な3つは以下の通りである:

  1. ハイブリッドKDA + ゲート付きMLAアテンション機構。
  2. アテンション残差。
  3. 安定化された潜在混合エキスパートモデル。

画像はKimi K3アーキテクチャを示しており、3つの部分に分かれている。左側はStable Normalized LatentMoEとKDAモジュールで、Shared Expert、Routed Expert、Router、Linear、Normなどのコンポーネントを含む。右上はAttnRes操作で、Output、Stable LatentMoE、Gated MLA、Stable LatentMoE、KDAなどがある。右側はBlock Attention Residualsのバックボーンで、Block n-1、Block n-2、Block n-3などがある。この図は文脈と密接に関連し、Kimi K3アーキテクチャにおける3つの主要な変更点のモジュール構造を視覚的に示している。

1. ハイブリッドアテンション機構:KDA + ゲート付きMLA

Kimi K3はハイブリッドアテンション設計を採用している。

公式モデルカードには以下のように記載されている:

69層のKDA + 24層のゲート付きMLA

このアーキテクチャは、複数のKimi Deltaアテンション層と周期的なゲート付きマルチヘッド潜在アテンション層を組み合わせた繰り返しパターンに従っている。

Kimi Deltaアテンション

KDAは線形アテンション機構であり、非常に長いコンテキストに伴うメモリと計算の負担を軽減するように設計されている。

KDAは、標準的なフルアテンションのように各トークンに応じて拡大する従来のKVキャッシュを使用する代わりに、循環状態を維持する。

これにより、百万トークンシーケンスに対して魅力的なものとなっている。

Moonshotは以前、Kimi線形研究シリーズを通じてKDAを導入しており、同チームは評価条件下で、KDAがフルアテンションと比較してKVキャッシュ要件を削減し、長いコンテキストのデコードスループットを向上させることを報告している。

ゲート付きMLA

K3はグローバルアテンションを完全に置き換えてはいない。

周期的なゲート付きMLA層は、モデルがコンテキスト内で情報をグローバルに検索する能力を保持している。

したがって、このハイブリッド設計は2つの目標のバランスを取ろうとしている:

  • 効率的な長いシーケンス処理。
  • 強力なグローバル検索。

その考え方は、線形アテンションが常にグローバルアテンションよりも優れているというものではなく、それぞれのメカニズムが長いコンテキスト問題の異なる部分を処理するというものである。

2. アテンション残差

深層ニューラルネットワークは、複数の層を通じて情報を伝達する一方で、有用な表現が徐々に失われるのを防ぐ必要がある。

Kimi K3はアテンション残差(AttnRes)を導入し、情報が深さ方向に伝達される方法を変更している。

このメカニズムは、統一された順次残差フローに依存するのではなく、後続のモジュールが以前のモジュールによって生成された表現を選択的に取得することを可能にする。

概念的に言えば、これはネットワークに学習メカニズムを提供し、どの初期情報を直接アクセス可能に保つべきかをネットワークが決定できるようにする。

目標は、93層モデルにおいて、すべての特徴量を厳密に同一の残差パスに通す必要なく、情報の流れを改善することである。

3. 安定化されたLatentMoE

Kimi K3はMoEのスパース性を大幅に向上させている。

このモデルには以下が含まれている:

896 のルーティングエキスパート

しかし、各トークンは以下のみを活性化する:

16 のルーティングエキスパート

さらに、モデルには2つの共有エキスパートも含まれている。

これにより、モデルの総パラメータ数は非常に大きくなるが、アクティブな計算量は総パラメータ数よりもはるかに少ない。

このスパース性の下では、訓練の安定性とエキスパートのバランスが厄介な問題となる。

Moonshotの安定化されたLatentMoE設計には、これらの問題を解決することを目的としたいくつかのメカニズムが含まれている。

SiTU-GLU

Kimi K3はSwiGLUをSiTU-GLUに置き換えている。これは、極端な拡張下での無制限な成長を回避することを目的とした活性化関数である。

画像はGLU、SwiGLU、SiTU-GLUのゲートブランチとアップブランチの構造、およびそれらのスカラーレスポンス曲線を示している。すべてのブランチはスカラー入力xを受け取り、曲線はx ∈ [−10, 100]の定義域を共有し、右下隅は原点付近の領域を拡大表示している。SiTU-GLUはβ1 = 4、β2 = 25の場合、原点付近でSwiGLUに近い曲線を示し、xが大きな正の数の場合、SiTU-GLUの|f(x)| ≤ β1β2 = 100となるのに対し、SwiGLUは依然として無制限である。この図は、Kimi K3においてSiTU-GLUがSwiGLUを置き換え、極端なスケーリング下での無制限な成長を回避するという文脈に関連している。

分位数バランシング

このシステムはまた、従来の補助バランシング損失関数に完全に依存するのではなく、動的なルーティングバイアスに基づく負荷分散方法を採用している。

その目標は、過度な訓練妨害を導入することなく、ルーティング後のトークンをエキスパート間でより均等に分散させることである。

百万トークンエージェント訓練

Kimi K3の技術報告書は、特に長時間実行エージェント向けのポスト訓練を強調している。

このモデルは3つの主要分野で訓練されている:

  • 汎用推論。
  • 汎用エージェントタスク。
  • プログラミングエージェント。

また、複数の推論精細度レベルをサポートしている:

  • 低。
  • 高。
  • 最高。

最終モデルは、マルチティーチャーオンラインポリシー蒸留(MOPD)を通じて複数の専門ポリシーを組み合わせている。

Moonshotは、各分野と精細度レベルごとに独立した恒久的なモデルを訓練する代わりに、専門のティーチャーモデルを訓練し、その行動を統一されたK3ポリシーに統合している。

AgentENV:長時間持続可能なサンドボックス訓練

技術報告書ではAgentENVについて説明されている。これは、永続的なエージェント展開のために構築されたインフラストラクチャ層である。

このシステムはFirecrackerベースの

マイクロ仮想マシン環境により、エージェントが再現可能なサンドボックス内で長い一連の操作を実行できるようになります。

訓練タスクには以下が含まれる可能性があります:

  1. ファイルを読み取る。
  2. コードを書く。
  3. コマンドを実行する。
  4. アプリケーションを開く。
  5. スクリーンショットを撮る。
  6. 模擬的な職場ツールを使用する。
  7. エラーをデバッグする。
  8. 長時間の遅延後に戻る。
  9. 以前の環境状態から実行を継続する。

これは短い質疑応答のやり取りに基づく強化学習とは異なります。

エージェントは数百回のツール呼び出しを実行し、模擬環境内で仮想の数日間にわたって状態を維持する可能性があります。

元の記事では、Slack、Notion、Gmailなどのアプリケーションを含む模擬環境について説明しています。

主な訓練上の課題は永続性です。環境とモデルの長いコンテキスト状態の両方を利用可能に保つ必要があります。

長い展開プロセスの中で。

知識グラフによるタスク合成

長周期訓練には、多数の困難なタスクも必要です。

Moonshotは、階層的な知識グラフを中心に構成されたタスク生成パイプラインを説明しています。

このグラフは、コンピュータサイエンス、人工知能、コーディング、数学、物理学、化学、生物医学、人文科学など、複数の分野をカバーしています。

関連する概念をまとめてサンプリングし、関連する公開資料を取得し、それらの資料から新しい評価タスクや訓練タスクを合成することができます。

このグラフの目的は、単なる答えの暗記ではなく、実際のツール使用と多段階の推論を必要とするタスクを作成することです。

3T級MoEモデルのインフラストラクチャ

100万トークンのコンテキストウィンドウを持つ2.8Tモデルは、モデルアーキテクチャだけで効率的な訓練とサービスを実現することはできません。

Moonshotのテクニカルレポートでは、KDAカーネル、コンテキスト並列、エキスパート並列、メモリ管理、長周期RLスケジューリング、プレフィックスキャッシュ、投機的デコード、サービスアクセス制御などに関するシステムレベルの取り組みについて説明しています。

これらの一部はすでに公開されています。

MoonEP:バランスの取れたエキスパート並列

MoonEPはMoonshotがオープンソース化したエキスパート並列通信ライブラリです。

MoE訓練では、ルーティングに深刻な不均衡が生じる可能性があります。

ルーターが特定のエキスパートを好むため、あるランクが別のランクよりもはるかに多くのトークンを受信する可能性があります。これが発生すると、最速のデバイスが最も遅いデバイスを待たなければなりません。

MoonEPは動的冗長エキスパートを使用してこの問題を解決します。

現在のルーティングパターンに基づいて一時的にエキスパートのコピーを作成し、各ランクのトークンワークロードを均等に保つことができます。

このプロジェクトは、通信オーバーヘッドを削減しながら、各ランクを期待されるルーティングトークン負荷量に正確に保つことを目標としています。

これはK3の規模では非常に重要であり、896のエキスパートを大規模クラスタに分散させることは、大きな同期問題を引き起こします。

FlashKDA:高性能KDAカーネル

FlashKDAは、CUTLASSベースの高性能Kimi Deltaアテンションカーネルを提供します。

この公開リポジトリの現在の要件は以下の通りです:

SM90 またはそれ以降
CUDA 12.9 またはそれ以降
PyTorch 2.4 またはそれ以降

リポジトリには、対応ハードウェア向けの正しさテストとベンチマークデータが含まれています。

FlashKDAは、K3の長いコンテキストアーキテクチャを実用的にするアテンション機構を高速化することを目的としています。

ネイティブMXFP4量子化

Kimi K3は、教師ありファインチューニング段階から量子化対応訓練を使用しています。

公式構成には以下がリストされています:

MXFP4 重み
MXFP8 アクティベーション

これは、最初に完全な高精度モデルを訓練し、訓練後に量子化する方法とは異なります。

このモデルは、パイプライン内でこれらの低精度フォーマットを直接使用して演算するように訓練されています。

これにより、メモリと通信のオーバーヘッドを削減するのに役立ちます。

ただし、これは2.8Tモデルを通常のデスクトップモデルに変えるものではありません。

Kimi K3をローカルで実行できますか?

重みは公開されていますが、「ダウンロード可能」であることは「ノートパソコンで簡単に実行できる」という意味ではありません。

Kimi K3の総パラメータ数は2.8兆です。

スパースアクティベーションと低ビットフォーマットを使用しても、完全なモデルを実行するには、大量の集約アクセラレータメモリ、高帯域幅のデバイス相互接続、エキスパート並列実行、互換性のある推論エンジン、およびKDA、MLA、MoEの効率的なサポートが必要です。

Moonshotの公式リポジトリが推奨するもの:

  • vLLM
  • SGLang
  • Moonshotのデプロイメントソリューションを介したTokenSpeed

エコシステムは急速に進化しています。サポートは、特定のソリューション、カーネル、量子化モード、ハードウェアに依存する可能性があります。

セルフホスト環境を構築する前に、最新のKimi K3デプロイメントドキュメントを確認し、標準的なTransformerサービス設定が正常に機能することを前提としないでください。

ほとんどの個人や小規模チームにとって、ホスト型APIの方が完全なモデルを実行するよりもはるかに簡単かもしれません。

Kimi K3 APIと推論努力度

Moonshotは、公式APIプラットフォームを通じてKimi K3も提供しています:

https://platform.kimi.ai/

モデル識別子は次のとおりです:

kimi-k3

Kimi K3は推論機能を使用し、reasoning_contentフィールドを返します。

公式モデルカードでは、3つの推論努力度が説明されています:

low
high
max

重要な実装の詳細は、保持される思考履歴です。

マルチターンのエージェントワークフローの場合、Moonshotは開発者が以前のアシスタントメッセージ全体(reasoning_contentcontenttool_callsを含む)を次のリクエストに渡し直す必要があると述べています。

これらの状態の一部を破棄すると、K3の訓練方法が推論履歴の保持を要求するため、連続性が損なわれる可能性があります。

ベンチマーク性能

Moonshotのテクニカルレポートでは、推論と知識、コーディング、エージェントワークフロー、ビジョンの各分野でKimi K3を評価しています。

同社独自の評価スイートでは、K3は利用可能な最強モデルの1つにランク付けされており、特定のタスクでは多くのオープンウェイトモデルやプロプライエタリシステムをリードしています。

同時に、レポートでは、このモデルは全体的には依然として最強のプロプライエタリシステム、特にClaude Fable 5やGPT-5.6 Solに劣っていると明確に述べられています。

この限定条件は重要です。

K3がすべてのベンチマークで勝利したという主張ではありません。

より妥当な結論は、Kimi K3がオープンウェイトを、最近まで主に最先端のプロプライエタリシステムに関連していた性能領域に押し上げたということです。

画像は表で、Kimi K3とClaude Fable 5、GPT-5.6 Sol、GLM-5.2などのモデルを、推論と知識、コーディング、エージェントワークフロー、ビジョンなどの複数の性能で比較しています。表では、最良の結果は太字、2番目に良い結果は下線で示されています。例えば、推論と知識の分野では、Kimi K3はGQA OpenWorld、Critiq、ACLRCなどのタスクで優れた結果を示し、一部のタスクではClaude Fable 5などのモデルを上回っています。この表は文脈に密接に関連しており、Kimi K3の異なるタスクにおける性能を視覚的に示しています。

複数のベンチマーク比較は、Kimi Code、Claude Code、Codex、公式ベンチマークツールなど、さまざまなエージェントツールにも依存しています。

したがって、エージェントベンチマークスコアは、純粋なモデル能力の尺度として解釈されるべきではありません。

測定結果。周囲のツール、プロンプト、コンテキスト管理、フォールバックメカニズム、評価者はすべて、結果に実質的な影響を与えます。

長周期コーディングのケーススタディ

レポートでは、K3が短いコード補完タスクをはるかに超える複雑なエンジニアリング作業に適していることを示すことを目的としたいくつかのケースを提供しています。

これらのケースはモデル開発者によって提供されたものであり、普遍的な性能保証ではなく、事例紹介として見るべきです。

MiniTriton:GPUプログラミングシステムの構築

Moonshotは、Kimi K3がMiniTriton、コンパクトなTriton風GPUプログラミングシステムを開発したと報告しています。

このプロジェクトには、中間表現、コンパイラフロー、PTX生成、フロントエンド言語、ランタイムコンポーネント、GPUカーネル最適化、そして分散学習プリミティブが含まれています。

画像は、MiniTritonコンパイラを用いたNVIDIA L20 GPU上でのKimi K3によるGPUコンピューティング事例を示しています。CUDAコアとテンソルコアの性能スレッドグラフ、並びにMiniTritonとtorch eager、MiniTriton分散プリミティブ(NCCL)と単一GPU学習の収束曲線グラフを含みます。CUDAコアスレッドグラフでは、train、gpt、torch eagerなど異なるコンパイラの性能を比較。テンソルコアスレッドグラフでは、train、gptなどのコンパイラ性能を比較。収束曲線グラフでは、MiniTritonとtorch eager、MiniTriton分散プリミティブと単一GPU学習の訓練損失の変化をそれぞれ示しています。

Moonshotによれば、K3は自身のアーキテクチャに関連する複雑なカーネルも最適化し、選択したカーネルで顕著な高速化を実現しました。

これは、このモデルの期待される動作を示しています。すなわち、複雑なコードベースの調査、パフォーマンス分析、低レベルコードの記述、結果のベンチマーク、そして反復的な改良です。

しかし、これは、各モデルが生成するコンパイラやカーネルが、人間によるレビューやテストなしで完全に信頼できることを意味するものではありません。

48時間のチップ設計実験

別のケーススタディでは、Kimi K3はサンドボックス環境で48時間実行され、上記のアーキテクチャと類似点を持つ設計思想に基づいた、小型モデル向け推論チップのプロトタイプを作成するよう指示されました。

このモデルは、オープンソースの電子設計自動化ツールとNangate 45ナノメートル標準セルライブラリを使用しました。

Moonshotの報告によると、最終的な設計シミュレーションは、4平方ミリメートルの分析面積予算内で完了し、100MHzのクロック周波数でタイミング収束を達成、約146万個の標準セルと0.277 MiBのSRAMを使用し、RTLシミュレーションで毎秒8,700トークン以上のデコードスループットを達成しました。

画像は、Kimi K3が設計した推論チッププロトタイプの関連紹介です。初期コンセプト実証として、Kimi K3は同一アーキテクチャ設計(混合KDAおよびNoPE-MLAアテンション機構、Block AttnRes、シグモイドベースのMoEルーティング等を含む)に従っています。4mm²の分析面積予算内で、設計は100MHzクロックでタイミング収束し、約146万標準セル、0.277MiBのSRAM、融合逆量子化付きINT4 MACアレイを搭載、RTLシミュレーションによるデコードスループットは8,700 tokens/s超です。この設計は48時間の自律実行中にKimi Codeを使用して構築、最適化、検証され、コードはGitHubで入手可能です。

これはシミュレーションベースの概念実証であり、量産チップではありません。

研究コーディングと天体物理学

K3は、計算天体物理学の再現タスクでも評価されました。

Moonshotによると、このモデルは20以上の論文を読み、相互検証し、完全な数値計算パイプラインを実装し、300以上の状態方程式を評価し、公表された式の矛盾を特定し、3,000行を超えるPythonコードを記述し、インタラクティブなHTMLダッシュボードを生成しました。

画像は、Kimi K3の研究コーディングにおける成果を示しています。計算天体物理学におけるI-Love-Q普遍関係を再現するため、Kimi K3は20以上の論文を精査し、結果を相互検証、完全な数値パイプラインを実装、300以上の状態方程式を評価、公表された式の矛盾を発見し、3000行を超えるPythonコードを作成し、約2時間でインタラクティブなHTMLダッシュボードを生成しました。経験豊富な研究者は通常1〜2週間を要します。この画像は文脈と密接に関連し、Kimi K3の研究コーディングタスクにおける具体的な成果を視覚的に示しています。

報告によれば、この自律的な作業には約2時間を要しましたが、経験豊富な研究者は通常1〜2週間かかります。

研究作業においては、独立した検証が依然として極めて重要です。モデルは完全なパイプラインを生成できますが、仮定、単位、数値手法、引用、解釈において微細な誤りが含まれる可能性があります。

サイバーセキュリティ評価

技術報告書では、サイバーセキュリティに関する評価も議論されています。

月之暗面は、Kimi K3が制御されたセキュリティテストにおいて、これまで知られていなかったLinuxカーネルの脆弱性を発見し、関連する発見は人間の専門家によってレビューされたと述べています。

その意義は、K3を教師なしの攻撃的なセキュリティ運用に使用すべきだということではありません。

むしろ、長周期コーディングモデルが、大規模なコードベースを読み取り、低レベルの動作を追跡し、仮説を形成し、仮説を検証し、方法を修正し、試行が失敗した後も継続する能力をますます備えていることを示しています。

これらの能力は防御的な監査やセキュリティコードレビューを支援しますが、同時に、承認、サンドボックス分離、アクセス制御、および人間による監視の重要性を高めます。

コストと効率

モデルの価値はベンチマークスコアだけで決まるわけではありません。

長周期エージェントシステムは、単一のタスクで数百万ものトークンを生成する可能性があります。

したがって、コストは入力長、出力長、推論の複雑さ、キャッシュヒット率、ツール呼び出し回数、リトライ回数、コンテキスト管理、および推論プロバイダーに依存します。

月之暗面の技術報告書には、複数のエージェントベンチマークのスコアとコストの比較が含まれています。

これらのグラフは、K3が一部のテストワークロードにおいて相対的にコスト効率が良いことを示しています。

これは、K3があらゆる状況で全ての代替手段よりも安いという普遍的な結論として解釈されるべきではありません。

本番環境の計画では、100万トークンあたりの価格だけでなく、タスクを正常に完了するための総コストを測定する必要があります。

オープンウェイト公開の意義

Kimi K3の公開は、単一モデルのランキングを超えた意義を持ちます。

これは、API限定のシステムでは研究が困難であった、複数の研究およびエンジニアリング分野を切り開きます。

研究者は、モデルの重み、MoEの動作、KDAベースのアテンション機構、長コンテキスト機構、ビジョンコンポーネント、量子化の動作、サービングシステム、エージェントの事後学習戦略を検査または変更できます。

インフラストラクチャチームは、異なるサービング方式をテストできます。

企業は、ハードウェアの経済性が合理的である場合、プライベートデプロイメントを評価できます。

コミュニティは以下を構築できます:

  • 新しい推論方式
  • 量子化バリアント
  • ファインチューニング派生モデル
  • ドメイン固有システム
  • 評価フレームワーク
  • モデルルーティングツール
  • ハードウェア固有の最適化

これらが、初期の重要なオープンモデル公開に匹敵するエコシステムを構築できるかどうかは、推論コスト、入手可能なハードウェア、ライセンス条項、コミュニティツールチェーン、および派生する小型モデルの品質に依存します。

Kimi K3 デプロイ前の実用的チェックリスト

1. ライセンス契約を読む

あなたのユースケースが以下に該当するか確認してください:内部研究、企業利用、ファインチューニング、組み込みアプリケーション、公開推論、またはモデル・アズ・ア・サービス。

2. ハードウェアサポートを確認する

アクセラレータアーキテクチャ、HBM容量、インターコネクト方式、CUDAバージョン、カーネル要件、量子化サポート、デバイス数、エキスパート並列トポロジを確認してください。

3. サポートされている推論エンジンを選択する

現在、vLLM、SGLang、またはその他公式にサポートされているサービスパス向けのK3専用ソリューションを使用してください。

4. 完全な100万コンテキストを個別にテストする

プリフィルレイテンシ、デコードレイテンシ、プレフィックスキャッシュの動作、メモリ使用量、同時実行能力、スループット、障害回復を測定してください。

5. 推論履歴を保持する

エージェント型マルチターンワークフローの場合、Moonshotのガイドラインに従い、推論およびツール呼び出しの状態を含む完全なアシスタントメッセージを返してください。

6. 実際のタスクを検証する

自社のリポジトリ、研究ワークフロー、ドキュメント、ビジョンタスク、ツール使用、およびエージェントシナリオでベンチマークを行ってください。

7. タスク完了あたりのコストを測定する

トークン価格だけに注目すると誤解を招く可能性があります。リトライ回数、ツール呼び出し、出力長、および人的介入コストを計算する必要があります。

よくある質問

Kimi K3 はオープンソースですか?

Kimi K3の完全な重み、コードベース、ドキュメント、技術報告書は公開されており、MoonShotはこれをオープンウェイトのモデルと説明しています。このモデルは、Apache 2.0ではなく、カスタムのKimi K3ライセンスを使用しています。

等の標準プロトコルについては、商用利用者は具体的な条項を慎重に確認する必要があります。

Kimi K3はどこからダウンロードできますか?

公式ウェイトは、Hugging Face上のMoonshot AIから入手可能です。メインのソースコードリポジトリとテクニカルレポートはGitHubで参照できます。

Kimi K3のパラメータ数は?

Kimi K3の総パラメータ数は約2.8兆です。スパース混合エキスパートモデルアーキテクチャを採用しており、各トークンにつき約1040億のパラメータが活性化されます。

Kimi K3のコンテキストウィンドウは?

公式モデルは最大1,048,576トークンのコンテキストをサポートします。長いコンテキストのデプロイには、特に同時実行シナリオにおいて、多くのメモリと推論インフラが必要です。

Kimi K3はコンシューマー向けGPUで動作しますか?

完全な2.8Tモデルは、通常のコンシューマー向けGPUでは事実上動作しません。スパース活性化や低ビット量子化を用いても、完全なウェイトとサービススタックには大規模なマルチアクセラレーターインフラが必要です。

どの推論エンジンがKimi K3をサポートしていますか?

Moonshot公式リポジトリでは、K3専用のデプロイガイドを通じてvLLM、SGLang、TokenSpeedの使用が推奨されています。このモデルはKDA、MLA、MoE、およびMXFP4関連の最適化を採用しているため、デプロイ前に現在サポートされているバージョンを確認する必要があります。

MoonEPとFlashKDAとは何ですか?

MoonEPは、Moonshotがオープンソース化したエキスパート並列通信ライブラリで、GPU間でMoEトークンの負荷をバランスさせます。FlashKDAは、CUTLASSをベースに構築された高性能なKimi Deltaアテンションカーネルです。

Kimi K3はGPT-5.6 SolやClaude Fable 5より優れていますか?

すべての面で優れているわけではありません。Moonshotのテクニカルレポートによると、Kimi K3はフロンティアレベルの性能を達成し、特定のタスクでリードしていますが、全体としては最強のプロプライエタリシステムに劣ります。ベンチマーク結果は、エージェントフレームワーク、ツール、推論設定、評価手法にも依存します。

関連ツール

  • Hugging Face上のKimi K3:公式モデルカードと完全なKimi K3ウェイト。
  • GitHub上のKimi K3:README、ライセンス、アセット、テクニカルレポートを含む公式リポジトリ。
  • MoonEP:Moonshotのエキスパート並列通信ライブラリ。MoEワークロードを動的にバランスします。
  • FlashKDA:CUTLASSをベースに構築された高性能Kimi Deltaアテンションカーネル。
  • vLLM:Kimi K3デプロイガイドで推奨されるオープンソースの推論・サービスエンジン。
  • SGLang:MoonshotがK3デプロイ用に挙げているオープンソースのLLM・マルチモーダルサービスフレームワーク。
  • Kimi API:Moonshot AIがホストするAPIプラットフォーム。kimi-k3モデルにアクセス可能。

関連リンク

まとめ

Moonshot AIは、完全なKimi K3ウェイトを公開し、2.8Tパラメータのフロンティアモデルを、研究者やインフラチームがKimi K3ライセンスの下で検査、デプロイ、微調整、拡張できるシステムへと変えました。

このモデルは、104Bの活性化パラメータ、100万トークンのコンテキストウィンドウ、ネイティブマルチモーダル、ハイブリッドKDA/Gated-MLAアテンション機構、アテンション残差、安定潜在MoE、量子化認識トレーニング、そして長期視点エージェントのポストトレーニングを組み合わせています。

同様に重要なのは、このリリースがMoonEPやFlashKDAなどのプロジェクトを通じて、モデルの背後にあるシステムエンジニアリングの一部を明らかにしたことです。K3は依然として高い自己ホスト要件を必要とするモデルであり、その最良の結果は、フレームワーク選択と開発者が実行する評価の文脈で解釈されるべきです。

真のマイルストーンは、単に2.8T規模のモデルが存在することではなく、その規模のモデルが、より広いコミュニティによって検査、実行、そして構築可能になったことです。